Рубріки: Новини

Китайська модель DeepSeek V3 з відкритим кодом перевершила усіх конкурентів

Дмитро Сімагін

27.12.2024 13:03

Китайський стартап DeepSeek створив одну з найпотужніших на сьогоднішній день «відкритих» моделей штучного інтелекту — DeepSeek V3. Вона має відкритий код і навчена на наборі даних з 14,8 трильйонів токенів. 1 мільйон токенів дорівнює приблизно 750 000 слів, повідомляє Venture Beat.

Оскільки модель випущена під відкритою ліцензією, це дозволяє розробникам завантажувати та модифікувати її для більшості програм, включаючи комерційні.

DeepSeek V3 може виконувати низку завдань, у тому числі роботу з кодом, переклад, написання есе та електронних листів.

Відповідно до внутрішнього порівняльного тесту, DeepSeek V3 перевершує як «відкриті», так і «закриті» моделі ШІ, доступ до яких можливий лише через API. У тестах з кодування, які проводяться на платформі Codeforces, DeepSeek V3 перевершила всі інші моделі, зокрема Llama 3.1 405B від Meta, GPT-4o від OpenAI та Qwen 2.5 72B від Alibaba.

DeepSeek V3 також перевершує конкурентів у тесті Aider Polyglot, який розроблено, щоб визначити, чи може модель успішно написати новий код, який інтегрується в існуючий код.

Відносним недоліком є те, що DeepSeek V3 має величезний розмір: 671 мільярд параметрів. Це приблизно в 1,6 рази більше, ніж розмір моделі Llama 3.1 405B, яка має 405 мільярдів параметрів. DeepSeek V3 знадобиться велика кількість потужних графічних процесорів, щоб відповідати на запитання з розумною швидкістю.

Хоча це не найпрактичніша модель, DeepSeek V3 є досягненням у певному відношенні. Її вдалося навчити за допомогою графічних процесорів Nvidia H800 всього за два місяці. Компанія також стверджує, що витратила лише $5,5 мільйона на навчання DeepSeek V3, що становить незначну частину вартості розробки таких моделей, як GPT-4 від OpenAI.

Наступна стаття В Україні створили перший словник термінології штучного інтелекту »

попередня стаття « Хакери з Північної Кореї розповсюджують на GitHub нову шкідливу програму OtterCookie

Дмитро Сімагін

Теги: DeepSeekLLM-модельштучний інтелект

27.12.2024 13:03

Останні статті

Новини

Zoom випустить фотореалістичних аватарів, які замінять людей на нарадах

Відеосервіс Zoom анонсує технологію цифрових двійників, які самостійно відвідуватимуть робочі зустрічі. Про це пише TechCrunch.…

10.03.2026

Новини

Meta купує Moltbook: соціальну мережу для агентів та ботів

IT-гігант Meta (материнська компанія Facebook) офіційно оголосив про придбання Moltbook — вірусної соціальної мережі, яка…

10.03.2026

Новини

Китайський агент штучного інтелекту почав таємно майнити криптовалюту

Експериментальний агент штучного інтелекту ROME, якого створили дослідники, пов'язані з китайською компанією Alibaba, продемонстрував неочікувану…

10.03.2026

Новини

Заробляли на DDoS-атаках: у Польщі викрито групу школярів-хакерів, наймолодшому 12 років

Центральне бюро боротьби з кіберзлочинністю Польщі (CBZC) провело масштабну операцію, результатом якої стало викриття групи…

10.03.2026

Новини

Microsoft випустила Copilot Cowork — мультимодальний інструмент для запуску агентів

Microsoft оголосила про початок інтеграції технологій Anthropic у свої сервіси, представивши новий інструмент Copilot Cowork,…

10.03.2026

Новини

Anthropic презентує новий інструмент перевірки пул-реквестів Code Review

Компанія Anthropic оголосила про доступність у Claude Code бета-версії нового інструменту Code Review. Він розробленій…

10.03.2026

Китайська модель DeepSeek V3 з відкритим кодом перевершила усіх конкурентів

Схожі статті

Останні статті

Zoom випустить фотореалістичних аватарів, які замінять людей на нарадах

Meta купує Moltbook: соціальну мережу для агентів та ботів

Китайський агент штучного інтелекту почав таємно майнити криптовалюту

Заробляли на DDoS-атаках: у Польщі викрито групу школярів-хакерів, наймолодшому 12 років

Microsoft випустила Copilot Cowork — мультимодальний інструмент для запуску агентів

Anthropic презентує новий інструмент перевірки пул-реквестів Code Review