Рубріки: Новини

DeepSeek випускає нову безкоштовну модель V3-0324. Вона краща в програмуванні, ніж GPT-4o

Дмитро Сімагін

25.03.2025 12:50

Китайська компанія DeepSeek випустила нову велику мовну модель, яка не тільки безкоштовна, але й перевершує Claude Sonnet 3.5. Модель DeepSeek-V3-0324 важить 641 гігабайт, має 685 мільярдів параметрів і доступна для комерційного використання за ліцензією MIT. Ще однією перевагою є те, що вона може працювати безпосередньо на апаратному забезпеченні споживчого класу, зокрема Mac Studio від Apple з чіпом M3 Ultra, пише Venture Beat.

Хоча Mac Studio за $9499 може розтягнути визначення «споживчого апаратного забезпечення», можливість запускати таку масивну модель локально, без використання дата-центрів, є серйозним ударом по маркетинговій стратегії OpenAI.

«Випробував нову DeepSeek V3 на своєму внутрішньому стенді, і вона показала величезний стрибок у всіх показниках у всіх тестах. Тепер це найкраща модель без міркування, яка скидає Sonnet 3.5», — пише дослідник штучного інтелекту Xeophon.

На відміну від Sonnet, для використання якої потрібна платна підписка, модель DeepSeek-V3-0324 доступна для завантаження та використання будь-кому.

DeepSeek-V3-0324 використовує архітектуру суміші експертів (MoE), яка принципово переосмислює роботу великих мовних моделей. Традиційні моделі активують усю кількість параметрів для кожного завдання, але підхід DeepSeek активує лише близько 37 мільярдів із 685 мільярдів параметрів під час конкретних завдань.

Ця вибіркова активація являє собою зміну парадигми ефективності моделі. Активуючи лише найбільш релевантні «експертні» параметри для кожного конкретного завдання, DeepSeek досягає продуктивності, порівнянної з набагато більшими повністю активованими моделями, при цьому різко знижуючи обчислювальні вимоги.

Розробник Саймон Віллісон зазначив, що випуск V3-0324 є потенційно значним зсувом у розгортанні ШІ. У той час як традиційна інфраструктура штучного інтелекту зазвичай покладається на кілька графічних процесорів Nvidia, які споживають кілька кіловат енергії, Mac Studio споживає менше 200 Вт під час роботи. Цей розрив ефективності свідчить про те, що індустрії ШІ, можливо, доведеться переглянути припущення щодо вимог до інфраструктури для продуктивності моделі найвищого рівня.

Наступна стаття TypeScript на Go пришвидшує компіляцію, але не виконання коду »

попередня стаття « Три роки за розробку програми для викрадення паролів. Подробиці справи хакера із Запоріжжя

Дмитро Сімагін

Теги: DeepSeekLLM-модельштучний інтелект

25.03.2025 12:50

Останні статті

Новини

Zoom випустить фотореалістичних аватарів, які замінять людей на нарадах

Відеосервіс Zoom анонсує технологію цифрових двійників, які самостійно відвідуватимуть робочі зустрічі. Про це пише TechCrunch.…

10.03.2026

Новини

Meta купує Moltbook: соціальну мережу для агентів та ботів

IT-гігант Meta (материнська компанія Facebook) офіційно оголосив про придбання Moltbook — вірусної соціальної мережі, яка…

10.03.2026

Новини

Китайський агент штучного інтелекту почав таємно майнити криптовалюту

Експериментальний агент штучного інтелекту ROME, якого створили дослідники, пов'язані з китайською компанією Alibaba, продемонстрував неочікувану…

10.03.2026

Новини

Заробляли на DDoS-атаках: у Польщі викрито групу школярів-хакерів, наймолодшому 12 років

Центральне бюро боротьби з кіберзлочинністю Польщі (CBZC) провело масштабну операцію, результатом якої стало викриття групи…

10.03.2026

Новини

Microsoft випустила Copilot Cowork — мультимодальний інструмент для запуску агентів

Microsoft оголосила про початок інтеграції технологій Anthropic у свої сервіси, представивши новий інструмент Copilot Cowork,…

10.03.2026

Новини

Anthropic презентує новий інструмент перевірки пул-реквестів Code Review

Компанія Anthropic оголосила про доступність у Claude Code бета-версії нового інструменту Code Review. Він розробленій…

10.03.2026

DeepSeek випускає нову безкоштовну модель V3-0324. Вона краща в програмуванні, ніж GPT-4o

Схожі статті

Останні статті

Zoom випустить фотореалістичних аватарів, які замінять людей на нарадах

Meta купує Moltbook: соціальну мережу для агентів та ботів

Китайський агент штучного інтелекту почав таємно майнити криптовалюту

Заробляли на DDoS-атаках: у Польщі викрито групу школярів-хакерів, наймолодшому 12 років

Microsoft випустила Copilot Cowork — мультимодальний інструмент для запуску агентів

Anthropic презентує новий інструмент перевірки пул-реквестів Code Review