Рубріки: Новини

GPT-5 виявилась «найпотужнішою для кодування», однак багато хто сподівався на краще

Дмитро Сімагін

08.08.2025 09:05

Компанія OpenAI випустила флагманську LLM-модель GPT-5, яка, за словами Сема Альтмана, є найкращою моделлю для кодування. У загальному рейтингу LMArena GPT-5 опинилась на першому місці, хоча із вимкненою опцією Remove Style Control новинка все ж поступається Gemini 2.5 Pro.

Починаючи з 8 серпня GPT-5 доступна всім безкоштовним користувачам ChatGPT як модель за замовчуванням.

У SWE-bench Verified — тесті реальних завдань кодування, взятих з GitHub — GPT-5 набрала 74,9% з першої спроби. Це означає, що нова модель OpenAI трохи перевершує Claude Opus 4.1 від Anthropic, яка набрала 74,5%, та Gemini 2.5 Pro з 59,6%.

На «Останньому іспиті людства» — складному тесті, що вимірює продуктивність моделей штучного інтелекту в математиці, гуманітарних та природничих науках — версія GPT-5 з розширеним мисленням (GPT-5 Pro) набрала 42% при використанні інструментів. Це трохи менше, ніж xAI змогла досягти з Grok 4 Heavy, яка в цьому тесті отримала 44,4%.

У GPQA Diamond — тесті з наукових питань рівня PhD (доктор наук) — GPT-5 Pro набрала 89,4% з першої спроби, перевершивши Claude Opus 4.1 з 80,9% та Grok 4 Heavy з 88,9%.

OpenAI стверджує, що GPT-5 краще підходить для відповідей на запитання, пов’язані зі здоров’ям. У тесті HealthBench Hard Hallucinations, що вимірює точність відповідей моделей ШІ на теми охорони здоров’я, GPT-5 (з опцією міркування) викликає галюцинації лише в 1,6% випадків. Це набагато нижче, ніж у попередніх моделей компанії GPT-4o та o3, які набрали 12,9% та 15,8% відповідно.

У відповідях на запити ChatGPT, нова модель викликає галюцинації чи неправильно відповідає лише в 4,8% випадків. Це значне покращення, оскільки o3 та GPT-4o мають показники галюцинацій 22% та 20,6% відповідно в тесті.

Передплатники тарифного плану Plus від ChatGPT вартістю $20 на місяць отримують вищі ліміти використання GPT-5, ніж безкоштовні користувачі. Тоді як передплатники Pro вартістю $200 на місяць можуть розраховувати на необмежений доступ до GPT-5, а також на доступ до покращеної версії під назвою GPT-5 Pro, яка використовує додаткові обчислювальні ресурси для отримання кращих відповідей.

Наступна стаття Microsoft посилює вимоги щодо повернення до офісної роботи »

попередня стаття « GitHub розкрив дані про GPT-5 за кілька годин до релізу

Дмитро Сімагін

Теги: GPT-5LLM-модельopenAIбенчмарки

08.08.2025 09:05

Останні статті

Новини

Zoom випустить фотореалістичних аватарів, які замінять людей на нарадах

Відеосервіс Zoom анонсує технологію цифрових двійників, які самостійно відвідуватимуть робочі зустрічі. Про це пише TechCrunch.…

10.03.2026

Новини

Meta купує Moltbook: соціальну мережу для агентів та ботів

IT-гігант Meta (материнська компанія Facebook) офіційно оголосив про придбання Moltbook — вірусної соціальної мережі, яка…

10.03.2026

Новини

Китайський агент штучного інтелекту почав таємно майнити криптовалюту

Експериментальний агент штучного інтелекту ROME, якого створили дослідники, пов'язані з китайською компанією Alibaba, продемонстрував неочікувану…

10.03.2026

Новини

Заробляли на DDoS-атаках: у Польщі викрито групу школярів-хакерів, наймолодшому 12 років

Центральне бюро боротьби з кіберзлочинністю Польщі (CBZC) провело масштабну операцію, результатом якої стало викриття групи…

10.03.2026

Новини

Microsoft випустила Copilot Cowork — мультимодальний інструмент для запуску агентів

Microsoft оголосила про початок інтеграції технологій Anthropic у свої сервіси, представивши новий інструмент Copilot Cowork,…

10.03.2026

Новини

Anthropic презентує новий інструмент перевірки пул-реквестів Code Review

Компанія Anthropic оголосила про доступність у Claude Code бета-версії нового інструменту Code Review. Він розробленій…

10.03.2026

GPT-5 виявилась «найпотужнішою для кодування», однак багато хто сподівався на краще

Схожі статті

Останні статті

Zoom випустить фотореалістичних аватарів, які замінять людей на нарадах

Meta купує Moltbook: соціальну мережу для агентів та ботів

Китайський агент штучного інтелекту почав таємно майнити криптовалюту

Заробляли на DDoS-атаках: у Польщі викрито групу школярів-хакерів, наймолодшому 12 років

Microsoft випустила Copilot Cowork — мультимодальний інструмент для запуску агентів

Anthropic презентує новий інструмент перевірки пул-реквестів Code Review