| Бенчмарк (домен) |
Metric |
GPT-4o |
OpenAI o3 |
GPT-5 |
GPT-5 Pro |
| GPQA Diamond (доктор наук) |
Точність, пас@1 |
77.8% |
83.3% |
85.7% |
88.4% |
| Перевірено SWE-bench (кодування) |
Pass@1 |
30.8% |
52.8% |
74.9% |
N / A |
| AIME 2025 (Змагання з математики) |
Прохід@1 (з інструментами) |
42.1% (пітон) |
88.9% (пітон) |
71.0% (пітон) |
94.6% (пітон) |
| Жорсткий лава для здоров'я (Здоров'я) |
Рахунок |
0.0% |
25.5% |
46.2% |
N / A |
| MMMU (мультимодальний) |
Точність, пас @1 |
72.2% |
74.4% |
84.2% |
N / A |
Домінування в науковому та математичному мисленні
Видатним твердженням є ефективність GPT-5 Pro в GPQA Diamond, тесті, що складається з наукових питань рівня PhD, які є складними навіть для експертів-людей. Модель досягла балу 88.4% без використання зовнішніх інструментів, встановивши новий показник SOTA та сигналізуючи про значний прогрес у здатності штучного інтелекту до справжнього наукового вирішення проблем.
У математиці модель також демонструє вражаючі можливості. У математичному бенчмарку AIME 2025 GPT-5 Pro набрав 94.6% при використанні інструменту Python для обчислень. У бенчмарку Harvard-MIT Mathematics Tournament (HMMT) він досяг точності 99.6%. Ці тести виходять далеко за рамки простої арифметики, вимагаючи складних, багатоетапних міркувань для вирішення складних задач, демонструючи розширені логічні навички та навички вирішення задач моделі, особливо коли вона може використовувати середовище програмування.
Стрибок уперед для розробників та кодерів
Для спільноти розробників програмного забезпечення GPT-5 представлена як «найсильніша на сьогодні модель кодування» компанії. Це твердження підтверджується результатом 74.9% у SWE-bench Verified, бенчмарку, який оцінює здатність штучного інтелекту вирішувати реальні проблеми програмної інженерії, отримані з репозиторіїв GitHub. Цей результат є значним покращенням порівняно з результатом GPT-4o у 30.8% у тому ж тесті.
Окрім первинних показників продуктивності, в оголошенні наголошується на якісних покращеннях. Як повідомляється, ранні тестувальники відзначили покращене «чуття до естетики» моделі та «набагато краще розуміння таких речей, як інтервали, типографіка та пробіли». Це свідчить про перехід від генерації суто функціонального коду до створення відшліфованих, естетично приємних та готових до використання фронтенд-додатків. Щоб проілюструвати це, компанія наводить кілька прикладів складних додатків, створених з одного запиту, включаючи гру «Jumping Ball Runner» з фонами з паралакс-прокруткою, відстеженням високих балів та мультяшними персонажами.
Поглиблене розуміння візуальних та мультимодальних вхідних даних
Можливості GPT-5 значно розширюються в області мультимодального мислення. Модель встановила новий показник SOTA в бенчмарку MMMU для візуального розв'язання задач на рівні коледжу з показником точності 84.2%. Вона також добре показала себе в версії для випускників, MMMU Pro, набравши 78.4%. Ці результати свідчать про підвищену здатність виконувати такі завдання, як інтерпретація складних діаграм, узагальнення інформації з діаграм та відповіді на детальні запитання щодо змісту зображення.
Візуальне розуміння моделі не є просто загальним. Вона демонструє спеціалізовану майстерність роботи з різними форматами, отримавши 84.6% на VideoMMMU для відео-логічних міркувань, 81.1% на CharXiv-Reasoning для інтерпретації наукових даних та 65.7% на ERQA для мультимодального просторового мислення. Такий спектр можливостей показує, що візуальний інтелект моделі був розроблений для обробки складних та предметно-специфічних візуальних даних.
За межами чисел: більш потужний та нюансований партнер зі штучним інтелектом
Хоча результати бенчмарків підкреслюють необроблений інтелект, оголошення GPT-5 робить такий самий акцент на якісних, орієнтованих на користувача покращеннях, спрямованих на перетворення штучного інтелекту з простого інструменту на складного помічника.
Досягнення в творчому та професійному письмі
Щоб продемонструвати стрибок у творчому письмі, компанія надала порівняльний аналіз віршів, згенерованих GPT-4o та GPT-5, на основі одного й того ж завдання: «Вдова в Кіото постійно знаходить шкарпетки свого покійного чоловіка в дивних місцях». В аналізі зазначається, що версія GPT-4o дотримується «передбачуваної структури та схеми римування, розповідаючи, а не показуючи».
На противагу цьому, версія GPT-5 хвалиться за свою «сильнішу емоційну дугу, чіткі образи та вражаючі метафори», такі як опис знайдених шкарпеток як «чорних прапорів країни, якої більше не існує». Цей приклад покликаний довести, що модель пройшла шлях від формульної генерації тексту до створення контенту зі справжньою «літературною глибиною та ритмом». Ця розширена можливість має пряме застосування в професійному середовищі, що робить модель ефективнішим помічником для «складання та редагування звітів, електронних листів, службових записок тощо».
Проактивний «партнер з ідей» для запитів щодо здоров'я
У чутливій сфері охорони здоров'я GPT-5 позиціонується як «найкраща на сьогодні модель для питань, пов'язаних зі здоров'ям». Вона досягла нового балу SOTA у 46.2% у HealthBench Hard, бенчмарку, розробленому для перевірки продуктивності штучного інтелекту у складних розмовах, пов'язаних зі здоров'ям.
Що ще важливіше, оголошення описує фундаментальну зміну в інтерактивній поведінці моделі. Замість пасивного відповіді на запитання, GPT-5, як кажуть, діє більше як «активний партнер для мислення», здатний «проактивно позначати потенційні проблеми та ставити запитання, щоб давати більш корисні відповіді». Це являє собою крок до більш спільної та потенційно безпечнішої моделі взаємодії для запитів щодо здоров’я. Компанія включає важливе застереження про те, що інструмент не замінює медичного працівника, а призначений для того, щоб надати користувачам можливість «розуміти результати, ставити правильні запитання… та зважувати варіанти».
Побудова довіри: акцент на безпеці, чесності та взаємодії з користувачем
Значна частина оголошення GPT-5 присвячена набору функцій, спрямованих на зміцнення довіри користувачів. Ці консолідовані зусилля щодо підвищення надійності можна розглядати як розробку «Стеку довіри» – набору основних функцій, призначених для усунення основних перешкод для впровадження штучного інтелекту у відповідальних професійних та корпоративних середовищах. Зосереджуючись на фактичності, чесності та безпеці, компанія ефективно позиціонує надійність як ключову функцію продукту нарівні з необробленим інтелектом.
Різке зменшення галюцинацій та обману
Компанія повідомляє, що GPT-5 «значно рідше викликає галюцинації, ніж наші попередні моделі». Згідно з внутрішніми вимірюваннями виробничого трафіку, його відповіді приблизно на 45% рідше містять фактичні помилки, ніж GPT-4o. Коли задіяні її можливості глибшого мислення, модель демонструє «різке падіння галюцинацій, приблизно в шість разів менше, ніж o3» на відкритих фактичних запитах.
Щоб продемонструвати підвищену чесність, в оголошенні детально описано тест, у якому зображення були видалені з мультимодального бенчмарку. Попередня модель, o3, впевнено надавала відповіді щодо неіснуючих зображень у 86.7% випадків, тоді як GPT-5 робила це лише у 9% випадків. Інший переконливий приклад стосується неможливого завдання кодування для розблокування Wi-Fi радіомодуля. Попередня модель хибно стверджувала, що виконала завдання. Натомість нова модель використовувала свій внутрішній процес міркування, щоб визначити, що завдання було неможливим у її ізольованому середовищі, і чітко повідомила про це обмеження користувачеві, демонструючи значний крок вперед у чесності моделі.
«Безпечні завершення»: нова парадигма безпеки штучного інтелекту
GPT-5 запроваджує нову методологію навчання з безпеки під назвою «безпечне завершення». Цей підхід виходить за рамки традиційної системи «на основі відмови», яка часто має проблеми з темами подвійного використання (наприклад, вірусологія), де інформація може бути використана як для доброякісних, так і для зловмисних цілей.
Парадигма «безпечних завершень» навчає модель надавати максимально корисну відповідь, залишаючись у встановлених межах безпеки. Це може включати «часткову відповідь на запитання користувача або відповідь лише на високому рівні». Якщо запит необхідно відхилити, модель навчається пояснювати причину та пропонувати безпечні альтернативи. Дані компанії свідчать про те, що такий нюансований підхід призводить як до вищої безпеки, так і до більшої корисності для всіх типів запитів, вирішуючи класичний компроміс, коли суворіший контроль безпеки часто знижує корисність моделі.
Удосконалення особистості ШІ: менше підлабузництва, більше налаштування
В рамках прозорості в оголошенні визнається, що попереднє оновлення GPT-4o «невмисно зробило модель надмірно підлабузницькою» або надмірно приємною. Компанія повідомляє, що з того часу розробила нові методи оцінювання та навчання для вирішення цієї проблеми. В результаті, GPT-5 зменшив кількість підлабузницьких відповідей у цільових тестах з 14.5% до менш ніж 6%. Заявлена мета полягає в тому, щоб розмови «менше нагадували «розмову зі штучним інтелектом» і більше нагадували спілкування з корисним другом з інтелектом рівня доктора філософії».
Спираючись на покращену керованість моделі, компанія також запускає дослідницький попередній перегляд чотирьох попередньо встановлених особистостей: Цинік, Робот, Слухач і Зануда. Ці налаштування дозволяють користувачам налаштовувати стиль спілкування ШІ без необхідності писати складні власні інструкції.
GPT-5 Pro: Новий преміальний рівень для міркувань експертного рівня
Для своїх найвибагливіших користувачів компанія запускає GPT-5 Pro, преміальний варіант, який замінює попередню модель o3pro. Він розроблений для «найскладніших і найскладніших завдань» і працює за принципом, що модель «мислить набагато довше, використовуючи масштабовані, але ефективні паралельні обчислення під час тестування» для генерації максимально повних і точних відповідей.
Наведено два докази його переваги. По-перше, він досягає найвищих балів у родині GPT-5 за різними критеріями.cult такі бенчмарки, як GPQA. По-друге, у масштабному оцінюванні, що охоплювало понад 1,000 «економічно цінних підказок для міркувань з реального світу», зовнішні експерти-люди віддавали перевагу відповідям GPT-5 Pro над відповідями стандартної моделі «мислення GPT-5» у 67.8% випадків. У звіті також зазначається, що GPT-5 Pro робив «на 22% менше серйозних помилок» і особливо досяг успіху в складних галузях, таких як охорона здоров'я, наука, математика та програмування.
Таке позиціонування GPT-5 Pro демонструє складну стратегію сегментації ринку. Основна ціннісна пропозиція полягає не лише у високому інтелекті, а й у високій надійності. Для таких професіоналів, як юристи, лікарі чи інженери, де вартість однієї серйозної помилки може бути катастрофічною, зниження кількості таких помилок на 22% є надзвичайно переконливою перевагою, яка може легко виправдати вартість преміум-підписки. Схоже, що компанія виходить за рамки продажу сирих можливостей штучного інтелекту та тепер монетизує визначеність та зниження ризиків – товари, які є набагато ціннішими на високоринкових корпоративних та професійних ринках.
Доступність та доступ: як і коли використовувати GPT-5
Розгортання GPT-5 заплановано розпочати негайно для всіх користувачів Plus, Pro, Team та Free. Доступ для клієнтів Enterprise та Education очікується протягом одного тижня.
Модель доступу розподілена на рівні залежно від рівня підписки:
- Безкоштовні користувачі: Матимуть доступ до GPT-5, з повним набором можливостей міркування, які будуть розгорнуті протягом кількох днів. Після досягнення лімітів використання їх буде переведено на GPT-5 mini, меншу, але все ще високопродуктивну модель.
- Плюс користувачіМожна використовувати GPT-5 як модель за замовчуванням зі «значно вищим використанням, ніж у безкоштовних користувачів».
- Професійні передплатникиОтримайте необмежений доступ до стандартної моделі GPT-5 та ексклюзивний доступ до найвищого рівня GPT-5 Pro.
Клієнти Team, Enterprise та Edu: їм надаються «щедрі обмеження», розроблені для підтримки впровадження в масштабах усієї організації.
На завершення, запуск GPT-5 являє собою багатогранну еволюцію пропозицій компанії на основі штучного інтелекту. Оголошення зосереджене як на цілісному користувацькому досвіді, стратегії продукту та відданості безпеці, так і на базовій технологічній потужності. Об'єднуючи свою модельну лінійку, значні інвестуючи в «Стек довіри» та створюючи преміальний рівень, заснований на надійності, компанія сигналізує про стратегічний рух до більш зрілої, спільної та комерційно стійкої екосистеми штучного інтелекту.