| Benchmark (doména) |
metrický |
GPT-4o |
OpenAI o3 |
GPT-5 |
GPT-5 Pro |
| GPQA Diamond (PhD vědy) |
Přesnost, průchod@1 |
77.8% |
83.3% |
85.7% |
88.4% |
| Ověřeno SWE-bench (kódování) |
Přihrávka@1 |
30.8% |
52.8% |
74.9% |
N / A |
| AIME 2025 (Soutěž v matematice) |
Průchod@1 (s nástroji) |
42.1 % (python) |
88.9 % (python) |
71.0 % (python) |
94.6 % (python) |
| ZdravíTvrdá lavička (Zdraví) |
Skóre |
0.0% |
25.5% |
46.2% |
N / A |
| MMMU (multimodální) |
Přesnost, přihrávka @1 |
72.2% |
74.4% |
84.2% |
N / A |
Dominance ve vědeckém a matematickém uvažování
Významným tvrzením je výkon GPT-5 Pro v testu GPQA Diamond, což je benchmark sestavený z vědeckých otázek na úrovni PhD, které jsou náročné i pro lidské experty. Model dosáhl skóre 88.4 % bez použití externích nástrojů, čímž stanovil novou hranici SOTA a signalizoval významný pokrok ve schopnosti umělé inteligence skutečně řešit vědecké problémy.
V matematice model také prokazuje impozantní schopnosti. V matematickém benchmarku soutěže AIME 2025 dosáhl GPT-5 Pro skóre 94.6 %, když byl vybaven nástrojem Python pro výpočty. V benchmarku Harvard-MIT Mathematics Tournament (HMMT) dosáhl přesnosti 99.6 %. Tyto testy jdou daleko za rámec jednoduché aritmetiky a vyžadují sofistikované, vícestupňové uvažování k řešení složitých problémů, což ukazuje pokročilé logické a problémové dovednosti modelu, zejména pokud může využít kódovací prostředí.
Skok vpřed pro vývojáře a kodéry
Pro komunitu vývojářů softwaru je GPT-5 prezentován jako „dosud nejsilnější kódovací model společnosti“. Toto tvrzení je podpořeno skóre 74.9 % v testu SWE-bench Verified, což je benchmark, který hodnotí schopnost umělé inteligence řešit reálné problémy softwarového inženýrství získané z repozitářů GitHub. Tento výsledek představuje masivní zlepšení oproti skóre 4 % u GPT-30.8o ve stejném testu.
Kromě samotných metrik výkonu oznámení zdůrazňuje kvalitativní vylepšení. První testeři údajně zaznamenali vylepšený „oko pro estetický cit“ modelu a „mnohem lepší pochopení věcí, jako je mezery, typografie a bílý prostor“. To naznačuje přechod od generování pouze funkčního kódu k vytváření propracovaných, esteticky příjemných a produkčně připravených frontendových aplikací. Pro ilustraci společnost poukazuje na několik příkladů složitých aplikací vytvořených z jediného promptu, včetně hry „Jumping Ball Runner“ s paralaxním rolováním na pozadí, sledováním vysokého skóre a kreslenými postavičkami.
Lepší porozumění vizuálním a multimodálním vstupům
Schopnosti GPT-5 se robustně rozšiřují i do multimodálního uvažování. Model stanovil novou úroveň SOTA v rámci benchmarku MMMU pro vizuální řešení problémů na vysokoškolské úrovni s přesností 84.2 %. Také si vedl dobře v postgraduální verzi MMMU Pro s 78.4 %. Tyto výsledky naznačují zvýšenou schopnost provádět úkoly, jako je interpretace složitých grafů, shrnutí informací z diagramů a odpovídání na podrobné otázky týkající se obsahu obrázku.
Vizuální porozumění modelu není pouze obecné. Model demonstruje specializovanou zdatnost napříč různými formáty, přičemž v testu VideoMMMU dosáhl skóre 84.6 % pro uvažování na základě videa, 81.1 % v testu CharXiv-Reasoning pro interpretaci vědeckých údajů a 65.7 % v testu ERQA pro multimodální prostorové uvažování. Tato šíře schopností ukazuje, že vizuální inteligence modelu byla vyvinuta pro zpracování komplexních a doménově specifických vizuálních dat.
Za hranicemi čísel: Schopnější a propracovanější spolupracovník s umělou inteligencí
Zatímco benchmarkové skóre zdůrazňuje surovou inteligenci, oznámení GPT-5 klade stejný důraz na kvalitativní vylepšení zaměřená na uživatele, jejichž cílem je transformovat umělou inteligenci z jednoduchého nástroje v sofistikovaného spolupracovníka.
Pokroky v tvůrčím a profesionálním psaní
Aby společnost demonstrovala pokrok v tvůrčím psaní, poskytla srovnání básní generovaných metodami GPT-4o a GPT-5 na stejnou výzvu: „Vdova v Kjótu stále nachází ponožky svého zesnulého manžela na podivných místech“. Analýza uvádí, že verze GPT-4o se řídí „předvídatelnou strukturou a rýmovým schématem, vypráví místo ukazuje“.
Naproti tomu verze GPT-5 je chválena pro svůj „silnější emocionální oblouk, jasnou obraznost a působivé metafory“, například popis nalezených ponožek jako „černých vlajek země, která již neexistuje“. Tento příklad má za cíl argumentovat, že model pokročil od generování textu založené na formulích k vytváření obsahu se skutečnou „literární hloubkou a rytmem“. Tato vylepšená schopnost má přímé uplatnění v profesionálním prostředí, což z modelu činí efektivnějšího pomocníka pro „navrhování a úpravu zpráv, e-mailů, poznámek a dalších dokumentů“.
Proaktivní „myšlenkový partner“ pro zdravotní dotazy
V citlivé oblasti zdraví je GPT-5 hodnocen jako „dosud nejlepší model pro otázky týkající se zdraví“. V testu HealthBench Hard, který je určen k testování výkonu umělé inteligence v náročných konverzacích týkajících se zdraví, dosáhl nového skóre SOTA 46.2 %.
Ještě důležitější je, že oznámení popisuje zásadní posun v interaktivním chování modelu. GPT-5 údajně místo pasivního odpovídání na otázky funguje spíše jako „aktivní myšlenkový partner“, schopný „proaktivně upozorňovat na potenciální obavy a klást otázky, aby poskytoval užitečnější odpovědi“. To představuje krok směrem ke spolupracujícímu a potenciálně bezpečnějšímu modelu interakce pro zdravotní dotazy. Společnost uvádí zásadní upozornění, že nástroj nenahrazuje lékaře, ale má uživatelům umožnit „porozumět výsledkům, klást správné otázky… a zvažovat možnosti“.
Budování důvěry: Zaměření na bezpečnost, poctivost a uživatelskou zkušenost
Podstatná část oznámení GPT-5 je věnována sadě funkcí zaměřených na budování důvěry uživatelů. Toto konsolidované úsilí o zlepšení spolehlivosti lze vnímat jako vývoj „Trust Stacku“, což je sada klíčových funkcí určených k řešení hlavních překážek bránících zavedení umělé inteligence v náročných profesionálních a podnikových prostředích. Zaměřením se na fakta, poctivost a bezpečnost společnost efektivně pozicionuje důvěryhodnost jako klíčovou vlastnost produktu, rovnající se kvalitě nezpracovaných informací.
Dramatické snížení halucinací a klamů
Společnost uvádí, že GPT-5 má „výrazně menší pravděpodobnost halucinací než naše předchozí modely“. Podle interních měření produkčního provozu je u jeho odpovědí přibližně o 45 % menší pravděpodobnost, že budou obsahovat faktické chyby, než u GPT-4o. Když jsou zapojeny jeho hlubší schopnosti uvažování, model vykazuje „prudký pokles halucinací, přibližně šestkrát méně než o3“ u otevřených faktických výzev.
Pro demonstraci zlepšené poctivosti oznámení podrobně popisuje test, ve kterém byly z multimodálního benchmarku odstraněny obrázky. Předchozí model o3 s jistotou poskytoval odpovědi ohledně neexistujících obrázků v 86.7 % případů, zatímco GPT-5 tak činil pouze v 9 % případů. Dalším silným příkladem je nemožný kódovací úkol k odblokování Wi-Fi rádia. Předchozí model falešně tvrdil, že úkol dokončil. Naproti tomu nový model použil svůj interní proces uvažování k identifikaci, že úkol byl v jeho sandboxovém prostředí nemožný, a toto omezení jasně sdělil uživateli, což představuje významný krok vpřed v poctivosti modelu.
„Bezpečné dokončení“: Nové paradigma pro bezpečnost umělé inteligence
GPT-5 zavádí novou metodologii bezpečnostního školení s názvem „bezpečné dokončení“. Tento přístup jde nad rámec tradičního systému „založeného na odmítnutí“, který se často potýká s tématy dvojího užití (např. virologie), kde informace mohou být použity jak k neškodným, tak k škodlivým účelům.
Paradigma „bezpečných dokončení“ učí model poskytovat co nejužitečnější odpověď a zároveň zůstat v rámci stanovených bezpečnostních hranic. To může zahrnovat „částečné zodpovězení uživatelské otázky nebo pouze odpověď na vysoké úrovni“. Pokud je nutné požadavek zamítnout, model je trénován tak, aby vysvětlil proč a nabídl bezpečné alternativy. Data společnosti naznačují, že tento nuancovaný přístup vede k vyšší bezpečnosti i větší užitečnosti u všech typů výzev a řeší klasický kompromis, kdy přísnější bezpečnostní kontroly často snižují užitečnost modelu.
Zdokonalování osobnosti umělé inteligence: Méně podlézavosti, více možností přizpůsobení
V rámci transparentnosti oznámení uvádí, že předchozí aktualizace GPT-4o „neúmyslně způsobila, že se model stal příliš podlézavým“ nebo nadměrně příjemným. Společnost uvádí, že od té doby vyvinula nové metody hodnocení a školení, které tento problém řeší. V důsledku toho GPT-5 snížil počet podlézavých odpovědí v cílených testech ze 14.5 % na méně než 6 %. Uvedeným cílem je, aby konverzace „méně připomínaly ‚mluvení s umělou inteligencí‘ a více mluvily s ochotným přítelem s inteligencí na úrovni PhD“.
V návaznosti na vylepšenou ovladatelnost modelu společnost také spouští výzkumnou verzi čtyř přednastavených osobností: Cynik, Robot, Posluchač a Šmejd. Tato volitelná nastavení umožňují uživatelům přizpůsobit komunikační styl umělé inteligence, aniž by museli psát složité vlastní pokyny.
GPT-5 Pro: Nová prémiová úroveň pro uvažování na expertní úrovni
Pro své nejnáročnější uživatele společnost uvádí na trh GPT-5 Pro, prémiovou variantu, která nahrazuje předchozí model o3pro. Je navržena pro „nejnáročnější a nejsložitější úkoly“ a funguje tak, že model „myslí stále déle a využívá škálované, ale efektivní paralelní výpočty v testovací době“ pro generování co nejkomplexnějších a nejpřesnějších odpovědí.
Důkazy o jeho nadřazenosti jsou dvojí. Zaprvé, dosahuje nejvyššího skóre v rámci rodiny GPT-5 na porovnání...cult benchmarky jako GPQA. Za druhé, v rozsáhlém hodnocení zahrnujícím více než 1,000 5 „ekonomicky cenných, reálných argumentačních výzev“ externí lidští experti upřednostňovali odpovědi GPT-5 Pro před odpověďmi ze standardního modelu „myšlení GPT-67.8“ v 5 % případů. Zpráva rovněž uvádí, že GPT-22 Pro udělal „o XNUMX % méně závažných chyb“ a obzvláště vynikal ve složitých oblastech, jako je zdravotnictví, věda, matematika a programování.
Toto umístění GPT-5 Pro odhaluje sofistikovanou strategii segmentace trhu. Hlavní hodnotovou nabídkou není jen vynikající inteligence, ale i vynikající spolehlivost. Pro profesionály, jako jsou právníci, lékaři nebo inženýři, kde mohou být náklady na jedinou závažnou chybu katastrofální, je 22% snížení takových chyb mimořádně přesvědčivou výhodou, která může snadno ospravedlnit cenu prémiového předplatného. Zdá se, že společnost se posouvá nad rámec prodeje surových schopností umělé inteligence a nyní monetizuje jistotu a snížení rizik, což jsou komodity, které jsou mnohem cennější na vysoce rizikových podnikových a profesionálních trzích.
Dostupnost a přístup: Jak a kdy používat GPT-5
Zavádění GPT-5 je naplánováno na okamžité zahájení pro všechny uživatele Plus, Pro, Team a Free. Přístup pro zákazníky Enterprise a Education by měl následovat do jednoho týdne.
Model přístupu je stupňovitý na základě úrovně předplatného:
- Bezplatní uživateléBudou mít přístup k GPT-5 s plnými funkcemi uvažování, které budou spuštěny během několika dnů. Jakmile budou splněny jejich limity využití, budou převedeni na GPT-5 mini, menší, ale stále vysoce výkonný model.
- Plus uživateléMohou používat GPT-5 jako výchozí model s „výrazně vyšším využitím než uživatelé bezplatných verzí“.
- Profesionální odběrateléZískejte neomezený přístup ke standardnímu modelu GPT-5 a exkluzivní přístup k špičkovému modelu GPT-5 Pro.
Zákazníci pro týmy, podniky a vzdělávání: Dostávají „velkorysé limity“ určené k podpoře přijetí v celé organizaci.
Závěrem lze říci, že uvedení GPT-5 představuje mnohostranný vývoj v nabídce společnosti v oblasti umělé inteligence. Oznámení se zaměřuje jak na holistický uživatelský zážitek, produktovou strategii a závazek k bezpečnosti, tak i na základní technologický potenciál. Sjednocením své modelové řady, velkými investicemi do „Trust Stacku“ a vytvořením prémiové úrovně založené na spolehlivosti společnost signalizuje strategický tlak na vyspělejší, spolupracující a komerčně robustnější ekosystém umělé inteligence.