| Benchmark (Domain) |
metric |
GPT-4o |
OpenAI o3 |
GPT-5 |
GPT-5 Pro |
| GPQA Diamond (PhD Science) |
Katumpakan, pass@1 |
77.8% |
83.3% |
85.7% |
88.4% |
| Na-verify ang SWE-bench (Coding) |
Pass@1 |
30.8% |
52.8% |
74.9% |
N / A |
| AIME 2025 (Competition Math) |
Pass@1 (w/ tools) |
42.1% (python) |
88.9% (python) |
71.0% (python) |
94.6% (python) |
| HealthBench Hard (Health) |
Puntos |
0.0% |
25.5% |
46.2% |
N / A |
| MMMU (Multimodal) |
Katumpakan, ipasa ang @1 |
72.2% |
74.4% |
84.2% |
N / A |
Pangingibabaw sa Pang-agham at Pang-matematika na Pangangatwiran
Ang isang kapansin-pansing claim ay ang pagganap ng GPT-5 Pro sa GPQA Diamond, isang benchmark na binubuo ng mga tanong sa agham sa antas ng PhD na mahirap kahit para sa mga eksperto ng tao. Nakamit ng modelo ang markang 88.4% nang hindi gumagamit ng mga panlabas na tool, nagtatakda ng bagong SOTA at nagsenyas ng makabuluhang pagsulong sa kapasidad ng AI para sa tunay na siyentipikong paglutas ng problema.
Sa matematika, ang modelo ay nagpapakita rin ng mga kakila-kilabot na kakayahan. Sa AIME 2025 competition math benchmark, nakakuha ang GPT-5 Pro ng 94.6% kapag nilagyan ng Python tool para sa mga kalkulasyon. Sa benchmark ng Harvard-MIT Mathematics Tournament (HMMT), umabot ito sa katumpakan na 99.6%. Ang mga pagsubok na ito ay higit pa sa simpleng aritmetika, na nangangailangan ng sopistikado, multi-step na pangangatwiran upang malutas ang mga kumplikadong problema, na nagpapakita ng mga advanced na lohikal at mga kasanayan sa paglutas ng problema ng modelo, lalo na kapag maaari nitong gamitin ang isang coding environment.
Isang Leap Forward para sa mga Developer at Coder
Para sa komunidad ng software development, ang GPT-5 ay ipinakita bilang "pinakamatibay na modelo ng coding hanggang sa kasalukuyan". Ang claim na ito ay sinusuportahan ng 74.9% na marka sa SWE-bench Verified, isang benchmark na sinusuri ang kakayahan ng AI na lutasin ang mga isyu sa real-world na software engineering na nagmula sa mga GitHub repository. Ang resultang ito ay kumakatawan sa isang napakalaking pagpapabuti sa 4% na marka ng GPT-30.8o sa parehong pagsubok.
Higit pa sa hilaw na sukatan ng pagganap, binibigyang-diin ng anunsyo ang mga pagpapahusay sa husay. Ang mga naunang sumusubok ay iniulat na napansin ang pinahusay na "eye para sa aesthetic sensibility" ng modelo at isang "mas mahusay na pag-unawa sa mga bagay tulad ng spacing, typography, at white space". Ito ay nagmumungkahi ng isang paglipat mula sa pagbuo lamang ng functional na code patungo sa paggawa ng pinakintab, aesthetically kasiya-siya, at handa sa produksyon na mga frontend na application. Upang ilarawan ito, ang kumpanya ay tumuturo sa ilang mga halimbawa ng mga kumplikadong application na ginawa mula sa isang prompt, kabilang ang isang "Jumping Ball Runner" na laro na kumpleto sa parallax scrolling background, high-score tracking, at cartoonish na mga character.
Pinahusay na Pag-unawa sa Mga Visual at Multimodal na Input
Ang mga kakayahan ng GPT-5 ay lumalawak nang matatag sa multimodal na pangangatwiran. Nagtakda ang modelo ng bagong SOTA sa MMMU benchmark para sa antas ng kolehiyo na visual na paglutas ng problema na may 84.2% na marka ng katumpakan. Malakas din itong gumanap sa graduate-level na bersyon, MMMU Pro, na nakakuha ng 78.4%. Ang mga resultang ito ay nagpapahiwatig ng mas mataas na kakayahang magsagawa ng mga gawain tulad ng pagbibigay-kahulugan sa mga kumplikadong chart, pagbubuod ng impormasyon mula sa mga diagram, at pagsagot sa mga detalyadong tanong tungkol sa nilalaman ng isang larawan.
Ang visual na pag-unawa ng modelo ay hindi lamang generic. Nagpapakita ito ng espesyal na kasanayan sa iba't ibang format, na nakakuha ng 84.6% sa VideoMMMU para sa video-based na pangangatwiran, 81.1% sa CharXiv-Reasoning para sa pagbibigay-kahulugan sa mga siyentipikong numero, at 65.7% sa ERQA para sa multimodal spatial na pangangatwiran. Ang lawak ng kakayahan na ito ay nagpapakita na ang visual intelligence ng modelo ay binuo upang pangasiwaan ang kumplikado at tukoy sa domain na visual na data.
Beyond the Numbers: Isang Mas May kakayahan at Nuanced AI Collaborator
Habang ang mga marka ng benchmark ay nagtatampok ng hilaw na katalinuhan, ang GPT-5 na anunsyo ay nagbibigay ng pantay na diin sa husay, mga pagpapahusay na nakaharap sa user na idinisenyo upang baguhin ang AI mula sa isang simpleng tool sa isang sopistikadong collaborator.
Mga Pagsulong sa Malikhain at Propesyonal na Pagsusulat
Upang ipakita ang isang paglukso sa malikhaing pagsulat, ang kumpanya ay nagbigay ng magkatabing paghahambing ng mga tula na nabuo ng GPT-4o at GPT-5 sa parehong prompt: "Isang balo sa Kyoto ay patuloy na nakakahanap ng mga medyas ng kanyang yumaong asawa sa mga kakaibang lugar". Ang pagsusuri ay nagsasaad na ang bersyon ng GPT-4o ay sumusunod sa isang "nahuhulaang istraktura at pamamaraan ng rhyme, na nagsasabi sa halip na ipakita".
Sa kabaligtaran, ang bersyon ng GPT-5 ay pinuri para sa "mas malakas na emosyonal na arko, malinaw na imahe, at kapansin-pansin na mga metapora," tulad ng paglalarawan sa mga natagpuang medyas bilang "mga itim na bandila ng isang bansang wala na." Ang halimbawang ito ay na-curate upang magtaltalan na ang modelo ay sumulong mula sa pagbuo ng formulaic text hanggang sa paglikha ng nilalaman na may tunay na "literary depth at ritmo". Ang pinahusay na kakayahan na ito ay may mga direktang aplikasyon sa mga propesyonal na setting, na ginagawang mas epektibong katulong ang modelo para sa "pag-draft at pag-edit ng mga ulat, email, memo, at higit pa."
Isang Proactive na 'Thought Partner' para sa Mga Tanong sa Kalusugan
Sa sensitibong domain ng kalusugan, ang GPT-5 ay nakaposisyon bilang "pinakamahusay na modelo para sa mga tanong na may kaugnayan sa kalusugan". Nakamit nito ang bagong marka ng SOTA na 46.2% sa HealthBench Hard, isang benchmark na idinisenyo upang subukan ang pagganap ng AI sa mga mapaghamong pag-uusap na may kaugnayan sa kalusugan.
Higit sa lahat, inilalarawan ng anunsyo ang isang pangunahing pagbabago sa interactive na gawi ng modelo. Sa halip na passive na sumagot sa mga tanong, ang GPT-5 ay sinasabing mas kumikilos bilang isang "aktibong kasosyo sa pag-iisip," na may kakayahang "proactive na pag-flag ng mga potensyal na alalahanin at pagtatanong upang magbigay ng mas kapaki-pakinabang na mga sagot." Ito ay kumakatawan sa isang hakbang patungo sa isang mas collaborative at potensyal na mas ligtas na modelo ng pakikipag-ugnayan para sa mga katanungan sa kalusugan. Kasama sa kumpanya ang mahalagang disclaimer na ang tool ay hindi isang kapalit para sa isang medikal na propesyonal ngunit nilayon upang bigyang kapangyarihan ang mga user na "maunawaan ang mga resulta, magtanong ng mga tamang tanong... at timbangin ang mga opsyon."
Pagbuo ng Tiwala: Isang Pagtuon sa Kaligtasan, Katapatan, at Karanasan ng User
Ang isang malaking bahagi ng anunsyo ng GPT-5 ay nakatuon sa isang hanay ng mga tampok na naglalayong bumuo ng tiwala ng user. Ang pinagsama-samang pagsisikap na ito upang pahusayin ang pagiging maaasahan ay makikita bilang pagbuo ng isang "Trust Stack", isang hanay ng mga pangunahing tampok na idinisenyo upang tugunan ang mga pangunahing hadlang sa pag-aampon ng AI sa mga high-stakes na propesyonal at enterprise na kapaligiran. Sa pamamagitan ng pagtutok sa katotohanan, katapatan, at kaligtasan, epektibong ipinoposisyon ng kumpanya ang pagiging mapagkakatiwalaan bilang pangunahing feature ng produkto na katumbas ng raw intelligence.
Kapansin-pansing Pagbabawas ng mga Hallucinations at Panlilinlang
Ang kumpanya ay nag-uulat na ang GPT-5 ay "malaking mas malamang na mag-hallucinate kaysa sa aming mga nakaraang modelo". Ayon sa mga panloob na sukat sa trapiko ng produksyon, ang mga tugon nito ay humigit-kumulang 45% na mas malamang na maglaman ng isang makatotohanang error kaysa sa GPT-4o. Kapag ang mas malalim nitong kakayahan sa pangangatwiran ay nakikibahagi, ang modelo ay nagpapakita ng "matalim na pagbaba sa mga guni-guni, mga anim na beses na mas kaunti sa o3" sa mga bukas na katotohanang senyales.
Upang ipakita ang pinahusay na katapatan, ang anunsyo ay nagdedetalye ng isang pagsubok kung saan inalis ang mga larawan mula sa isang multimodal na benchmark. Ang nakaraang modelo, o3, ay kumpiyansa na nagbigay ng mga sagot tungkol sa mga hindi umiiral na larawan 86.7% ng oras, samantalang ginawa ito ng GPT-5 sa 9% lamang ng mga kaso. Ang isa pang makapangyarihang halimbawa ay nagsasangkot ng isang imposibleng coding na gawain upang i-unblock ang isang Wi-Fi radio. Ang nakaraang modelo ay maling inaangkin na nakumpleto ang gawain. Sa kabaligtaran, ginamit ng bagong modelo ang internal na proseso ng pangangatwiran nito upang matukoy na imposible ang gawain sa loob ng sandboxed na kapaligiran nito at malinaw na ipinaalam ang limitasyong ito sa user, na nagpapakita ng isang malaking hakbang pasulong sa pagiging tapat ng modelo.
"Mga Ligtas na Pagkumpleto": Isang Bagong Paradigm para sa Kaligtasan ng AI
Ipinakilala ng GPT-5 ang isang bagong pamamaraan ng pagsasanay sa kaligtasan na tinatawag na "mga ligtas na pagkumpleto." Ang diskarte na ito ay lumalampas sa tradisyunal na "batay sa pagtanggi" na sistema, na kadalasang nakikipagpunyagi sa mga paksang dalawahan ang paggamit (hal., virology) kung saan maaaring gamitin ang impormasyon para sa parehong benign at malisyosong layunin.
Itinuturo ng paradigm na "safe completions" ang modelo na magbigay ng pinakakapaki-pakinabang na sagot na posible habang nananatili sa loob ng itinatag na mga hangganan ng kaligtasan. Maaaring kabilang dito ang "bahagyang pagsagot sa tanong ng gumagamit o pagsagot lamang sa mataas na antas". Kung ang isang kahilingan ay dapat tanggihan, ang modelo ay sinanay na ipaliwanag kung bakit at mag-alok ng mga ligtas na alternatibo. Iminumungkahi ng data ng kumpanya na ang nuanced na diskarte na ito ay humahantong sa parehong mas mataas na kaligtasan at mas kapaki-pakinabang sa lahat ng uri ng mga senyas, na tumutugon sa klasikong trade-off kung saan ang mas mahigpit na mga kontrol sa kaligtasan ay kadalasang binabawasan ang utility ng isang modelo.
Pinipino ang Personalidad ng AI: Mas Kaunting Sycophancy, Higit na Pag-customize
Sa isang sandali ng transparency, kinikilala ng anunsyo na ang isang naunang pag-update sa GPT-4o ay "hindi sinasadyang ginawa ang modelo ng sobrang sycophantic" o labis na sumasang-ayon. Ang kumpanya ay nag-uulat na ito ay bumuo ng mga bagong pagsusuri at mga pamamaraan ng pagsasanay upang matugunan ito. Bilang resulta, binawasan ng GPT-5 ang mga sycophantic na tugon sa mga naka-target na pagsubok mula 14.5% hanggang mas mababa sa 6%. Ang nakasaad na layunin ay gawin ang mga pag-uusap na parang "hindi tulad ng 'pakikipag-usap sa AI' at mas katulad ng pakikipag-chat sa isang matulunging kaibigan na may PhD-level na katalinuhan".
Batay sa pinahusay na kakayahang makontrol ng modelo, ang kumpanya ay naglulunsad din ng isang preview ng pananaliksik ng apat na preset na personalidad: Cynic, Robot, Listener, at Nerd. Ang mga setting ng pag-opt-in na ito ay nagbibigay-daan sa mga user na i-customize ang istilo ng komunikasyon ng AI nang hindi kinakailangang magsulat ng mga kumplikadong custom na tagubilin.
GPT-5 Pro: Isang Bagong Premium Tier para sa Expert-Level Reasoning
Para sa mga pinaka-demanding user nito, inilulunsad ng kumpanya ang GPT-5 Pro, isang premium na variant na pumapalit sa nakaraang modelo ng o3pro. Ito ay idinisenyo para sa "pinaka-mapanghamong, kumplikadong mga gawain" at gumagana sa pamamagitan ng pagkakaroon ng modelong "mag-isip nang mas matagal, gamit ang pinaliit ngunit mahusay na parallel na pag-compute ng oras ng pagsubok" upang makabuo ng pinakakomprehensibo at tumpak na mga sagot na posible.
Ang ebidensya na ipinakita para sa higit na kahusayan nito ay dalawa. Una, nakakamit nito ang pinakamataas na marka sa loob ng pamilya ng GPT-5 sa difficult mga benchmark tulad ng GPQA. Pangalawa, sa isang malakihang pagsusuri na kinasasangkutan ng higit sa 1,000 "mahalaga sa ekonomiya, totoong mundo na mga senyales ng pangangatwiran," mas gusto ng mga panlabas na eksperto ng tao ang mga tugon ng GPT-5 Pro kaysa sa mga mula sa karaniwang modelo ng "GPT-5 thinking" na 67.8% ng oras. Binabanggit din ng ulat na ang GPT-5 Pro ay gumawa ng "22% na mas kaunting malalaking error" at partikular na mahusay sa mga kumplikadong domain tulad ng kalusugan, agham, matematika, at coding.
Ang pagpoposisyon na ito ng GPT-5 Pro ay nagpapakita ng isang sopistikadong diskarte sa segmentasyon ng merkado. Ang panukalang pangunahing halaga ay hindi lamang higit na katalinuhan, ngunit higit na pagiging maaasahan. Para sa mga propesyonal tulad ng mga abogado, doktor, o inhinyero, kung saan ang halaga ng isang malaking error ay maaaring maging sakuna, ang 22% na pagbawas sa mga naturang error ay isang lubhang nakakahimok na benepisyo na madaling mabigyang-katwiran ang isang premium na halaga ng subscription. Ang kumpanya ay lumilitaw na lumilipat nang higit pa sa pagbebenta ng mga hilaw na kakayahan ng AI at ngayon ay kumikita ng katiyakan at pagbabawas ng panganib, mga kalakal na higit na mahalaga sa mga negosyong may mataas na stake at mga propesyonal na merkado.
Availability at Access: Paano at Kailan Gamitin ang GPT-5
Ang paglulunsad ng GPT-5 ay nakatakdang magsimula kaagad para sa lahat ng Plus, Pro, Team, at Libreng mga user. Ang pag-access para sa mga customer ng Enterprise at Education ay inaasahang susundan sa isang linggo.
Naka-tier ang modelo ng access batay sa antas ng subscription:
- Libreng Mga Gumagamit: Magkakaroon ng access sa GPT-5, na may ganap na kakayahan sa pangangatwiran na ilalabas sa loob ng ilang araw. Sa sandaling matugunan ang kanilang mga limitasyon sa paggamit, ililipat sila sa GPT-5 mini, isang mas maliit ngunit may mataas na kakayahan na modelo.
- Plus Users: Maaaring gamitin ang GPT-5 bilang kanilang default na modelo na may "mas mataas na paggamit kaysa sa mga libreng user."
- Mga Pro subscriber: Makatanggap ng walang limitasyong access sa karaniwang modelo ng GPT-5 at eksklusibong access sa top-tier na GPT-5 Pro.
Mga Customer ng Team, Enterprise, at Edu: Binibigyan ng "mapagbigay na limitasyon" na idinisenyo upang suportahan ang pag-aampon sa buong organisasyon.
Sa konklusyon, ang paglulunsad ng GPT-5 ay kumakatawan sa isang multi-faceted evolution para sa mga alok ng AI ng kumpanya. Ang anunsyo ay higit na nakatuon sa holistic na karanasan ng user, diskarte sa produkto, at pangako sa kaligtasan gaya ng ginagawa nito sa pinagbabatayan na teknolohikal na lakas-kabayo. Sa pamamagitan ng pag-iisa sa lineup ng modelo nito, pag-iinvest nang malaki sa isang "Trust Stack," at paglikha ng isang premium na tier batay sa pagiging maaasahan, ang kumpanya ay nagpapahiwatig ng isang madiskarteng pagtulak tungo sa isang mas mature, collaborative, at komersyal na matatag na AI ecosystem.