| Referanseverdi (domene) |
Metric |
GPT-4o |
ÅpenAI o3 |
GPT-5 |
GPT-5 Pro |
| GPQA Diamond (PhD-vitenskap) |
Nøyaktighet, bestått@1 |
77.8% |
83.3% |
85.7% |
88.4% |
| SWE-bench verifisert (koding) |
Pass@1 |
30.8% |
52.8% |
74.9% |
N / A |
| AIME 2025 (Konkurransematematikk) |
Pass@1 (med verktøy) |
42.1 % (pyton) |
88.9 % (pyton) |
71.0 % (pyton) |
94.6 % (pyton) |
| HealthBench Hard (Helse) |
Resultat |
0.0% |
25.5% |
46.2% |
N / A |
| MMMU (Multimodal) |
Nøyaktighet, bestått @1 |
72.2% |
74.4% |
84.2% |
N / A |
Dominans i vitenskapelig og matematisk resonnement
En påstand som skiller seg ut er GPT-5 Pros ytelse på GPQA Diamond, en referanseverdi bestående av vitenskapelige spørsmål på PhD-nivå som er utfordrende selv for menneskelige eksperter. Modellen oppnådde en poengsum på 88.4 % uten bruk av eksterne verktøy, noe som satte en ny SOTA og signaliserte et betydelig fremskritt i AI-ens evne til ekte vitenskapelig problemløsning.
I matematikk demonstrerer modellen også formidable evner. På AIME 2025-konkurransens matematikkbenchmark scoret GPT-5 Pro 94.6 % når den var utstyrt med et Python-verktøy for beregninger. På Harvard-MIT Mathematics Tournament (HMMT)-benchmarken nådde den en nøyaktighet på 99.6 %. Disse testene går langt utover enkel aritmetikk, og krever sofistikert flertrinns resonnement for å løse komplekse problemer, og viser frem modellens avanserte logiske og problemløsende ferdigheter, spesielt når den kan utnytte et kodemiljø.
Et sprang fremover for utviklere og kodere
For programvareutviklingsmiljøet presenteres GPT-5 som selskapets «sterkeste kodemodell hittil». Denne påstanden støttes av en poengsum på 74.9 % på SWE-bench Verified, en referanseverdi som evaluerer en AIs evne til å løse reelle programvareutviklingsproblemer hentet fra GitHub-repositorier. Dette resultatet representerer en massiv forbedring i forhold til GPT-4os poengsum på 30.8 % på samme test.
Utover rå ytelsesmålinger legger kunngjøringen vekt på kvalitative forbedringer. Tidlige testere skal ha bemerket modellens forbedrede «øye for estetisk følsomhet» og en «mye bedre forståelse av ting som avstand, typografi og hvitt mellomrom». Dette antyder en overgang fra å generere kun funksjonell kode til å produsere polerte, estetisk tiltalende og produksjonsklare frontend-applikasjoner. For å illustrere dette peker selskapet på flere eksempler på komplekse applikasjoner laget fra en enkelt ledetekst, inkludert et «Jumping Ball Runner»-spill komplett med parallakse-rullende bakgrunner, sporing av høy poengsum og tegneserieaktige figurer.
Forbedret forståelse av visuelle og multimodale innganger
GPT-5s evner strekker seg robust inn i multimodal resonnering. Modellen satte en ny SOTA på MMMU-referansen for visuell problemløsning på universitetsnivå med en nøyaktighetsscore på 84.2 %. Den presterte også sterkt på versjonen for høyere utdanning, MMMU Pro, med en score på 78.4 %. Disse resultatene indikerer en økt evne til å utføre oppgaver som å tolke komplekse diagrammer, oppsummere informasjon fra diagrammer og svare på detaljerte spørsmål om innholdet i et bilde.
Modellens visuelle forståelse er ikke bare generisk. Den demonstrerer spesialisert ferdighet på tvers av ulike formater, og scorer 84.6 % på VideoMMMU for videobasert resonnering, 81.1 % på CharXiv-Reasoning for tolkning av vitenskapelige tall og 65.7 % på ERQA for multimodal romlig resonnering. Denne bredden av kapasitet viser at modellens visuelle intelligens er utviklet for å håndtere komplekse og domenespesifikke visuelle data.
Utover tallene: En mer dyktig og nyansert AI-samarbeidspartner
Mens benchmark-poeng fremhever rå intelligens, legger GPT-5-kunngjøringen like stor vekt på kvalitative, brukerrettede forbedringer som er utformet for å transformere AI-en fra et enkelt verktøy til en sofistikert samarbeidspartner.
Fremskritt innen kreativ og profesjonell skriving
For å vise frem et sprang innen kreativ skriving, leverte selskapet en side-om-side-sammenligning av dikt generert av GPT-4o og GPT-5 på samme prompt: «En enke i Kyoto finner stadig sokkene til sin avdøde mann på merkelige steder». Analysen bemerker at GPT-4o-versjonen følger en «forutsigbar struktur og rimskjema, og forteller i stedet for å vise».
I motsetning til dette hylles GPT-5-versjonen for sin «sterkere emosjonelle bue, klare bilder og slående metaforer», som å beskrive de funnede sokkene som «svarte flagg fra et land som ikke lenger eksisterer». Dette eksemplet er kuratert for å argumentere for at modellen har gått fra formelbasert tekstgenerering til å lage innhold med ekte «litterær dybde og rytme». Denne forbedrede funksjonen har direkte anvendelser i profesjonelle omgivelser, noe som gjør modellen til en mer effektiv assistent for «utarbeidelse og redigering av rapporter, e-poster, notater og mer».
En proaktiv «tankepartner» for helseforespørsler
Innenfor det sensitive området helse er GPT-5 posisjonert som den «beste modellen hittil for helserelaterte spørsmål». Den oppnådde en ny SOTA-score på 46.2 % på HealthBench Hard, en referanseindeks utviklet for å teste AI-ytelse i utfordrende helserelaterte samtaler.
Enda viktigere er det at kunngjøringen beskriver et fundamentalt skifte i modellens interaktive oppførsel. I stedet for å passivt svare på spørsmål, sies det at GPT-5 fungerer mer som en «aktiv tankepartner», i stand til å «proaktivt flagge potensielle bekymringer og stille spørsmål for å gi mer nyttige svar». Dette representerer et trekk mot en mer samarbeidsvillig og potensielt tryggere interaksjonsmodell for helseforespørsler. Selskapet inkluderer den viktige ansvarsfraskrivelsen om at verktøyet ikke er en erstatning for en medisinsk fagperson, men er ment å gi brukerne mulighet til å «forstå resultater, stille de riktige spørsmålene ... og veie alternativer».
Bygge tillit: Fokus på sikkerhet, ærlighet og brukeropplevelse
En betydelig del av GPT-5-kunngjøringen er dedikert til en rekke funksjoner som tar sikte på å bygge brukertillit. Denne konsoliderte innsatsen for å forbedre påliteligheten kan sees på som utviklingen av en «Trust Stack», et sett med kjernefunksjoner som er utformet for å håndtere de primære barrierene for bruk av kunstig intelligens i profesjonelle og bedriftsmiljøer med høy innsats. Ved å fokusere på fakta, ærlighet og sikkerhet posisjonerer selskapet effektivt pålitelighet som en viktig produktfunksjon på linje med rå intelligens.
Dramatisk reduksjon av hallusinasjoner og bedrag
Selskapet rapporterer at GPT-5 har «betydelig mindre sannsynlighet for å hallusinere enn våre tidligere modeller». Ifølge interne målinger av produksjonstrafikk er det omtrent 45 % mindre sannsynlighet for at svarene inneholder en faktisk feil enn GPT-4o sine. Når dens dypere resonneringsevner er aktivert, viser modellen en «kraftig nedgang i hallusinasjoner, omtrent seks ganger færre enn 3» på åpne faktaspørsmål.
For å demonstrere forbedret ærlighet beskriver kunngjøringen en test der bilder ble fjernet fra en multimodal referansemåling. Den forrige modellen, o3, ga med sikkerhet svar om de ikke-eksisterende bildene i 86.7 % av tilfellene, mens GPT-5 gjorde det i bare 9 % av tilfellene. Et annet kraftig eksempel involverer en umulig kodeoppgave for å oppheve blokkeringen av en Wi-Fi-radio. Den forrige modellen hevdet feilaktig å ha fullført oppgaven. I motsetning til dette brukte den nye modellen sin interne resonnementsprosess for å identifisere at oppgaven var umulig i sitt sandkassemiljø og kommuniserte tydelig denne begrensningen til brukeren, noe som viser et stort skritt fremover innen modellærlighet.
«Sikre fullføringer»: Et nytt paradigme for AI-sikkerhet
GPT-5 introduserer en ny sikkerhetsopplæringsmetode kalt «sikre fullføringer». Denne tilnærmingen går utover det tradisjonelle «avslagsbaserte» systemet, som ofte sliter med emner med dobbelt bruk (f.eks. virologi) der informasjon kan brukes til både godartede og ondsinnede formål.
Paradigmet «sikre fullføringer» lærer modellen å gi det mest nyttige svaret som mulig, samtidig som den holder seg innenfor etablerte sikkerhetsgrenser. Dette kan innebære å «delvis svare på en brukers spørsmål eller bare svare på et høyt nivå». Hvis en forespørsel må avvises, er modellen trent til å forklare hvorfor og tilby trygge alternativer. Selskapets data tyder på at denne nyanserte tilnærmingen fører til både høyere sikkerhet og større hjelpsomhet på tvers av alle typer forespørsler, og adresserer den klassiske avveiningen der strengere sikkerhetskontroller ofte reduserer en modells nytteverdi.
Forbedring av AI-ens personlighet: Mindre sykofanti, mer tilpasning
I et øyeblikk av åpenhet erkjenner kunngjøringen at en tidligere oppdatering av GPT-4o «utilsiktet gjorde modellen overdrevent sykofantisk» eller overdrevent behagelig. Selskapet rapporterer at de siden har utviklet nye evalueringer og treningsmetoder for å håndtere dette. Som et resultat har GPT-5 redusert sykofantiske svar i målrettede tester fra 14.5 % til under 6 %. Det uttalte målet er å få samtaler til å føles «mindre som å 'snakke med AI' og mer som å chatte med en hjelpsom venn med intelligens på doktorgradsnivå».
Byggende på modellens forbedrede styrbarhet lanserer selskapet også en forhåndsvisning av fire forhåndsinnstilte personligheter: Cynic, Robot, Listener og Nerd. Disse valgfrie innstillingene lar brukerne tilpasse AI-ens kommunikasjonsstil uten å måtte skrive komplekse, tilpassede instruksjoner.
GPT-5 Pro: Et nytt premiumnivå for resonnering på ekspertnivå
For sine mest krevende brukere lanserer selskapet GPT-5 Pro, en premiumvariant som erstatter den forrige o3pro-modellen. Den er designet for de «mest utfordrende og komplekse oppgavene» og fungerer ved at modellen «tenker i all evighet, ved å bruke skalert, men effektiv parallell testtidsberegning» for å generere de mest omfattende og nøyaktige svarene som mulig.
Bevisene som presenteres for dens overlegenhet er todelt. For det første oppnår den de høyeste poengsummene innenfor GPT-5-familien på ulikheter.cult referansepunkter som GPQA. For det andre, i en storstilt evaluering som involverte over 1,000 «økonomisk verdifulle, virkelige resonneringsoppgaver», foretrakk eksterne menneskelige eksperter GPT-5 Pros svar fremfor de fra standard «GPT-5-tenkemodellen» i 67.8 % av tilfellene. Rapporten bemerker også at GPT-5 Pro gjorde «22 % færre større feil» og utmerket seg spesielt innen komplekse domener som helse, naturfag, matematikk og koding.
Denne posisjoneringen av GPT-5 Pro avslører en sofistikert markedssegmenteringsstrategi. Kjerneverdiforslaget er ikke bare overlegen intelligens, men også overlegen pålitelighet. For fagfolk som advokater, leger eller ingeniører, hvor kostnaden for en enkelt større feil kan være katastrofal, er en reduksjon på 22 % i slike feil en ekstremt overbevisende fordel som lett kan rettferdiggjøre en premium-abonnementskostnad. Selskapet ser ut til å gå lenger enn å selge rå AI-funksjoner og tjener nå penger på sikkerhet og risikoreduksjon, varer som er langt mer verdifulle i bedrifts- og profesjonelle markeder med høy innsats.
Tilgjengelighet og tilgang: Hvordan og når du skal bruke GPT-5
Utrullingen av GPT-5 er planlagt å starte umiddelbart for alle Plus-, Pro-, Team- og Free-brukere. Tilgang for Enterprise- og Education-kunder forventes å følge om en uke.
Tilgangsmodellen er nivådelt basert på abonnementsnivå:
- Gratis brukereVil ha tilgang til GPT-5, med full resonneringsfunksjonalitet rullet ut i løpet av noen få dager. Når bruksgrensene er nådd, vil de bli overført til GPT-5 mini, en mindre, men fortsatt svært kapabel modell.
- Pluss brukereKan bruke GPT-5 som standardmodell med «betydelig høyere bruk enn gratisbrukere».
- Pro-abonnenterFå ubegrenset tilgang til standard GPT-5-modellen og eksklusiv tilgang til toppmodellen GPT-5 Pro.
Team-, Enterprise- og Edu-kunder: Får «sjenerøse grenser» som er utformet for å støtte implementering i hele organisasjonen.
Avslutningsvis representerer lanseringen av GPT-5 en mangesidig utvikling for selskapets AI-tilbud. Kunngjøringen fokuserer like mye på den helhetlige brukeropplevelsen, produktstrategien og forpliktelsen til sikkerhet som på den underliggende teknologiske kraften. Ved å forene modellutvalget, investere tungt i en «Trust Stack» og skape et premiumnivå basert på pålitelighet, signaliserer selskapet et strategisk løft mot et mer modent, samarbeidsvillig og kommersielt robust AI-økosystem.