OpenAI ha presentato o3-mini, l'ultimo modello della sua serie di ragionamento, progettato per offrire prestazioni eccezionali nei campi STEM, ingegneria del software e risoluzione di problemi logici. Questa versione migliora l'accessibilità dell'IA mantenendo bassi i costi e migliorando velocità e accuratezza rispetto al suo predecessore, OpenAI o1-mini.
Dopo l'anteprima di dicembre 2024, o3-mini è ora ufficialmente disponibile nei servizi Chat e API. Offre una maggiore capacità di ragionamento, rendendolo ideale per attività in ambito scientifico, tecnologico, ingegneristico e matematico (STEM). Gli sviluppatori possono sfruttare le sue chiamate di funzione, gli output strutturati e i messaggi per gli sviluppatori, garantendo maggiore flessibilità e applicazioni pronte per la produzione.
Funzionalità e accessibilità migliorate
Uno degli aggiornamenti più attesi di OpenAI o3-mini è il suo supporto per vari livelli di sforzo di ragionamento, consentendo agli utenti di ottimizzare il modello per velocità o complessità in base alle proprie esigenze. Queste modalità includono:
- Basso sforzo di ragionamento: dà priorità alla velocità con un costo computazionale minimo.
- Sforzo di ragionamento medio: bilancia accuratezza e tempo di risposta.
- Elevato sforzo di ragionamento: massimizza l'intelligenza per compiti complessi.
A differenza di OpenAI o1-mini, o3-mini introduce funzionalità di ricerca strutturata, consentendo agli utenti di accedere a informazioni aggiornate tramite fonti web pertinenti. Inoltre, triplica il limite di messaggi per gli utenti di Chat Plus e Team, da 50 a 150 messaggi al giorno, migliorando l'accessibilità per gli utenti più assidui.
Per la prima volta, OpenAI ha reso disponibile un modello di ragionamento agli utenti del livello gratuito in Chat, consentendo loro di sperimentare la risoluzione di problemi logici assistita dall'intelligenza artificiale selezionando l'opzione "Motivo" nel compositore di messaggi.
Benchmark delle prestazioni: surclassare i modelli precedenti
OpenAI o3-mini supera il suo predecessore, o1-mini, in vari parametri scientifici e matematici:
Matematica e Codifica
- Ragionamento matematico: Equivale a OpenAI o1 in termini di precisione, offrendo al contempo tempi di risposta più rapidi.
- Matematica competitiva (AIME 2024): Supera o1-mini con un elevato sforzo di ragionamento.
- Programmazione competitiva di Codeforces: Raggiunge risultati più elevati Punteggi Elo attraverso i vari livelli di sforzo di ragionamento.
- Ingegneria del software (SWE-Bench): Supera i modelli precedenti, dimostrando i migliori risultati nello sviluppo di software assistito dall'intelligenza artificiale.
Conoscenze scientifiche avanzate
- Domande scientifiche di livello dottorale (GPQA Diamond): Eccelle in biologia, chimica e fisica, raggiungendo livelli di prestazioni prossimi a OpenAI o1.
- Matematica di livello di ricerca (FrontierMath): Con Integrazione degli strumenti Python, o3-mini risolve con successo oltre il 32% dei problemi, di cui Il 28% dei problemi più impegnativi (T3).
Conoscenze generali e preferenze umane
- Le valutazioni mostrano un Preferenza del 56% per le risposte o3-mini rispetto a o1-mini.
- Riduce errori gravi del 39%, migliorando l'affidabilità su difficult domande del mondo reale.
Miglioramenti di velocità ed efficienza
OpenAI o3-mini fornisce risposte 24% più veloce di o1-mini, Riducendo tempi di risposta medi da 10.16 secondi a 7.7 secondiNei test di latenza, o3-mini mantiene un Tempo di 2,500 ms più veloce per il primo token, garantendo interazioni più rapide e fluide.
Miglioramenti della sicurezza e sviluppo etico dell'intelligenza artificiale
OpenAI ha integrato tecniche di allineamento deliberativo per garantire che o3-mini generi risposte sicure e allineate all'uomo. Test approfonditi hanno rivelato che o3-mini supera significativamente GPT-4o nelle valutazioni di sicurezza, rendendolo uno dei modelli più robusti di OpenAI nella prevenzione di abusi ed exploit di jailbreak.
Attraverso il red-teaming esterno e le valutazioni sistematiche della sicurezza, OpenAI continua a mitigare i rischi ottimizzando al contempo l'intelligenza dell'IA. L'ultima scheda di sistema fornisce approfondimenti sulle valutazioni dei contenuti non consentiti e sui protocolli di sicurezza.
Quale sarà il futuro di OpenAI?
Con o3-mini, OpenAI ha compiuto un altro passo significativo verso la creazione di un ragionamento AI avanzato più accessibile e conveniente. Questo modello è in linea con la missione aziendale in corso di riduzione dei prezzi per token, mantenendo al contempo capacità di ragionamento di alto livello.
Con l'espansione dell'adozione dell'intelligenza artificiale, OpenAI continua a impegnarsi a superare i confini dei modelli di intelligenza artificiale intelligenti, efficienti e sicuri, garantendo che aziende, sviluppatori e studenti possano sfruttare l'intelligenza artificiale per la risoluzione dei problemi, l'innovazione e la ricerca.
A partire da oggi, o3-mini è disponibile per gli utenti Chat Plus, Team e Pro, mentre l'accesso Enterprise sarà disponibile a febbraio. L'accesso API è concesso a sviluppatori selezionati nei livelli 3-5.
Per chi desidera sfruttare la potenza dell'intelligenza artificiale nello sviluppo di software e nei settori STEM, OpenAI o3-mini rappresenta un entusiasmante passo avanti.