Inilabas ng OpenAI ang o3-mini, ang pinakabagong modelo sa serye ng pangangatwiran nito, na idinisenyo upang maghatid ng pambihirang pagganap sa mga larangan ng STEM, software engineering, at lohikal na paglutas ng problema. Pinahuhusay ng release na ito ang AI accessibility sa pamamagitan ng pagpapanatili ng mababang gastos habang pinapabuti ang bilis at katumpakan kumpara sa hinalinhan nito, ang OpenAI o1-mini.
Pagkatapos ma-preview noong Disyembre 2024, ang o3-mini ay opisyal na ngayong available sa mga serbisyo ng Chat at API. Nag-aalok ito ng mas mataas na kapasidad sa pangangatwiran, na ginagawa itong perpekto para sa mga gawain sa agham, teknolohiya, engineering, at matematika (STEM). Maaaring gamitin ng mga developer ang function calling nito, mga structured na output, at mga mensahe ng developer, na tinitiyak ang higit na kakayahang umangkop at mga application na handa sa produksyon.
Pinahusay na Mga Tampok at Accessibility
Isa sa mga pinaka-inaasahang update sa OpenAI o3-mini ay ang suporta nito para sa iba't ibang antas ng pagsisikap sa pangangatwiran, na nagpapahintulot sa mga user na i-optimize ang modelo para sa bilis o pagiging kumplikado batay sa kanilang mga pangangailangan. Kasama sa mga mode na ito ang:
- Mababang Pagsisikap sa Pangangatwiran: Inuuna ang bilis na may kaunting gastos sa pag-compute.
- Katamtamang Pagsisikap sa Pangangatuwiran: Binabalanse ang katumpakan at oras ng pagtugon.
- High Reasoning Effort: Pina-maximize ang katalinuhan para sa mga kumplikadong gawain.
Hindi tulad ng OpenAI o1-mini, ang o3-mini ay nagpapakilala ng mga structured na kakayahan sa paghahanap, na nagbibigay-daan sa mga user na ma-access ang napapanahong impormasyon gamit ang mga nauugnay na web source. Bukod pa rito, triple nito ang mga limitasyon ng mensahe para sa mga user ng Chat Plus at Team, mula 50 hanggang 150 na mensahe bawat araw, na nagpapahusay sa pagiging naa-access para sa mga madalas na user.
Sa unang pagkakataon, ginawa ng OpenAI ang isang modelo ng pangangatwiran na magagamit sa mga free-tier na user sa Chat, na nagpapahintulot sa kanila na maranasan ang lohikal na paglutas ng problema na tinulungan ng AI sa pamamagitan ng pagpili sa opsyong "Dahilan" sa kompositor ng mensahe.
Mga Benchmark sa Pagganap: Mahusay na Mga Nakaraang Modelo
Nahigitan ng OpenAI o3-mini ang hinalinhan nito, o1-mini, sa iba't-ibang mga benchmark na pang-agham at matematika:
Matematika at Coding
- Pangangatwiran sa Matematika: Tumutugma sa OpenAI o1 sa katumpakan habang nag-aalok ng mas mabilis na mga oras ng pagtugon.
- Competition Math (AIME 2024): Outperforms o1-mini na may mataas na pagsisikap sa pangangatwiran.
- Codeforces Competitive Programming: Nakakamit ng mas mataas Naka-score si Elo sa mga antas ng pagsisikap sa pangangatwiran.
- Software Engineering (SWE-Bench): Nahigitan ang mga nakaraang modelo, na nagpapakita ng pinakamahusay na mga resulta sa AI-assisted software development.
Advanced na Kaalaman sa Siyentipiko
- Mga Tanong sa Agham sa Antas ng PhD (GPQA Diamond): Mahusay sa biology, chemistry, at physics, na nakakamit ng mga antas ng pagganap na malapit sa OpenAI o1.
- Research-Level Mathematics (FrontierMath): may Pagsasama ng tool sa Python, matagumpay na nalulutas ang o3-mini higit sa 32% ng mga problema, Kabilang ang 28% ng mga pinaka-mapanghamong (T3) na problema.
Pangkalahatang Kaalaman at Kagustuhan ng Tao
- Ang mga pagsusuri ay nagpapakita ng a 56% na kagustuhan para sa mga o3-mini na tugon kaysa sa o1-mini.
- Binabawasan malalaking pagkakamali ng 39%, pagpapabuti ng pagiging maaasahan sa difficult mga tanong sa totoong mundo.
Mga Pagpapabuti ng Bilis at Kahusayan
Ang OpenAI o3-mini ay naghahatid ng mga tugon 24% na mas mabilis kaysa sa o1-mini, Pagbabawas average na oras ng pagtugon mula 10.16 segundo hanggang 7.7 segundo. Sa mga pagsubok sa latency, pinapanatili ng o3-mini ang a 2,500ms mas mabilis na oras sa unang token, tinitiyak ang mas mabilis at mas tuluy-tuloy na pakikipag-ugnayan.
Mga Pagpapahusay sa Kaligtasan at Pagbuo ng Etikal na AI
Pinagsama ng OpenAI ang mga diskarte sa deliberative alignment upang matiyak na ang o3-mini ay bumubuo ng ligtas, nakahanay sa mga tugon ng tao. Ang malawak na pagsubok ay nagsiwalat na ang o3-mini ay higit na nalampasan ang GPT-4o sa mga pagsusuri sa seguridad, na ginagawa itong isa sa pinakamatatag na modelo ng OpenAI sa pagpigil sa maling paggamit at mga pagsasamantala sa jailbreak.
Sa pamamagitan ng panlabas na red-teaming at sistematikong mga pagsusuri sa kaligtasan, patuloy na pinapagaan ng OpenAI ang mga panganib habang ino-optimize ang AI intelligence. Ang pinakabagong system card ay nagbibigay ng mga insight sa hindi pinapayagang mga pagsusuri sa nilalaman at mga protocol sa kaligtasan.
Ano ang Susunod para sa OpenAI?
Sa o3-mini, ang OpenAI ay gumawa ng isa pang makabuluhang hakbang tungo sa paggawa ng advanced na pangangatwiran ng AI na mas naa-access at cost-effective. Ang modelong ito ay umaayon sa patuloy na misyon ng kumpanya na bawasan ang per-token na pagpepresyo habang pinapanatili ang top-tier na mga kakayahan sa pangangatwiran.
Habang lumalawak ang pag-ampon ng AI, nananatiling nakatuon ang OpenAI na itulak ang mga hangganan ng matalino, mahusay, at ligtas na mga modelo ng AI, na tinitiyak na ang mga negosyo, developer, at mag-aaral ay maaaring magamit ang AI para sa paglutas ng problema, pagbabago, at pananaliksik.
Simula ngayon, available na ang o3-mini para sa mga user ng Chat Plus, Team, at Pro, na ilulunsad ang Enterprise access sa Pebrero. Binibigyan ng access sa API ang mga piling developer sa tier 3-5.
Para sa mga naghahanap upang gamitin ang kapangyarihan ng AI sa STEM at software development, ang OpenAI o3-mini ay nagpapakita ng isang kapana-panabik na hakbang pasulong.