OpenAI o3-mini:為 STEM 和開發人員提供更快、更智慧的 AI

2025 年 2 月 5 日

OpenAI 推出了其推理系列的最新模型 o3-mini,旨在在 STEM 領域、軟體工程和邏輯問題解決方面提供卓越的效能。與其前身 OpenAI o1-mini 相比,此版本透過保持低成本並提高速度和準確性來增強 AI 的可近性。

o3-mini 於 2024 年 12 月發布預覽版,現已正式在聊天和 API 服務中推出。它擁有更強大的推理能力,非常適合科學、技術、工程和數學 (STEM) 領域的任務。開發者可以利用其函數呼叫、結構化輸出和開發者訊息,從而確保更高的靈活性和可立即投入生產的應用程式。

增強的功能和輔助功能

OpenAI o3-mini 最受期待的更新之一是它支援各種推理工作級別,讓使用者可以根據需要優化模型的速度或複雜性。這些模式包括:

  • 低推理工作量:優先考慮速度,盡量減少計算成本。
  • 中等推理努力:平衡準確度和反應時間。
  • 高推理努力:最大限度地發揮複雜任務的智慧。

與 OpenAI o1-mini 不同,o3-mini 引入了結構化搜尋功能,使用戶能夠透過相關的網路資源存取最新資訊。此外,它還將 Chat Plus 和 Team 用戶的訊息發送限制提高了三倍,從每天 50 條訊息增加到 150 條,從而提高了頻繁用戶的可訪問性。

OpenAI 首次在 Chat 中向免費用戶開放了推理模型,讓用戶透過在訊息編寫器中選擇「推理」選項來體驗 AI 輔助的邏輯問題解決。

性能基準:超越之前的型號

OpenAI o3-mini 超越了它的前身, o1-迷你在不同 科學和數學基準:

數學與編碼

  • 數學推理: 在準確度上與 OpenAI o1 相匹配,同時提供更快的回應時間。
  • 競賽數學(AIME 2024): 以較高的推理努力超越o1-mini。
  • Codeforces 競賽程式設計: 實現更高 Elo 分數 跨越推理努力程度。
  • 軟體工程(SWE-Bench): 超越先前的模型,展現出人工智慧輔助軟體開發的最佳成果。

先進的科學知識

  • 博士級科學問題(GPQA Diamond): 在生物學、化學和物理學方面表現出色,達到接近 OpenAI o1 的性能水準。
  • 研究級數學(FrontierMath):Python 工具集成,o3-mini 成功解決 超過 32% 的問題,包括 28% 最具挑戰性(T3)的問題.

常識與人類偏好

  • 評估顯示 與 o56-mini 相比,o3-mini 的反應偏好度為 1%.
  • 減少 重大錯誤減少 39%,提高可靠性cult 現實世界的問題。

速度和效率的提升

OpenAI o3-mini 做出回應 比 o24-mini 快 1%,減少 平均反應時間從 10.16 秒縮短至 7.7 秒。在延遲測試中,o3-mini 保持 第一個令牌的取得時間縮短了 2,500 毫秒,確保更快、更流暢的互動。

安全性增強和道德的人工智慧發展

OpenAI 已整合審慎對齊技術,以確保 o3-mini 產生安全、符合人性化的回應。大量測試表明,o3-mini 在安全評估中顯著超越 GPT-4o,成為 OpenAI 在防止濫用和越獄漏洞方面最強大的模型之一。

OpenAI透過外部紅隊測試和系統性安全評估,在優化AI智慧的同時不斷降低風險。最新的系統卡提供了對不允許的內容評估和安全協議的見解。

OpenAI 的下一步是什麼?

憑藉o3-mini,OpenAI在使先進的AI推理更易於訪問和更具成本效益方面又邁出了重要一步。該模型符合公司持續的使命,即降低每個代幣的定價,同時保持頂級推理能力。

隨著人工智慧的應用不斷擴大,OpenAI 始終致力於突破智慧、高效和安全的人工智慧模型的界限,確保企業、開發者和學生能夠利用人工智慧來解決問題、進行創新和研究。

從今天起,o3-mini 可供 Chat Plus、Team 和 Pro 用戶使用,企業版將於 2 月推出。 API 存取權限將授予 3-5 級的指定開發者。

對於那些希望在 STEM 和軟體開發中利用人工智慧力量的人來說,OpenAI o3-mini 帶來了令人興奮的飛躍。