| 基準(域) |
公制 |
GPT-4o |
OpenAI o3 |
GPT-5 |
GPT-5 專業版 |
| GPQA 鑽石(理學博士) |
準確率,透過@1 |
|
|
|
|
| SWE-bench 驗證(編碼) |
通行證@1 |
|
|
|
不適用 |
| AIME 2025(競賽數學) |
Pass@1(含工具) |
42.1%(蟒蛇) |
88.9%(蟒蛇) |
71.0%(蟒蛇) |
94.6%(蟒蛇) |
| HealthBench Hard(健康) |
總分 |
|
|
|
不適用 |
| MMMU(多模態) |
準確率,透過@1 |
|
|
|
不適用 |
科學和數學推理的優勢
GPT-5 Pro 在 GPQA Diamond 上的表現尤其突出。 GPQA Diamond 是一項基準測試,由博士級的科學問題組成,即使對人類專家來說也相當具有挑戰性。該模型在不使用外部工具的情況下獲得了 88.4% 的準確率,創下了新的 SOTA,標誌著人工智慧在解決真正科學問題的能力方面取得了顯著進步。
在數學方面,該模型也展現出強大的能力。在 AIME 2025 競賽數學基準測試中,GPT-5 Pro 在配備 Python 計算工具的情況下得分高達 94.6%。在哈佛-麻省理工學院數學錦標賽 (HMMT) 基準測試中,其準確率高達 99.6%。這些測試遠遠超出了簡單的算術,需要複雜的多步驟推理來解決複雜問題,展現了該模型先進的邏輯和解決問題的能力,尤其是在能夠利用編碼環境的情況下。
開發人員和程式設計師的飛躍
對於軟體開發社群來說,GPT-5 被譽為該公司「迄今為止最強大的編碼模型」。這一說法得到了 SWE-bench Verified 74.9% 的得分的支持。 SWE-bench Verified 是一項基準測試,用於評估 AI 解決來自 GitHub 儲存庫的實際軟體工程問題的能力。這一結果比 GPT-4o 在同一測試中的 30.8% 得分有了顯著提升。
除了原始性能指標外,該公告還強調了品質改進。據報道,早期測試人員注意到該模型增強了“美學感知力”,並且“對間距、排版和留白等方面有了更深入的理解”。這表明,該模型已從單純生成功能性程式碼過渡到能夠生成精緻、美觀且可立即投入生產的前端應用程式。為了說明這一點,該公司列舉了幾個基於單一指令創建的複雜應用程式範例,其中包括一款名為「Jumping Ball Runner」的遊戲,該遊戲擁有視差滾動背景、高分追蹤和卡通人物等功能。
增強對視覺和多模式輸入的理解
GPT-5 的功能已穩健擴展到多模態推理。該模型在 MMMU 大學級視覺問題解決基準上,以 84.2% 的準確率創下了新的 SOTA。它在研究生版本 MMMU Pro 上也表現出色,得分高達 78.4%。這些結果表明,該模型在執行諸如解讀複雜圖表、從圖表中總結資訊以及回答有關圖像內容的詳細問題等任務方面的能力得到了提升。
此模型的視覺理解能力並非泛泛而談。它展現了跨不同格式的專業能力,在 VideoMMMU 的視頻推理測試中得分為 84.6%,在 CharXiv-Reasoning 的科學圖表解讀測試中得分為 81.1%,在 ERQA 的多模態空間推理測試中得分為 65.7%。如此廣泛的能力表明,該模型的視覺智慧已發展到能夠處理複雜且特定領域的視覺數據。
超越數位:更強大、更細緻的人工智慧協作者
雖然基準分數突顯了原始智能,但 GPT-5 公告同樣強調定性、以使用者為導向的改進,旨在將人工智慧從簡單的工具轉變為複雜的合作者。
創意寫作和專業寫作的進步
為了展示創意寫作的飛躍,該公司對 GPT-4o 和 GPT-5 針對同一主題生成的詩歌進行了並排比較:「京都的一位寡婦總是在奇怪的地方發現她已故丈夫的襪子」。分析指出,GPT-4o 版本遵循「可預測的結構和押韻格式,講述而不是展示」。
相較之下,GPT-5 版本因其「更強烈的情感弧線、清晰的意象和引人注目的隱喻」而備受讚譽,例如將找到的襪子描述為「一個已不復存在的國家的黑旗」。這個例子旨在表明,該模型已經從公式化的文本生成發展到能夠創造出真正具有「文學深度和節奏」的內容。這種增強的功能可直接應用於專業領域,使該模型成為「起草和編輯報告、電子郵件、備忘錄等」的更有效助手。
積極主動的健康諮詢“思想夥伴”
在敏感的健康領域,GPT-5 被定位為「迄今為止解決健康相關問題的最佳模型」。它在 HealthBench Hard 上取得了 46.2% 的新 SOTA 分數,該基準旨在測試 AI 在具有挑戰性的健康相關對話中的表現。
更重要的是,該聲明描述了該模型交互行為的根本性轉變。 GPT-5 不再被動地回答問題,而是更像一個“積極的思考夥伴”,能夠“主動標記潛在問題並提出問題以提供更有幫助的答案”。這代表著健康諮詢正朝著更具協作性、可能更安全的健康諮詢互動模式邁進。該公司還包含一項重要的免責聲明:該工具並非醫療專業人員的替代品,而是旨在幫助用戶「理解結果、提出正確的問題…並權衡各種選擇」。
建立信任:注重安全、誠實和使用者體驗
GPT-5 公告的很大一部分內容致力於一系列旨在建立使用者信任的功能。這項旨在提升可靠性的整合工作可以被視為「信任堆疊」的開發,這套核心功能旨在解決在高風險的專業和企業環境中應用 AI 的主要障礙。透過專注於真實性、誠實性和安全性,該公司有效地將可信度定位為與原始智慧同等重要的關鍵產品特性。
大幅減少幻覺和欺騙
該公司報告稱,GPT-5「與我們之前的模型相比,產生幻覺的可能性顯著降低」。根據對生產流量的內部測量,其回應包含事實錯誤的可能性比GPT-45o低約4%。當其更深層的推理能力發揮作用時,該模型在開放式事實提示中「幻覺出現率急劇下降,大約比o3少六倍」。
為了證明其可靠性的提升,公告詳細介紹了一項測試,該測試將影像從多模態基準測試中移除。先前的模型 o3 能夠自信地給出關於不存在圖像的答案,準確率高達 86.7%,而 GPT-5 的準確率僅為 9%。另一個有力的例子是解鎖 Wi-Fi 無線電這項不可能的程式設計任務。先前的模型錯誤地聲稱自己已經完成了這項任務。相較之下,新模型利用其內部推理過程識別出該任務在其沙盒環境中無法完成,並清楚地向用戶傳達了這一限制,展現了模型可靠性的重大進步。
「安全完井」:人工智慧安全的新典範
GPT-5 引進了一種名為「安全完成」的新安全訓練方法。這種方法超越了傳統的「基於拒絕」的系統,後者通常在處理雙重用途主題(例如病毒學)時遇到困難,因為這些主題中的資訊既可用於良性目的,也可用於惡意目的。
「安全完成」典範教導模式在既定的安全界線內提供盡可能最有幫助的答案。這可能涉及「部分回答使用者的問題或僅在較高層面上回答」。如果必須拒絕某個要求,模型會經過訓練來解釋拒絕原因並提供安全的替代方案。該公司的數據表明,這種細緻入微的方法能夠在所有類型的提示中同時提高安全性和實用性,從而解決了經典的權衡問題:更嚴格的安全控制通常會降低模型的效用。
完善人工智慧的個性:減少諂媚,增加個人化
為公開透明起見,該公告承認,GPT-4o 的先前更新「無意中使模型變得過於奉承」或過度討好。該公司報告稱,此後已開發了新的評估和訓練方法來解決這個問題。因此,GPT-5 在針對性測試中將奉承回复的比例從 14.5% 降低到 6% 以下。其目標是讓對話“不再像‘與人工智慧對話’,而更像是與一位擁有博士級智力的樂於助人的朋友聊天”。
基於模型改進的可操控性,該公司還推出了四種預設性格的研究預覽:憤世嫉俗者、機器人、傾聽者和書呆子。這些可選設定允許用戶自訂AI的溝通風格,而無需編寫複雜的自訂指令。
GPT-5 Pro:專家級推理的全新高階層級
為了滿足最嚴苛的用戶需求,該公司推出了 GPT-5 Pro,這是一款高級版本,將取代先前的 o3pro 型號。它專為“最具挑戰性、最複雜的任務”而設計,其工作原理是讓模型“使用可擴展但高效的並行測試時間計算進行更長時間的思考”,從而產生盡可能全面、準確的答案。
其優越性的證據有兩方面。首先,它在 GPT-5 系列中獲得了最高分,cult GPQA 等基準測試結果顯示,GPT-1,000 Pro 的表現優於 GPQA。其次,在一項涉及 5 多個「具有經濟價值的現實世界推理題」的大規模評估中,外部人類專家 5% 的答案優於標準「GPT-67.8 思維」模型。報告還指出,GPT-5 Pro 的“重大錯誤減少了 22%”,並且在健康、科學、數學和程式設計等複雜領域表現尤為出色。
GPT-5 Pro 的定位體現了其精妙的市場區隔策略。其核心價值主張不僅在於卓越的智能,更在於卓越的可靠性。對於律師、醫生或工程師等專業人士而言,單一重大錯誤的代價可能帶來災難性的後果,而將此類錯誤減少 22% 則是一項極具吸引力的優勢,足以證明其高級訂閱費用的合理性。該公司似乎不再僅僅銷售原始的 AI 功能,而是開始將確定性和風險降低轉化為現實,而這些在高風險企業和專業市場中的價值遠高於其他產品。
可用性和存取:如何以及何時使用 GPT-5
GPT-5 計畫立即向所有 Plus、Pro、Team 和 Free 用戶推出。企業版和教育版用戶預計將在一周內上線。
存取模型根據訂閱層級分層:
- 免費用戶:將可使用 GPT-5,其完整的推理功能將在幾天內推出。一旦達到使用限制,他們將過渡到 GPT-5 mini,這是一個體積更小但仍然強大的型號。
- 加用戶:可以使用 GPT-5 作為其預設模型,且「使用率明顯高於免費用戶」。
- 專業訂閱者:無限制存取標準 GPT-5 模型並獲得頂級 GPT-5 Pro 的獨家存取權。
團隊、企業和教育客戶:享受旨在支持整個組織採用的「寬鬆限制」。
總而言之,GPT-5 的發布代表著該公司 AI 產品線的全方位演進。此次發布不僅注重底層技術實力,也同樣注重整體使用者體驗、產品策略和安全承諾。透過統一產品線、大力投資「信任堆疊」以及基於可靠性打造高端產品,該公司正朝著更成熟、協作性更強、商業化能力更強的 AI 生態系統邁進。