GPT-5 發布:人工智慧智慧與可靠性的新時代

2025 年 8 月 8 日

Chat 背後的公司宣布推出其下一代旗艦模型 GPT-5,此舉旨在重塑人工智慧格局。 GPT-5 被該公司譽為“迄今為止最聰明、最快、最實用的模型”,其定位是性能的重大飛躍,其特點是該公司所謂的“內置思維,讓每個人都能擁有專家級智能”。此次發布標誌著重大的產品整合,GPT-5 將取代一系列先前的模型,包括最近發布的 GPT-4o,以及 OpenAI o3、OpenAI o4-mini。 GPT4.1以及 GPT4.5,適用於所有已登入使用者。

此次發布的核心核心在於三大支柱:旨在動態平衡速度和分析深度的全新統一架構;在科學、程式設計和健康等高風險領域實現卓越性能;以及旨在透過系統性地解決幻覺、欺騙和安全等長期存在的人工智慧挑戰,提升模型可信度的全面改進。此次發布正值人工智慧領域競爭激烈之際,原始運算能力和可證明的可靠性已成為確立市場領導地位的關鍵。

GPT-5

新 Archi結構:GPT-5 的「內建思維」如何運作

的心臟 GPT-5 是一種新穎的「統一系統」架構,它是一個多元件框架,旨在智慧管理運算資源並優化使用者體驗。該系統摒棄了「一刀切」的模式,而是採用動態的方法來解決問題。

該架構由三個協同工作的主要部分組成:

  • 高效能模型:這是系統的前線,旨在快速有效地處理大多數使用者查詢。
  • 更深層的推理模型:被稱為“GPT-5思維”,這個更強大的組件會自動參與解決更困難的問題cult 需要全面分析和多步驟思考過程的問題。
  • 即時路由器:此元件可作為系統的智慧調度器。路由器會分析傳入的提示,評估其複雜性、工具需求和使用者意圖,然後立即將查詢導向到合適的模型(快速且有效率的模型或更深層的推理模型)。使用者也可以使用「仔細思考」之類的語句來明確觸發更深層的模型。

這種架構並非靜態的。公告強調,該路由器建立在一個持續學習循環之上,透過對真實世界訊號進行訓練,不斷改進其決策能力。這些訊號包括使用者對某些回應的偏好、答案正確性的測量,甚至包括使用者手動切換模型的情況,使系統能夠隨著時間的推移不斷完善其路由邏輯。

這種架構選擇代表著一項重大的策略決策。在現今的市場中,使用者常常面對著琳瑯滿目的AI模型,每個模型都針對速度、效能或特定模式進行了最佳化,而這個統一的系統則簡化了這種複雜性。透過以一個智慧介面取代先前五種截然不同的模型,該公司旨在提供一款更無縫銜接、直覺易用的產品。其目標是提供一個「即用即用」的系統,自動選擇最適合工作的工具,而無需使用者的技術專業知識。這種對產品簡化的關注,可以透過降低進入門檻和減少用戶摩擦,帶來顯著的競爭優勢。

此外,路由器從海量用戶互動中學習的能力,創造了一個強大的自我改進循環。隨著越來越多的人使用 GPT-5,路由器會收集更多關於高品質、高效回應的資料。這些數據用於使路由器更聰明地分配運算資源,從而提高答案的品質和速度。這種增強的體驗可能會吸引和留住更多用戶,從而產生更多數據來充實學習循環。這種機制有效地將公司龐大的用戶群轉化為策略資產,在效能和營運效率方面創造複合優勢,而這可能難以實現。cult 以供競爭對手複製。

設定新基準:GPT-5 在關鍵領域的表現

該公司用大量基準數據佐證了其卓越智能的主張,聲稱 GPT-5 在數學、編碼、多模態理解和健康等多個關鍵領域都達到了新的 SOTA 水平。以下總結的結果旨在展現其相對於 GPT-4o 等先前模型的跨越式發展。

基準(域) 公制 GPT-4o OpenAI o3 GPT-5 GPT-5 專業版
GPQA 鑽石(理學博士) 準確率,透過@1
SWE-bench 驗證(編碼) 通行證@1 不適用
AIME 2025(競賽數學) Pass@1(含工具) 42.1%(蟒蛇) 88.9%(蟒蛇) 71.0%(蟒蛇) 94.6%(蟒蛇)
HealthBench Hard(健康) 總分 不適用
MMMU(多模態) 準確率,透過@1 不適用

科學和數學推理的優勢

GPT-5 Pro 在 GPQA Diamond 上的表現尤其突出。 GPQA Diamond 是一項基準測試,由博士級的科學問題組成,即使對人類專家來說也相當具有挑戰性。該模型在不使用外部工具的情況下獲得了 88.4% 的準確率,創下了新的 SOTA,標誌著人工智慧在解決真正科學問題的能力方面取得了顯著進步。

在數學方面,該模型也展現出強大的能力。在 AIME 2025 競賽數學基準測試中,GPT-5 Pro 在配備 Python 計算工具的情況下得分高達 94.6%。在哈佛-麻省理工學院數學錦標賽 (HMMT) 基準測試中,其準確率高達 99.6%。這些測試遠遠超出了簡單的算術,需要複雜的多步驟推理來解決複雜問題,展現了該模型先進的邏輯和解決問題的能力,尤其是在能夠利用編碼環境的情況下。

開發人員和程式設計師的飛躍

對於軟體開發社群來說,GPT-5 被譽為該公司「迄今為止最強大的編碼模型」。這一說法得到了 SWE-bench Verified 74.9% 的得分的支持。 SWE-bench Verified 是一項基準測試,用於評估 AI 解決來自 GitHub 儲存庫的實際軟體工程問題的能力。這一結果比 GPT-4o 在同一測試中的 30.8% 得分有了顯著提升。

除了原始性能指標外,該公告還強調了品質改進。據報道,早期測試人員注意到該模型增強了“美學感知力”,並且“對間距、排版和留白等方面有了更深入的理解”。這表明,該模型已從單純生成功能性程式碼過渡到能夠生成精緻、美觀且可立即投入生產的前端應用程式。為了說明這一點,該公司列舉了幾個基於單一指令創建的複雜應用程式範例,其中包括一款名為「Jumping Ball Runner」的遊戲,該遊戲擁有視差滾動背景、高分追蹤和卡通人物等功能。

增強對視覺和多模式輸入的理解

GPT-5 的功能已穩健擴展到多模態推理。該模型在 MMMU 大學級視覺問題解決基準上,以 84.2% 的準確率創下了新的 SOTA。它在研究生版本 MMMU Pro 上也表現出色,得分高達 78.4%。這些結果表明,該模型在執行諸如解讀複雜圖表、從圖表中總結資訊以及回答有關圖像內容的詳細問題等任務方面的能力得到了提升。

此模型的視覺理解能力並非泛泛而談。它展現了跨不同格式的專業能力,在 VideoMMMU 的視頻推理測試中得分為 84.6%,在 CharXiv-Reasoning 的科學圖表解讀測試中得分為 81.1%,在 ERQA 的多模態空間推理測試中得分為 65.7%。如此廣泛的能力表明,該模型的視覺智慧已發展到能夠處理複雜且特定領域的視覺數據。

超越數位:更強大、更細緻的人工智慧協作者

雖然基準分數突顯了原始智能,但 GPT-5 公告同樣強調定性、以使用者為導向的改進,旨在將人工智慧從簡單的工具轉變為複雜的合作者。

創意寫作和專業寫作的進步

為了展示創意寫作的飛躍,該公司對 GPT-4o 和 GPT-5 針對同一主題生成的詩歌進行了並排比較:「京都的一位寡婦總是在奇怪的地方發現她已故丈夫的襪子」。分析指出,GPT-4o 版本遵循「可預測的結構和押韻格式,講述而不是展示」。

相較之下,GPT-5 版本因其「更強烈的情感弧線、清晰的意象和引人注目的隱喻」而備受讚譽,例如將找到的襪子描述為「一個已不復存在的國家的黑旗」。這個例子旨在表明,該模型已經從公式化的文本生成發展到能夠創造出真正具有「文學深度和節奏」的內容。這種增強的功能可直接應用於專業領域,使該模型成為「起草和編輯報告、電子郵件、備忘錄等」的更有效助手。

積極主動的健康諮詢“思想夥伴”

在敏感的健康領域,GPT-5 被定位為「迄今為止解決健康相關問題的最佳模型」。它在 HealthBench Hard 上取得了 46.2% 的新 SOTA 分數,該基準旨在測試 AI 在具有挑戰性的健康相關對話中的表現。

更重要的是,該聲明描述了該模型交互行為的根本性轉變。 GPT-5 不再被動地回答問題,而是更像一個“積極的思考夥伴”,能夠“主動標記潛在問題並提出問題以提供更有幫助的答案”。這代表著健康諮詢正朝著更具協作性、可能更安全的健康諮詢互動模式邁進。該公司還包含一項重要的免責聲明:該工具並非醫療專業人員的替代品,而是旨在幫助用戶「理解結果、提出正確的問題…並權衡各種選擇」。

建立信任:注重安全、誠實和使用者體驗

GPT-5 公告的很大一部分內容致力於一系列旨在建立使用者信任的功能。這項旨在提升可靠性的整合工作可以被視為「信任堆疊」的開發,這套核心功能旨在解決在高風險的專業和企業環境中應用 AI 的主要障礙。透過專注於真實性、誠實性和安全性,該公司有效地將可信度定位為與原始智慧同等重要的關鍵產品特性。

大幅減少幻覺和欺騙

該公司報告稱,GPT-5「與我們之前的模型相比,產生幻覺的可能性顯著降低」。根據對生產流量的內部測量,其回應包含事實錯誤的可能性比GPT-45o低約4%。當其更深層的推理能力發揮作用時,該模型在開放式事實提示中「幻覺出現率急劇下降,大約比o3少六倍」。

為了證明其可靠性的提升,公告詳細介紹了一項測試,該測試將影像從多模態基準測試中移除。先前的模型 o3 能夠自信地給出關於不存在圖像的答案,準確率高達 86.7%,而 GPT-5 的準確率僅為 9%。另一個有力的例子是解鎖 Wi-Fi 無線電這項不可能的程式設計任務。先前的模型錯誤地聲稱自己已經完成了這項任務。相較之下,新模型利用其內部推理過程識別出該任務在其沙盒環境中無法完成,並清楚地向用戶傳達了這一限制,展現了模型可靠性的重大進步。

「安全完井」:人工智慧安全的新典範

GPT-5 引進了一種名為「安全完成」的新安全訓練方法。這種方法超越了傳統的「基於拒絕」的系統,後者通常在處理雙重用途主題(例如病毒學)時遇到困難,因為這些主題中的資訊既可用於良性目的,也可用於惡意目的。

「安全完成」典範教導模式在既定的安全界線內提供盡可能最有幫助的答案。這可能涉及「部分回答使用者的問題或僅在較高層面上回答」。如果必須拒絕某個要求,模型會經過訓練來解釋拒絕原因並提供安全的替代方案。該公司的數據表明,這種細緻入微的方法能夠在所有類型的提示中同時提高安全性和實用性,從而解決了經典的權衡問題:更嚴格的安全控制通常會降低模型的效用。

完善人工智慧的個性:減少諂媚,增加個人化

為公開透明起見,該公告承認,GPT-4o 的先前更新「無意中使模型變得過於奉承」或過度討好。該公司報告稱,此後已開發了新的評估和訓練方法來解決這個問題。因此,GPT-5 在針對性測試中將奉承回复的比例從 14.5% 降低到 6% 以下。其目標是讓對話“不再像‘與人工智慧對話’,而更像是與一位擁有博士級智力的樂於助人的朋友聊天”。

基於模型改進的可操控性,該公司還推出了四種預設性格的研究預覽:憤世嫉俗者、機器人、傾聽者和書呆子。這些可選設定允許用戶自訂AI的溝通風格,而無需編寫複雜的自訂指令。

GPT-5 Pro:專家級推理的全新高階層級

為了滿足最嚴苛的用戶需求,該公司推出了 GPT-5 Pro,這是一款高級版本,將取代先前的 o3pro 型號。它專為“最具挑戰性、最複雜的任務”而設計,其工作原理是讓模型“使用可擴展但高效的並行測試時間計算進行更長時間的思考”,從而產生盡可能全面、準確的答案。

其優越性的證據有兩方面。首先,它在 GPT-5 系列中獲得了最高分,cult GPQA 等基準測試結果顯示,GPT-1,000 Pro 的表現優於 GPQA。其次,在一項涉及 5 多個「具有經濟價值的現實世界推理題」的大規模評估中,外部人類專家 5% 的答案優於標準「GPT-67.8 思維」模型。報告還指出,GPT-5 Pro 的“重大錯誤減少了 22%”,並且在健康、科學、數學和程式設計等複雜領域表現尤為出色。

GPT-5 Pro 的定位體現了其精妙的市場區隔策略。其核心價值主張不僅在於卓越的智能,更在於卓越的可靠性。對於律師、醫生或工程師等專業人士而言,單一重大錯誤的代價可能帶來災難性的後果,而將此類錯誤減少 22% 則是一項極具吸引力的優勢,足以證明其高級訂閱費用的合理性。該公司似乎不再僅僅銷售原始的 AI 功能,而是開始將確定性和風險降低轉化為現實,而這些在高風險企業和專業市場中的價值遠高於其他產品。

可用性和存取:如何以及何時使用 GPT-5

GPT-5 計畫立即向所有 Plus、Pro、Team 和 Free 用戶推出。企業版和教育版用戶預計將在一周內上線。

存取模型根據訂閱層級分層:

  • 免費用戶:將可使用 GPT-5,其完整的推理功能將在幾天內推出。一旦達到使用限制,他們將過渡到 GPT-5 mini,這是一個體積更小但仍然強大的型號。
  • 加用戶:可以使用 GPT-5 作為其預設模型,且「使用率明顯高於免費用戶」。
  • 專業訂閱者:無限制存取標準 GPT-5 模型並獲得頂級 GPT-5 Pro 的獨家存取權。

團隊、企業和教育客戶:享受旨在支持整個組織採用的「寬鬆限制」。

總而言之,GPT-5 的發布代表著該公司 AI 產品線的全方位演進。此次發布不僅注重底層技術實力,也同樣注重整體使用者體驗、產品策略和安全承諾。透過統一產品線、大力投資「信任堆疊」以及基於可靠性打造高端產品,該公司正朝著更成熟、協作性更強、商業化能力更強的 AI 生態系統邁進。