OpenAI 宣布推出 Deep Research,這是一款突破性的人工智慧代理,旨在在互聯網上執行多步驟研究。這項新功能現已在 Chat 中上線,可協助使用者分擔複雜的線上研究任務,並在幾分鐘內合成大量資訊。
Deep Research 基於即將推出的 OpenAI o3 模型的高級版本構建,在數據分析、知識綜合和基於網絡的推理方面表現出色。該模型獨立搜尋、分析和編譯數據,產生具有清晰引用和參考的研究分析師級報告。
該功能目前僅對 Chat Pro 用戶開放,Plus 和 Team 用戶接下來將獲得存取權限。
OpenAI 為何進行深度研究
深度研究是為需要跨金融、科學、政策和工程等領域深入知識的專業人士和研究人員而建立的。該工具還專為尋求超個人化推薦的消費者而設計,使其成為在購買汽車、家電和技術等產品時進行全面產品比較的寶貴資產。
與提供簡短摘要的傳統 AI 模型不同,深度研究能夠:
- 瀏覽和分析數百個線上資源
- 產生詳盡記錄的報告
- 提供結構化的引文以驗證事實
- 綜合非直觀且難以發現的見解
這項進步代表著 OpenAI 朝著其長期目標——通用人工智慧 (AGI) 邁出了重要一步,該目標包括產生新知識的能力,而不僅僅是簡單地檢索現有數據。
深度研究如何運作
用戶可以在聊天中選擇訊息編輯器中的「深度研究」選項,啟動「深度研究」功能。輸入查詢後,例如串流媒體服務的競爭分析或電動車普及趨勢報告,AI 就會開始深入調查。
主要功能:
- 多步驟研究:深度研究自主規劃和執行複雜的研究軌跡,並根據即時發現進行調整。
- 文件和電子表格支持:使用者可以上傳文件或電子表格以增強上下文理解。
- 實時追踪:側邊欄提供有關研究步驟、所用來源和分析進度的更新。
- 綜合報告:在 5 到 30 分鐘內,Chat 會提供詳細的研究報告,並附上引文。
- 即將推出的增強功能:未來的更新將引入嵌入式影像、資料視覺化和分析圖表以增強報告。
與擅長即時多模式互動的 GPT-4o 不同,深度研究旨在進行需要細緻事實查核和綜合的廣泛、特定領域的調查。
基準性能:人工智慧研究的新標準
深度研究在專家級研究評估中明顯超越先前的人工智慧模型,展現出卓越的推理能力和準確性。
人類的最後一次考試表現
在人類的最後考試——一項嚴格的人工智慧基準測試中,深度研究涵蓋了 100 多個科目,測試專家級推理能力,準確率達到了創紀錄的 26.6%,超越了所有主流人工智慧模型。
| 型號 | 準確性 (%) |
|---|---|
| GPT-4o | 3.3 |
| 格羅克-2 | 3.8 |
| 克勞德第 3.5 首十四行詩 | 4.3 |
| 雙子座思維 | 6.2 |
| OpenAI o1 | 9.1 |
| 中深烘SeekR1 | 9.4 |
| OpenAI o3-mini(高) | 13.0 |
| OpenAI深度研究 | 26.6 |
深度研究擅長化學、人文、社會科學和數學,利用其先進的推理能力比以前的模型更有效地搜尋和解釋複雜數據。
GAIA 基準測試結果
Deep Research 也在 GAIA 上創造了新的最先進 (SOTA) 記錄,GAIA 是一個公共基準,用於測試 AI 處理現實世界中多步驟研究任務的能力。
| 測試級別 | 先前 SOTA (%) | 深度研究通行證@1(%) | 深度研究共識@64(%) |
|---|---|---|---|
| Level 1 | 67.92 | 74.29 | 78.66 |
| Level 2 | 67.44 | 69.06 | 73.21 |
| Level 3 | 42.31 | 47.6 | 58.03 |
| 中等 | 63.64 | 67.36 | 72.57 |
這些結果證實,深度研究不僅更快、更有高效,而且能夠更精確地應對高度技術性的研究挑戰。
挑戰和未來的改進
儘管深度研究具有先進的能力,但它仍處於早期階段,並且存在一些限制:
- 事實幻覺:雖然顯著減少,但偶爾仍會出現誤解或不準確的推論。
- 置信度校準問題:模型可能並不總是準確地表達不確定性,可能會導致對某些反應過度自信。
- 格式和引用錯誤:正在改進細微的格式不一致和引用位置問題。
隨著深度研究的發展,OpenAI 計劃增強可靠性、提高準確性並擴大對其他專門資料來源的存取。
可用性和訪問
誰可以使用深度研究?
- 專業用戶: 現已推出,每月限制 100 次查詢。
- Plus 與團隊使用者: 訪問即將推出。
- 企業用戶: 計劃未來發布。
目前,英國、瑞士和歐洲經濟區尚未提供深度研究服務,但 OpenAI 正積極致力於擴大區域存取權。
即將推出的增強功能
- 更具成本效益的版本:更小、更快、更有效率的深度研究模式很快就會向所有付費用戶開放。
- 行動和桌面集成:深度研究將於下個月推廣到 Chat 的行動和桌面應用程式。
- 擴展數據訪問:未來的更新將整合基於訂閱和內部的資料來源,使研究更加全面。
人工智慧研究的未來
OpenAI的深度研究代表著人工智慧進行獨立多步驟推理能力的重大飛躍。透過結合智慧數據合成、即時網路瀏覽和進階報告,OpenAI 正在為更多自主的人工智慧研究工具鋪平道路。
展望未來,OpenAI 設想了更複雜的人工智慧代理,能夠執行非同步線上研究和現實世界的任務。 Deep Research 與 OpenAI 即將推出的代理商 Operator 的整合有望重新定義 AI 在研究、自動化和決策中的作用。
目前,深度研究將徹底改變專業人士、研究人員和消費者收集和綜合資訊的方式,將數小時的工作時間縮短為幾分鐘。