OpenAIは、インターネット上で多段階の調査を実行するために設計された画期的なAIエージェント「Deep Research」のリリースを発表しました。チャットで利用可能なこの新機能により、ユーザーは複雑なオンライン調査タスクをオフロードし、膨大な情報をわずか数分で統合することができます。
Deep Research は、近日登場予定の OpenAI o3 モデルの高度なバージョンに基づいて構築されており、データ分析、知識の統合、Web ベースの推論に優れています。このモデルは、データを独立して検索、分析、コンパイルし、明確な引用と参照を含むリサーチアナリスト レベルのレポートを作成します。
この機能は現在 Chat Pro ユーザーが利用可能で、次に Plus および Team ユーザーもアクセスできるようになる予定です。
OpenAIがディープリサーチを開発した理由
Deep Research は、金融、科学、政策、エンジニアリングなどの分野にわたる詳細な知識を必要とする専門家や研究者向けに構築されました。このツールは、超パーソナライズされた推奨事項を求める消費者向けにも設計されており、自動車、家電、テクノロジーなどの購入における徹底的な製品比較に役立つ貴重な資産となっています。
簡単な要約を提供する従来の AI モデルとは異なり、Deep Research は次のことが可能です。
- 何百ものオンラインソースを閲覧し分析する
- 十分に文書化されたレポートの生成
- 事実検証のための構造化された引用の提供
- 直感的でなく見つけにくい洞察を統合する
この進歩は、既存のデータを単に取得するのではなく、新しい知識を生成する能力を含む、OpenAI の長期目標である汎用人工知能 (AGI) に向けた大きな一歩を表しています。
ディープリサーチの仕組み
ユーザーは、チャットのメッセージ作成画面で「ディープリサーチ」オプションを選択することで、ディープリサーチを有効化できます。ストリーミングサービスの競合分析や電気自動車の普及動向に関するレポートなど、クエリを入力すると、AIが詳細な調査を開始します。
主な特長:
- 多段階研究: Deep Research は、リアルタイムの調査結果に基づいて調整しながら、複雑な研究軌道を自律的に計画および実行します。
- ファイルとスプレッドシートのサポート: ユーザーはファイルやスプレッドシートをアップロードして、コンテキストの理解を深めることができます。
- ライブトラッキング: サイドバーには、研究の手順、使用されたソース、分析の進行状況に関する最新情報が表示されます。
- 包括的なレポート: 5 ~ 30 分以内に、Chat は引用を含む詳細な調査レポートを提供します。
- 今後の機能強化: 今後のアップデートでは、埋め込み画像、データの視覚化、分析グラフが導入され、レポートが強化されます。
リアルタイムのマルチモーダルインタラクションに優れた GPT-4o とは異なり、Deep Research は、綿密な事実確認と統合を必要とする広範囲にわたるドメイン固有の調査向けに設計されています。
ベンチマークパフォーマンス: AI研究における新たな基準
Deep Research は、専門家レベルの研究評価において従来の AI モデルを大幅に上回り、優れた推論と精度を実証しています。
人類最後の試験の成績
100 以上の科目にわたる専門家レベルの推論をテストする厳格な AI ベンチマークである「人類最後の試験」において、Deep Research は 26.6% という記録的な精度を達成し、すべての主要な AI モデルを上回りました。
| モデル | 正確さ (%) |
|---|---|
| GPT-4o | 3.3 |
| Grok-2 | 3.8 |
| クロード 3.5 ソネット | 4.3 |
| 双子座の思考 | 6.2 |
| OpenAI o1 | 9.1 |
| 深いSeek-R1 | 9.4 |
| OpenAI o3-mini (高) | 13.0 |
| OpenAI ディープリサーチ | 26.6 |
Deep Research は化学、人文科学、社会科学、数学の分野で優れており、高度な推論機能を使用して、従来のモデルよりも効率的に複雑なデータを検索および解釈します。
GAIA ベンチマーク結果
Deep Research は、現実世界の複数ステップの研究タスクを処理する AI の能力をテストする公開ベンチマークである GAIA で、新たな最先端 (SOTA) 記録も樹立しました。
| テストレベル | 前回のSOTA(%) | ディープリサーチパス@1 (%) | ディープリサーチコンセンサス@64 (%) |
|---|---|---|---|
| Level1 | 67.92 | 74.29 | 78.66 |
| Level2 | 67.44 | 69.06 | 73.21 |
| Level3 | 42.31 | 47.6 | 58.03 |
| 平均 | 63.64 | 67.36 | 72.57 |
これらの結果は、Deep Research がより高速かつ効率的であるだけでなく、高度な技術を要する研究課題にもより正確に取り組むことができることを裏付けています。
課題と今後の改善点
高度な機能を備えているにもかかわらず、Deep Research はまだ初期段階にあり、いくつかの制限があります。
- 事実の幻覚: 大幅に減少しますが、時折、誤解や不正確な推論が発生する可能性があります。
- 信頼性の較正に関する問題モデルは必ずしも不確実性を正確に表現するわけではないため、一部の応答に過信を招く可能性があります。
- 書式と引用のエラー: 軽微な書式の不一致と引用の配置の問題が修正されています。
Deep Research が進化するにつれ、OpenAI は信頼性を高め、精度を向上させ、追加の専門データ ソースへのアクセスを拡大する予定です。
可用性とアクセス
ディープリサーチを利用できるのは誰ですか?
- プロユーザー: 現在利用可能ですが、100 か月あたり XNUMX 件のクエリに制限されています。
- Plus & チームユーザー: アクセスはまもなく開始されます。
- エンタープライズユーザー: 今後リリース予定。
Deep Research は現在、英国、スイス、EEA では利用できませんが、OpenAI は地域アクセスの拡大に積極的に取り組んでいます。
今後の機能強化
- よりコスト効率の高いバージョン: より小型で高速、かつ効率的な Deep Research モデルが、まもなくすべての有料ユーザーに提供される予定です。
- モバイルとデスクトップの統合: Deep Research は来月中に Chat のモバイル アプリとデスクトップ アプリに展開される予定です。
- 拡張データアクセス今後のアップデートでは、サブスクリプションベースのデータソースと内部データソースが統合され、研究がさらに包括的になります。
AIを活用した研究の未来
OpenAI の Deep Research は、AI が独立した多段階の推論を実行する能力の大きな飛躍を表しています。インテリジェントなデータ合成、リアルタイムの Web ブラウジング、高度なレポートを組み合わせることで、OpenAI はより自律的な AI を活用した研究ツールへの道を切り開いています。
将来的には、OpenAI は、非同期のオンライン調査と現実世界のタスク実行を実行できる、さらに高度な AI エージェントを構想しています。Deep Research と OpenAI の次期エージェント Operator の統合により、調査、自動化、意思決定における AI の役割が再定義されることが期待されます。
現時点では、Deep Research は、専門家、研究者、消費者が情報を収集して統合する方法に革命をもたらし、何時間もかかっていた作業を数分に短縮する予定です。