| ベンチマーク(ドメイン) |
メトリック |
GPT-4o |
OpenAI o3 |
GPT-5 |
GPT-5 プロ |
| GPQA ダイヤモンド(理学博士) |
精度、パス@1 |
77.8% |
83.3% |
85.7% |
88.4% |
| SWE-bench Verified(コーディング) |
パス@1 |
30.8% |
52.8% |
74.9% |
無し |
| AIME 2025(競技数学) |
Pass@1(ツール付き) |
42.1% (パイソン) |
88.9% (パイソン) |
71.0% (パイソン) |
94.6% (パイソン) |
| ヘルスベンチ ハード(ヘルス) |
スコア |
0.0% |
25.5% |
46.2% |
無し |
| MMMU(マルチモーダル) |
精度、パス@1 |
72.2% |
74.4% |
84.2% |
無し |
科学的および数学的推論における優位性
GPT-5 Proの注目すべき点は、人間の専門家でさえ難しい博士レベルの科学問題で構成されるベンチマークであるGPQA Diamondにおけるパフォーマンスです。このモデルは外部ツールを使用せずに88.4%のスコアを達成し、新たなSOTAを樹立しました。これは、真の科学的問題解決におけるAIの能力の大幅な進歩を示しています。
数学においても、このモデルは驚異的な能力を発揮しています。AIME 2025競技数学ベンチマークでは、計算にPythonツールを搭載したGPT-5 Proは94.6%のスコアを記録しました。ハーバード-MIT数学トーナメント(HMMT)ベンチマークでは、99.6%の精度を達成しました。これらのテストは単純な算術演算をはるかに超えており、複雑な問題を解くには高度な多段階推論が求められます。特にコーディング環境を活用できる場合、このモデルの高度な論理的思考力と問題解決能力が発揮されます。
開発者とプログラマーにとっての飛躍的進歩
ソフトウェア開発コミュニティにとって、GPT-5は同社の「これまでで最も強力なコーディングモデル」と位置付けられています。この主張は、GitHubリポジトリから収集された現実世界のソフトウェアエンジニアリングの課題を解決するAIの能力を評価するベンチマークであるSWE-bench Verifiedで74.9%という高いスコアによって裏付けられています。この結果は、同じテストにおけるGPT-4oの30.8%というスコアを大幅に上回っています。
発表では、パフォーマンス指標そのものだけでなく、質的な改善も強調されています。初期テスターは、このモデルの「美的感覚への洞察力」の向上と「間隔、タイポグラフィ、余白などの理解力の大幅な向上」に気づいたと報告されています。これは、単に機能的なコードを生成する段階から、洗練され、美しく、実稼働可能なフロントエンドアプリケーションを生成する段階への移行を示唆しています。これを説明するために、同社は単一のプロンプトから複雑なアプリケーションを作成した例をいくつか挙げています。その中には、視差スクロールの背景、ハイスコアトラッキング、漫画風のキャラクターを備えた「ジャンピングボールランナー」ゲームも含まれています。
視覚的およびマルチモーダル入力の理解の向上
GPT-5の能力は、マルチモーダル推論にも堅牢に拡張されています。このモデルは、大学レベルの視覚的問題解決におけるMMMUベンチマークで84.2%の精度という新たなSOTAを樹立しました。また、大学院レベルのMMMU Proでも78.4%という高いスコアを記録しました。これらの結果は、複雑なグラフの解釈、図表からの情報の要約、画像の内容に関する詳細な質問への回答といったタスクを実行する能力が向上していることを示しています。
このモデルの視覚理解は、単なる汎用的なものではありません。様々なフォーマットにおいて専門的な能力を示しており、動画ベースの推論を行うVideoMMMUで84.6%、科学的数値の解釈を行うCharXiv-Reasoningで81.1%、マルチモーダル空間推論を行うERQAで65.7%のスコアを獲得しました。この幅広い能力は、このモデルの視覚知能が複雑かつ分野特有の視覚データを処理するために開発されていることを示しています。
数字を超えて:より有能でニュアンスに富んだAIコラボレーター
ベンチマーク スコアが生のインテリジェンスを強調する一方で、GPT-5 の発表では、AI を単純なツールから洗練された協力者へと変えるために設計された、ユーザー向けの定性的な改善に等しく重点が置かれています。
クリエイティブライティングとプロフェッショナルライティングの進歩
同社は、創作における飛躍的な進歩を示すため、同じ課題「京都に住む未亡人が、亡くなった夫の靴下を奇妙な場所で何度も見つける」に対してGPT-4oとGPT-5が生成した詩を並べて比較しました。分析では、GPT-4o版は「予測可能な構造と韻律に従っており、見せるのではなく伝える」と指摘されています。
対照的に、GPT-5版は「より強い感情の起伏、明確なイメージ、そして印象的なメタファー」が高く評価されています。例えば、見つかった靴下を「もはや存在しない国の黒旗」と表現するなどです。この例は、モデルが定型的なテキスト生成から、真の「文学的な深みとリズム」を備えたコンテンツの作成へと進化したことを示すためにまとめられています。この強化された機能は、専門的な現場で直接活用でき、「レポート、メール、メモなどの作成と編集」のためのより効果的なアシスタントとしてモデルを活用しています。
健康に関するお問い合わせに積極的に対応する「思考パートナー」
健康というデリケートな分野において、GPT-5は「健康関連の質問に対するこれまでで最高のモデル」と位置付けられています。GPT-46.2は、健康関連の難しい会話におけるAIの性能をテストするために設計されたベンチマークであるHealthBench Hardで、XNUMX%という新たなSOTAスコアを達成しました。
さらに重要なのは、この発表ではモデルの対話動作における根本的な変化について説明されている点です。GPT-5は、質問に受動的に答えるのではなく、「能動的な思考パートナー」のように行動し、「潜在的な懸念を積極的にフラグ付けし、より役立つ回答を提供するために質問する」ことができると言われています。これは、健康に関する問い合わせにおいて、より協調的で、より安全な対話モデルへの移行を示しています。同社は、このツールは医療専門家の代わりとなるものではなく、ユーザーが「結果を理解し、適切な質問をし、選択肢を比較検討する」ことを可能にすることを目的としているという重要な免責事項を付記しています。
信頼の構築:安全性、誠実さ、ユーザーエクスペリエンスに重点を置く
GPT-5の発表の大部分は、ユーザーの信頼構築を目的とした一連の機能に費やされています。信頼性向上に向けたこの統合的な取り組みは、「Trust Stack」の開発と捉えることができます。これは、ハイリスクな専門分野や企業環境におけるAI導入における主要な障壁に対処するために設計されたコア機能群です。事実性、誠実性、安全性に重点を置くことで、同社は信頼性を、生の知性と同等の重要な製品機能として効果的に位置付けています。
幻覚と欺瞞を劇的に軽減
同社は、GPT-5は「以前のモデルと比べて幻覚を起こす可能性が大幅に低い」と報告しています。実稼働トラフィックにおける社内測定によると、GPT-45の応答はGPT-4oと比較して事実誤認を含む可能性が約3%低いことが示されています。より深い推論機能が作動すると、自由記述式の事実に関する質問において、GPT-XNUMXは「幻覚が急激に減少し、GPT-XNUMXoの約XNUMX分のXNUMXに減少」することが示されています。
正直性の向上を示すため、発表ではマルチモーダルベンチマークから画像を削除したテストの詳細が示されています。以前のモデルであるo3は、存在しない画像について86.7%の確率で自信を持って回答しましたが、GPT-5ではわずか9%でした。もうXNUMXつの強力な例として、Wi-Fi無線のブロックを解除するという不可能なコーディングタスクがあります。以前のモデルは、タスクを完了したと誤って主張していました。一方、新しいモデルは内部推論プロセスを用いて、サンドボックス環境内でタスクが不可能であることを特定し、この制限をユーザーに明確に伝えました。これは、モデルの正直性における大きな進歩を示しています。
「安全な補完」:AIの安全性のための新しいパラダイム
GPT-5は、「セーフコンプリーション」と呼ばれる新しい安全性トレーニング手法を導入しています。このアプローチは、情報が善意と悪意の両方の目的で使用される可能性がある二重使用のトピック(例:ウイルス学)でしばしば問題となる従来の「拒否ベース」システムを凌駕します。
「安全な補完」パラダイムは、設定された安全境界を守りながら、可能な限り最も役立つ回答を提供するようモデルを学習させます。これには、「ユーザーの質問に部分的に答える、または高レベルな回答のみを行う」といったことが含まれます。リクエストを拒否する必要がある場合、モデルはその理由を説明し、安全な代替案を提示するように学習されます。同社のデータによると、このきめ細やかなアプローチは、あらゆる種類の質問において安全性と有用性の両方を高め、安全性管理を厳格化するとモデルの有用性が低下するという典型的なトレードオフに対処しています。
AIの性格を洗練させる:ごますりを減らし、カスタマイズを増やす
透明性を確保するため、今回の発表では、GPT-4oの以前のアップデートが「意図せずモデルを過度に追従的に」、つまり過度に協調的にしてしまったことを認めています。同社はその後、この問題に対処するために新たな評価手法と学習手法を開発したと報告しています。その結果、GPT-5では、対象を絞ったテストにおいて追従的な返答が14.5%から6%未満に減少しました。目標は、会話を「『AIと話している』という感覚ではなく、博士号レベルの知性を持つ親切な友人とおしゃべりしているような感覚」にすることだとされています。
モデルの操縦性向上を踏まえ、同社は「皮肉屋」「ロボット」「聞き手」「オタク」の4つのプリセットパーソナリティのリサーチプレビューも開始しました。これらのオプトイン設定により、ユーザーは複雑なカスタム指示を記述することなく、AIのコミュニケーションスタイルをカスタマイズできます。
GPT-5 Pro: 専門家レベルの推論のための新しいプレミアム層
最も要求の厳しいユーザー向けに、同社は従来のo5proモデルに代わるプレミアムモデル「GPT-3 Pro」をリリースします。「最も困難で複雑なタスク」向けに設計されており、「スケール化されながらも効率的な並列テスト時間コンピューティングを用いて、モデルがさらに長時間思考」することで、可能な限り包括的かつ正確な回答を生成します。
その優位性を示す証拠は5つある。まず、GPT-XNUMXファミリーの中で、diffiにおいて最高スコアを達成している。cult GPQAのようなベンチマークよりも優れています。次に、1,000以上の「経済的に価値のある、現実世界の推論プロンプト」を対象とした大規模な評価において、外部の専門家はGPT-5 Proの回答を標準的な「GPT-5思考」モデルよりも67.8%の割合で高く評価しました。また、報告書では、GPT-5 Proは「重大なエラーが22%減少」し、特に健康、科学、数学、コーディングといった複雑な分野で優れた成績を収めたと指摘しています。
GPT-5 Proのこのポジショニングは、洗練された市場セグメンテーション戦略を如実に示しています。中核となる価値提案は、優れたインテリジェンスだけでなく、優れた信頼性です。弁護士、医師、エンジニアといった専門家にとって、重大なミスが22つで甚大な損害をもたらす可能性があるため、そうしたミスをXNUMX%削減することは非常に魅力的なメリットであり、プレミアムサブスクリプションのコストを容易に正当化できます。同社はAI機能そのものの販売にとどまらず、確実性とリスク軽減という、ハイリスクなエンタープライズ市場や専門職市場においてはるかに価値の高い商品を収益化しようとしているようです。
可用性とアクセス: GPT-5 の使用方法とタイミング
GPT-5の展開は、Plus、Pro、Team、およびFreeプランのすべてのユーザーを対象に、直ちに開始される予定です。EnterpriseおよびEducationプランのお客様への提供は、XNUMX週間以内に開始される予定です。
アクセス モデルは、サブスクリプション レベルに基づいて階層化されています。
- 無料ユーザーGPT-5にアクセスでき、完全な推論機能は数日中に展開されます。使用制限に達した場合は、小型ながらも高性能なGPT-5 miniに移行します。
- Plusユーザー: GPT-5 をデフォルトモデルとして使用でき、「無料ユーザーよりも大幅に使用率が高い」。
- プロ加入者: 標準の GPT-5 モデルへの無制限アクセスと、最上位の GPT-5 Pro への限定アクセスを受け取ります。
チーム、エンタープライズ、Edu のお客様: 組織全体での導入をサポートするために設計された「寛大な制限」が提供されます。
結論として、GPT-5のリリースは、同社のAI製品における多面的な進化を象徴しています。今回の発表は、基盤となる技術力に加え、包括的なユーザーエクスペリエンス、製品戦略、そして安全性への取り組みにも重点を置いています。モデルラインナップの統一、「Trust Stack」への多額の投資、そして信頼性に基づいたプレミアム層の構築により、同社はより成熟し、協調的で、商業的に堅牢なAIエコシステムに向けた戦略的な推進を示しています。