OpenAIがGPT-4o画像生成を開始

2025 年 3 月 28 日

OpenAI は、これまでで最も高度な画像生成機能のリリースを発表しました。この機能は、現在、同社のマルチモーダル モデル GPT-4o にネイティブに統合されています。言語と視覚表現の境界を曖昧にするこの新しい画像ジェネレーターは、美しさと実用性を兼ね備えており、ユーザーは簡単なチャット ベースのプロンプトから、写真のようにリアルでテキストが正確で、コンテキストを認識した画像を生成できます。

GPT-4o 画像生成

アートからインフォグラフィックへ: 画像生成と実世界での使用

芸術的なシュールレアリズムを優先する従来の画像モデルとは異なり、GPT-4o の新しい画像生成機能は実用的なアプリケーション向けに設計されています。教育用図表、レストランのメニュー、インフォグラフィック、またはビデオ ゲーム アセットを作成する場合でも、このツールは正確でコンテキスト認識力のあるビジュアルを提供し、生成ビジュアル AI の飛躍的な進歩となります。

OpenAI は、このモデルの進化により「画像生成がコミュニケーション ツールに変わり」、ユーザーは構成やスタイルだけでなく、テキストの配置、象徴的な意味、反復にわたるシーンの連続性などの機能要素も指定できるようになると述べています。

「GPT-4oには、これまでで最も先進的な画像ジェネレーターが組み込まれています」と同社は発表した。「その結果、美しいだけでなく、便利な画像生成が実現しました。」

視覚的理解のための新たな基盤

この画期的な進歩の核となるのは、GPT-4o のネイティブなマルチモーダル アーキテクチャであり、これは、統合されたトランスフォーマー内で視覚と言語を統合します。これにより、モデルはアップロードされた画像を参照し、複数ステップの編集にわたって一貫性を維持し、フォローアップ プロンプトにインテリジェントに応答できるため、インタラクティブなデザインの改良から会話型プロトタイピングまで、あらゆる用途に適しています。

OpenAI が紹介するユースケースは次のとおりです。

  • 正確な物語のペースを備えた4コマ漫画
  • 埋め込まれたビジュアルと現実世界のコンテキストを備えたニュートンプリズム実験インフォグラフィック
  • ニューヨーク州ウィリアムズバーグの街の風景。細部までこだわった、信憑性のある標識(そして微妙なユーモア)が満載
  • エレガントな料理のイラストと正しいテキストフォーマットを備えた韓国料理レストランのメニュー

指示の遵守と文脈の正確さ

テストでは、GPT-4o は、以前のモデルでは苦労することが多かった、最大 20 個の異なるオブジェクトを正しい関係でレンダリングする能力を実証しました。また、招待状、看板、インタラクティブな UI モックアップなどの複雑なテキスト要素も、信頼性の高いタイプセッティングとレイアウト制御で処理します。

たとえば、ユーザーは次のようなリクエストを行うことができます。

  • ミステリーRPGを舞台にした猫探偵、ゲームUIオーバーレイ付き
  • 感謝祭の七面鳥を切り分けるのに使われるチェーンソーの広告。ユーモラスなスローガン付き。
  • 水彩画風のクジラに関する詳細な教育用チャート

安全性、出所、透明性

OpenAI は、印象的な創造力を披露する一方で、安全性とコンテンツの完全性への取り組みを強調しています。生成されたすべての画像には C2PA メタデータが含まれており、GPT-4o で作成されたことを示しています。このシステムには、信頼性の検証に役立つ内部画像検索ツールも統合されています。

OpenAI は、解釈可能な人間が書いたルールを使用してエッジケースを識別し、ディープフェイクや暴力的なグラフィックなどの不適切なコンテンツをブロックすることで、安全ポリシーの遵守を保証する推論ベースのモデレーション モデルをトレーニングしました。

以下の制限はまだ残っています:

  • 時々発生するトリミングの問題
  • ディフィcult多言語または数学的なテキストを高密度にレンダリングする
  • 特定の画像領域(顔の詳細など)に対する一貫性のない編集

同社によれば、改良は現在進行中であり、ユーザーからのフィードバックが今後のアップデートで重要な役割を果たすことになるという。

可用性とアクセス

GPT-4o画像ジェネレーターは、本日よりChatのFree、Plus、Pro、Teamユーザー向けにご利用いただけます。まもなくEnterpriseおよびEducationのお客様にも提供される予定です。API経由でのアクセスは今後数週間以内に開始される予定で、開発者はプログラムによる利用が可能になります。

ユーザーは、次の内容を指定する簡単な会話プロンプトを通じて、画像を生成し、反復処理することができます。

  • アスペクト比(例:16:9)
  • 背景色または透明度
  • 画像のスタイル(リアル、インフォグラフィック、コミックなど)
  • 特定のレイアウト要素(テキスト、アイコン、配置)

レンダリング時間は長くなりますが (多くの場合、最大 1 分)、OpenAI は、より高い詳細度と精度を得るためには、そのトレードオフは価値があると主張しています。

言語モデルの視覚的飛躍

GPT-4o は、ネイティブ画像生成により、コミュニケーションがテキストを超えるマルチモーダル AI の未来に向けて決定的な一歩を踏み出します。科学的な図表からステッカー、ビデオゲームのプロトタイプから詩的な結婚式の招待状まで、GPT-4o は想像力に限界がないことを証明しています。

画像と言語の境界が消えつつある中、OpenAI の最新のイノベーションは、画像の生成方法だけでなく、画像の使用に関する考え方そのものも変える可能性がある。