OpenAI 推出 GPT-4o 影像生成

2025 年 3 月 28 日

OpenAI 宣布推出迄今為止最先進的圖像生成功能,目前已原生整合到其多模態模型 GPT-4o 中。新的圖像生成器模糊了語言和視覺表達之間的界限,將美觀與實用結合在一起,使用戶能夠透過簡單的基於聊天的提示生成逼真、文字準確且具有上下文感知的圖像。

GPT-4o 影像生成

從藝術到資訊圖表:圖像生成滿足現實世界的使用

與優先考慮藝術超現實主義的傳統圖像模型不同,GPT-4o 的新圖像生成功能是專為實際應用而設計的。無論是創建教育圖表、餐廳菜單、資訊圖表還是視頻遊戲資產,該工具都能提供精確且具有情境感知能力的視覺效果,這是生成視覺人工智慧的飛躍。

OpenAI 表示,其模型的這一演變“將圖像生成轉變為一種交流工具”,允許用戶不僅可以指定構圖和样式,還可以指定文本位置、象徵意義和跨迭代的場景連續性等功能元素。

該公司宣布:“我們已經將迄今為止最先進的圖像生成器融入 GPT-4o。” “結果,生成的圖像不僅美觀,而且實用。”

視覺理解的新基礎

這項突破的核心是 GPT-4o 的原生多模態架構,它將視覺和語言整合在一個統一的轉換器中。這使得模型可以引用上傳的圖像,在多步驟編輯中保持一致性,並對後續提示做出智慧回應,使其非常適合從互動式設計改進到對話原型設計的一切。

OpenAI 展示的用例包括:

  • 具有精準敘事節奏的四格漫畫
  • 帶有嵌入式視覺效果和真實世界背景的牛頓棱鏡實驗資訊圖
  • 紐約威廉斯堡的街景充滿了細緻逼真的標誌(以及微妙的幽默)
  • 一家韓國餐廳的菜單,配有精美的菜餚插圖和正確的文字格式

指令遵循和上下文精度

在測試中,GPT-4o 展示了以正確的關係渲染多達 20 個不同物件的能力,而這是以前的模型經常遇到困難的領域。它還可以處理複雜的文字元素,例如邀請卡、標誌和互動式 UI 模型,並具有可靠的排版和佈局控制。

例如,使用者可以請求:

  • 一款神秘 RPG 遊戲設定中的貓偵探,帶有遊戲 UI 疊加層
  • 用於雕刻感恩節火雞的電鋸廣告,帶有幽默的口號
  • 水彩風格的鯨魚詳細教育圖表

安全性、出處和透明度

在展示令人印象深刻的創造能力的同時,OpenAI 強調了對安全和內容完整性的承諾。所有產生的圖像都包含 C2PA 元數據,表明它們是用 GPT-4o 創建的。該系統還整合了內部圖像搜尋工具來幫助驗證真實性。

OpenAI 訓練了一個基於推理的審核模型,以確保遵守安全政策,使用可解釋的人工編寫規則來識別邊緣情況並阻止不適當的內容,例如深度偽造或暴力圖像。

但仍存在局限性,包括:

  • 偶爾出現裁切問題
  • 困難culty 渲染密集的多語言或數學文本
  • 對特定影像區域(例如臉部細節)的不一致編輯

該公司表示,改進正在進行中,用戶回饋將在未來的更新中發揮關鍵作用。

可用性和訪問

GPT-4o 影像產生器現已在 Chat 的免費版、Plus 版、專業版和團隊版中推出,並將很快開放給企業版和教育版用戶。預計未來幾週內即可透過 API 訪問,為開發者解鎖編程式使用。

使用者可以透過簡單的對話提示產生和迭代圖像,指定:

  • 寬高比(例如 16:9)
  • 背景顏色或透明度
  • 圖像風格(寫實、資訊圖表、漫畫等)
  • 特定佈局元素(文字、圖示、定位)

儘管渲染時間更長(通常長達一分鐘),但 OpenAI 認為為了獲得更高的細節和精確度,這種權衡是值得的。

語言模型的視覺飛躍

透過原生圖像生成,GPT-4o 朝著多模態 AI 的未來邁出了決定性的一步,在多模態 AI 中,交流超越了文本。從科學圖表到貼紙、電玩原型到詩意的婚禮請柬,GPT-4o 證明了想像確實無邊無際。

隨著圖像和語言之間的界限逐漸消失,OpenAI 的最新創新可能不僅會改變我們生成圖像的方式,還會改變我們對使用圖像的看法。