Inilunsad ng OpenAI ang GPT-4o Image Generation

Mar 28, 2025

Inihayag ng OpenAI ang paglulunsad ng pinaka-advanced na kakayahan sa pagbuo ng imahe, na ngayon ay katutubong isinama sa multimodal na modelo nito, ang GPT-4o. Sa isang hakbang na nagpapalabo sa mga hangganan sa pagitan ng wika at visual na expression, pinagsasama ng bagong image generator ang kagandahan at utility, na nagbibigay sa mga user ng kakayahang bumuo ng photorealistic, text-accurate, at context-aware na mga larawan mula sa mga simpleng chat-based na prompt.

GPT-4o Pagbuo ng Imahe

Mula sa Sining hanggang sa Infographics: Ang Pagbuo ng Imahe ay Nakakatugon sa Tunay na Paggamit sa Mundo

Hindi tulad ng mga tradisyonal na modelo ng imahe na inuuna ang artistikong surrealism, ang bagong function ng pagbuo ng imahe ng GPT-4o ay idinisenyo para sa praktikal na aplikasyon. Gumagawa man ng mga educational diagram, menu ng restaurant, infographic, o mga asset ng video game, ang tool ay naghahatid ng mga visual na may katumpakan at context-awareness, isang hakbang pasulong para sa generative visual AI.

Sinabi ng OpenAI na ang ebolusyon ng modelo nito ay "binabago ang pagbuo ng imahe sa isang tool para sa komunikasyon," na nagpapahintulot sa mga user na tukuyin hindi lamang ang komposisyon at istilo, kundi pati na rin ang mga functional na elemento tulad ng paglalagay ng text, simbolikong kahulugan, at pagpapatuloy ng eksena sa mga pag-ulit.

"Nagawa namin ang aming pinaka-advanced na generator ng imahe sa GPT-4o," inihayag ng kumpanya. "Ang resulta - pagbuo ng imahe na hindi lamang maganda, ngunit kapaki-pakinabang."

Isang Bagong Pundasyon para sa Visual na Pag-unawa

Sa kaibuturan ng pambihirang tagumpay na ito ay ang katutubong multimodal na arkitektura ng GPT-4o, na nagsasama ng paningin at wika sa loob ng pinag-isang transpormer. Binibigyang-daan nito ang modelo na mag-reference ng mga na-upload na larawan, mapanatili ang pagkakaugnay-ugnay sa mga multi-step na pag-edit, at matalinong tumugon sa mga follow-up na prompt, na ginagawa itong angkop para sa lahat mula sa interactive na pagpipino ng disenyo hanggang sa pakikipag-usap na prototyping.

Ang mga kaso ng paggamit na ipinakita ng OpenAI ay kinabibilangan ng:

  • Isang apat na panel na comic strip na may tumpak na pagsasalaysay ng bilis
  • Isang Newton prism experiment infographic na may naka-embed na visual at real-world na konteksto
  • Isang eksena sa kalye sa Williamsburg, NY na puno ng mga detalyado, mapagkakatiwalaang mga palatandaan (at banayad na katatawanan)
  • Isang menu para sa isang Korean restaurant, kumpleto sa mga eleganteng larawan ng pagkain at tamang pag-format ng text

Pagsunod sa Pagtuturo at Katumpakan ng Konteksto

Sa mga pagsubok, ipinakita ng GPT-4o ang kakayahang mag-render ng hanggang 20 natatanging mga bagay na may mga tamang ugnayan, isang lugar kung saan madalas na nahihirapan ang mga nakaraang modelo. Pinangangasiwaan din nito ang mga kumplikadong textual na elemento, gaya ng mga invitation card, sign, at interactive na UI mockup, na may maaasahang pag-type at layout ng kontrol.

Halimbawa, maaaring humiling ang mga user ng:

  • Isang cat detective sa isang misteryosong setting ng RPG, na may mga overlay ng UI ng laro
  • Isang advertisement para sa isang chainsaw na ginamit sa pag-ukit ng Thanksgiving turkey, na may nakakatawang slogan
  • Isang detalyadong tsart na pang-edukasyon sa mga balyena sa istilong watercolor

Kaligtasan, Provenance, at Transparency

Habang nagpapakita ng mga kahanga-hangang kakayahan sa pagkamalikhain, binibigyang-diin ng OpenAI ang pangako nito sa kaligtasan at integridad ng nilalaman. Kasama sa lahat ng nabuong larawan ang C2PA metadata, na nagsasaad na nilikha ang mga ito gamit ang GPT-4o. Ang system ay nagsasama rin ng isang panloob na tool sa paghahanap ng imahe upang makatulong na i-verify ang pagiging tunay.

Ang OpenAI ay nagsanay ng isang modelo ng pagmo-moderate na nakabatay sa pangangatwiran upang matiyak ang pagsunod sa mga patakaran sa kaligtasan, gamit ang mga nabibigyang-kahulugan na mga panuntunang isinulat ng tao upang matukoy ang mga gilid ng kaso at harangan ang hindi naaangkop na nilalaman, tulad ng mga deepfakes o graphic na karahasan.

Nananatili pa rin ang mga limitasyon, kabilang ang:

  • Mga isyu sa pana-panahong pagtatanim
  • Difficulty pag-render ng makakapal na multilingguwal o mathematical na teksto
  • Mga hindi pare-parehong pag-edit sa mga partikular na rehiyon ng larawan (hal., detalye ng mukha)

Sinasabi ng kumpanya na ang mga pagpapabuti ay isinasagawa, at ang feedback ng user ay may mahalagang papel sa mga pag-update sa hinaharap.

Availability at Access

Ang GPT-4o image generator ay available simula ngayon sa Chat para sa Libre, Plus, Pro, at mga user ng Team, at malapit nang ialok sa mga customer ng Enterprise at Education. Inaasahan ang pag-access sa pamamagitan ng API sa mga darating na linggo, na nag-a-unlock ng programmatic na paggamit para sa mga developer.

Maaaring bumuo at umulit ang mga user sa mga larawan sa pamamagitan ng mga simpleng pang-usap na prompt, na tumutukoy sa:

  • Aspect ratio (hal., 16:9)
  • Kulay ng background o transparency
  • Estilo ng larawan (makatotohanan, infographic, komiks, atbp.)
  • Mga partikular na elemento ng layout (teksto, mga icon, pagpoposisyon)

Kahit na mas mahaba ang mga oras ng pag-render – madalas hanggang isang minuto – pinapanatili ng OpenAI na sulit ang tradeoff para sa mas mataas na detalye at katumpakan.

Isang Visual Leap para sa mga Modelo ng Wika

Sa pagbuo ng katutubong larawan, ang GPT-4o ay gumagawa ng isang mapagpasyang hakbang patungo sa hinaharap ng multimodal AI, kung saan ang komunikasyon ay lumalampas sa teksto. Mula sa mga siyentipikong diagram hanggang sa mga sticker, mga prototype ng video game hanggang sa patula na mga imbitasyon sa kasal, ang GPT-4o ay nagpapatunay na ang imahinasyon ay tunay na walang hangganan.

Habang nawawala ang linya sa pagitan ng imahe at wika, maaaring hindi lang baguhin ng pinakabagong inobasyon ng OpenAI kung paano tayo bumubuo ng mga larawan, ngunit kung paano natin iniisip ang paggamit ng mga ito nang buo.