OpenAI GPT-4o Görüntü Oluşturma'yı Başlattı

Mar 28, 2025

OpenAI, şimdiye kadarki en gelişmiş görüntü oluşturma yeteneğinin lansmanını duyurdu, artık çok modlu modeli GPT-4o'ya doğal olarak entegre edildi. Dil ve görsel ifade arasındaki sınırları bulanıklaştıran bir hamleyle, yeni görüntü oluşturucu güzelliği kullanışlılıkla birleştirerek kullanıcılara basit sohbet tabanlı istemlerden fotogerçekçi, metin açısından doğru ve bağlam farkında görüntüler oluşturma yeteneği sağlıyor.

GPT-4o Görüntü Oluşturma

Sanattan İnfografiklere: Görüntü Üretimi Gerçek Dünya Kullanımıyla Buluşuyor

Sanatsal sürrealizme öncelik veren geleneksel görüntü modellerinin aksine, GPT-4o'nun yeni görüntü oluşturma işlevi pratik uygulama için tasarlanmıştır. Eğitimsel diyagramlar, restoran menüleri, infografikler veya video oyunu varlıkları oluşturmak olsun, araç görselleri hassasiyet ve bağlam farkındalığıyla sunar; bu da üretken görsel yapay zeka için bir sıçramadır.

OpenAI, modelinin bu evriminin "görüntü oluşturmayı bir iletişim aracına dönüştürdüğünü" ve kullanıcıların yalnızca kompozisyon ve stili değil, aynı zamanda metin yerleşimi, sembolik anlam ve yinelemeler arasında sahne sürekliliği gibi işlevsel öğeleri de belirlemesine olanak tanıdığını söylüyor.

Şirket, "GPT-4o'ya şimdiye kadarki en gelişmiş görüntü oluşturucumuzu yerleştirdik," diye duyurdu. "Sonuç: yalnızca güzel değil, aynı zamanda kullanışlı görüntü oluşturma."

Görsel Anlayış İçin Yeni Bir Temel

Bu atılımın özünde, vizyonu ve dili birleşik bir dönüştürücü içinde birleştiren GPT-4o'nun doğal olarak çok modlu mimarisi yer alır. Bu, modelin yüklenen görüntüleri referans almasına, çok adımlı düzenlemelerde tutarlılığı korumasına ve takip istemlerine akıllıca yanıt vermesine olanak tanır ve bu da onu etkileşimli tasarım iyileştirmesinden konuşma prototiplemesine kadar her şey için uygun hale getirir.

OpenAI tarafından sergilenen kullanım örnekleri şunlardır:

  • Kesin anlatım temposuna sahip dört panelli çizgi roman
  • Gömülü görseller ve gerçek dünya bağlamı içeren bir Newton prizma deneyi infografiği
  • Williamsburg, NY'de ayrıntılı, inandırıcı tabelalarla (ve ince mizahla) dolu bir sokak manzarası
  • Kore restoranına ait, zarif yemek resimleri ve doğru metin biçimlendirmesiyle tamamlanmış bir menü

Talimat Takibi ve Bağlam Kesinliği

GPT-4o, testlerde, önceki modellerin sıklıkla zorlandığı bir alan olan, 20'ye kadar farklı nesneyi doğru ilişkilerle işleme yeteneğini göstermiştir. Ayrıca, davetiye kartları, tabelalar ve etkileşimli kullanıcı arayüzü maketleri gibi karmaşık metinsel öğeleri güvenilir dizgi ve düzen kontrolüyle işler.

Örneğin kullanıcılar şunları talep edebilir:

  • Gizemli bir RPG ortamında, oyun kullanıcı arayüzü katmanlarıyla bir kedi dedektifi
  • Şükran Günü hindisini kesmek için kullanılan bir motorlu testerenin reklamı, esprili bir sloganla birlikte
  • Balinalar hakkında suluboya tarzında detaylı bir eğitim çizelgesi

Güvenlik, Menşei ve Şeffaflık

Etkileyici yaratıcı yetenekleri sergilerken, OpenAI güvenlik ve içerik bütünlüğüne olan bağlılığını vurgular. Oluşturulan tüm görseller, GPT-2o ile oluşturulduklarını belirten C4PA meta verilerini içerir. Sistem ayrıca, özgünlüğü doğrulamaya yardımcı olmak için dahili bir görsel arama aracını da entegre eder.

OpenAI, güvenlik politikalarına uyumu garantilemek için yorumlanabilir insan tarafından yazılmış kurallar kullanarak, deepfake veya şiddet içeren içerikler gibi uç durumları belirlemek ve uygunsuz içerikleri engellemek amacıyla akıl yürütmeye dayalı bir moderasyon modeli geliştirdi.

Sınırlamalar hala devam ediyor, bunlar arasında şunlar yer alıyor:

  • Zaman zaman kırpma sorunları yaşanıyor
  • Zorculty yoğun çok dilli veya matematiksel metin oluşturma
  • Belirli görüntü bölgelerinde tutarsız düzenlemeler (örneğin, yüz ayrıntıları)

Şirket, geliştirmelerin sürdüğünü ve gelecekteki güncellemelerde kullanıcı geri bildirimlerinin önemli rol oynayacağını söylüyor.

Kullanılabilirlik ve Erişim

GPT-4o görüntü oluşturucu, bugün itibarıyla Chat'te Ücretsiz, Plus, Pro ve Team kullanıcıları için kullanıma sunuldu ve yakında Kurumsal ve Eğitim müşterilerine de sunulacak. Önümüzdeki haftalarda API üzerinden erişimin sağlanması ve geliştiricilerin programatik kullanımlarının açılması bekleniyor.

Kullanıcılar, aşağıdakileri belirterek basit konuşma komutları aracılığıyla görseller oluşturabilir ve bunlar üzerinde yineleme yapabilir:

  • En boy oranı (örneğin, 16:9)
  • Arkaplan rengi veya şeffaflık
  • Resim stili (gerçekçi, infografik, çizgi roman vb.)
  • Belirli düzen öğeleri (metin, simgeler, konumlandırma)

Render süreleri daha uzun olsa da (çoğu zaman bir dakikaya kadar) OpenAI, daha fazla ayrıntı ve hassasiyet için bu fedakarlığın buna değdiğini savunuyor.

Dil Modelleri İçin Görsel Bir Sıçrama

Yerel görüntü üretimiyle GPT-4o, iletişimin metnin ötesine geçtiği çok modlu AI'nın geleceğine doğru kararlı bir adım atıyor. Bilimsel diyagramlardan çıkartmalara, video oyunu prototiplerinden şiirsel düğün davetiyelerine kadar GPT-4o, hayal gücünün gerçekten sınır tanımadığını kanıtlıyor.

Görüntü ile dil arasındaki çizgi ortadan kalkarken, OpenAI'nin son yeniliği yalnızca görüntüleri nasıl ürettiğimizi değil, bunları kullanma şeklimizi de değiştirebilir.