OpenAI telah mengumumkan peluncuran kemampuan pembuatan gambar tercanggihnya, yang kini terintegrasi secara native ke dalam model multimodanya, GPT-4o. Dalam langkah yang mengaburkan batasan antara bahasa dan ekspresi visual, pembuat gambar baru ini menggabungkan keindahan dengan utilitas, yang memberi pengguna kemampuan untuk membuat gambar yang realistis, akurat dalam teks, dan sesuai konteks dari perintah berbasis obrolan sederhana.

Dari Seni hingga Infografis: Pembuatan Gambar Bertemu dengan Penggunaan di Dunia Nyata
Tidak seperti model gambar tradisional yang mengutamakan surealisme artistik, fungsi pembuatan gambar baru GPT-4o dirancang untuk aplikasi praktis. Baik untuk membuat diagram edukasi, menu restoran, infografis, atau aset permainan video, alat ini memberikan visual dengan presisi dan kesadaran konteks, sebuah lompatan maju untuk AI visual generatif.
OpenAI mengatakan evolusi modelnya ini “mengubah pembuatan gambar menjadi alat komunikasi,” yang memungkinkan pengguna menentukan tidak hanya komposisi dan gaya, tetapi juga elemen fungsional seperti penempatan teks, makna simbolis, dan kesinambungan adegan di seluruh iterasi.
"Kami telah membangun generator gambar tercanggih kami ke dalam GPT-4o," perusahaan itu mengumumkan. "Hasilnya – pembuatan gambar yang tidak hanya indah, tetapi juga bermanfaat."
Landasan Baru untuk Pemahaman Visual
Inti dari terobosan ini adalah arsitektur multimoda bawaan GPT-4o, yang memadukan visi dan bahasa dalam satu transformator terpadu. Hal ini memungkinkan model untuk merujuk pada gambar yang diunggah, menjaga koherensi melalui penyuntingan multi-langkah, dan merespons perintah tindak lanjut secara cerdas, sehingga sangat cocok untuk segala hal mulai dari penyempurnaan desain interaktif hingga pembuatan prototipe percakapan.
Kasus penggunaan yang dipamerkan oleh OpenAI meliputi:
- Komik strip empat panel dengan alur naratif yang tepat
- Infografis eksperimen prisma Newton dengan visual tertanam dan konteks dunia nyata
- Pemandangan jalan di Williamsburg, NY yang dipenuhi dengan rambu-rambu yang terperinci dan meyakinkan (dan humor yang halus)
- Menu untuk restoran Korea, lengkap dengan ilustrasi hidangan yang elegan dan format teks yang benar
Mengikuti Instruksi dan Ketepatan Konteks
Dalam pengujian, GPT-4o telah menunjukkan kemampuan untuk merender hingga 20 objek berbeda dengan hubungan yang benar, suatu area yang sering kali menjadi kendala model sebelumnya. Ia juga menangani elemen tekstual yang kompleks, seperti kartu undangan, tanda, dan tiruan UI interaktif, dengan pengaturan huruf dan kontrol tata letak yang andal.
Misalnya, pengguna dapat meminta:
- Detektif kucing dalam latar RPG misteri, dengan hamparan UI game
- Iklan gergaji mesin yang digunakan untuk memotong kalkun Thanksgiving, dengan slogan yang lucu
- Bagan edukasi terperinci tentang paus dalam gaya cat air
Keamanan, Keaslian, dan Transparansi
Sambil memamerkan kemampuan kreatif yang mengesankan, OpenAI menekankan komitmennya terhadap keamanan dan integritas konten. Semua gambar yang dihasilkan menyertakan metadata C2PA, yang menunjukkan bahwa gambar tersebut dibuat dengan GPT-4o. Sistem ini juga mengintegrasikan alat pencarian gambar internal untuk membantu memverifikasi keaslian.
OpenAI telah melatih model moderasi berbasis penalaran untuk memastikan kepatuhan terhadap kebijakan keselamatan, menggunakan aturan tertulis manusia yang dapat ditafsirkan untuk mengidentifikasi kasus-kasus ekstrem dan memblokir konten yang tidak pantas, seperti deepfake atau kekerasan grafis.
Masih ada keterbatasan, termasuk:
- Masalah pemotongan sesekali
- Kesulitanculty rendering teks multibahasa atau matematika yang padat
- Pengeditan yang tidak konsisten pada area gambar tertentu (misalnya, detail wajah)
Perusahaan mengatakan perbaikan sedang dilakukan, dan masukan pengguna akan memainkan peran penting dalam pembaruan di masa mendatang.
Ketersediaan dan Akses
Generator gambar GPT-4o tersedia mulai hari ini di Chat untuk pengguna Gratis, Plus, Pro, dan Tim, dan akan segera ditawarkan kepada pelanggan Enterprise dan Education. Akses melalui API diperkirakan akan tersedia dalam beberapa minggu mendatang, membuka akses terprogram bagi para pengembang.
Pengguna dapat membuat dan mengulangi gambar melalui perintah percakapan sederhana, dengan menentukan:
- Rasio aspek (misalnya, 16:9)
- Warna latar belakang atau transparansi
- Gaya gambar (realistis, infografis, komik, dll.)
- Elemen tata letak tertentu (teks, ikon, posisi)
Meskipun waktu render lebih lama – sering kali hingga satu menit – OpenAI tetap mempertahankan pengorbanan tersebut sepadan dengan detail dan presisi yang lebih tinggi.
Lompatan Visual untuk Model Bahasa
Dengan pembuatan gambar asli, GPT-4o mengambil langkah tegas menuju masa depan AI multimodal, di mana komunikasi melampaui teks. Dari diagram ilmiah hingga stiker, prototipe gim video hingga undangan pernikahan yang puitis, GPT-4o membuktikan bahwa imajinasi benar-benar tidak mengenal batas.
Saat garis antara gambar dan bahasa menghilang, inovasi terbaru OpenAI mungkin tidak hanya mengubah cara kita menghasilkan gambar, tetapi juga cara kita berpikir tentang penggunaan gambar secara keseluruhan.