OpenAI lansează GPT-4o Image Generation

Mar 28, 2025

OpenAI a anunțat lansarea celei mai avansate capacități de generare de imagini de până acum, integrată acum nativ în modelul său multimodal, GPT-4o. Într-o mișcare care estompează granițele dintre limbaj și expresia vizuală, noul generator de imagini combină frumusețea cu utilitatea, oferind utilizatorilor posibilitatea de a genera imagini fotorealiste, exacte în text și conștiente de context din mesaje simple bazate pe chat.

GPT-4o Generare de imagini

De la artă la infografică: generarea de imagini se întâlnește cu utilizarea în lumea reală

Spre deosebire de modelele tradiționale de imagine care acordă prioritate suprarealismului artistic, noua funcție de generare a imaginii a GPT-4o este concepută pentru aplicare practică. Indiferent dacă creează diagrame educaționale, meniuri de restaurante, infografice sau elemente de jocuri video, instrumentul oferă imagini cu precizie și conștientizare a contextului, un salt înainte pentru AI vizuală generativă.

OpenAI spune că această evoluție a modelului său „transformă generarea de imagini într-un instrument de comunicare”, permițând utilizatorilor să specifice nu numai compoziția și stilul, ci și elemente funcționale cum ar fi plasarea textului, semnificația simbolică și continuitatea scenei de-a lungul iterațiilor.

„Am construit cel mai avansat generator de imagini de până acum în GPT-4o”, a anunțat compania. „Rezultatul – generarea de imagini care nu este doar frumoasă, ci și utilă.”

O nouă fundație pentru înțelegerea vizuală

În centrul acestei descoperiri se află arhitectura multimodală nativă a lui GPT-4o, care integrează viziunea și limbajul într-un transformator unificat. Acest lucru permite modelului să facă referire la imaginile încărcate, să mențină coerența editărilor în mai mulți pași și să răspundă inteligent la solicitările ulterioare, făcându-l potrivit pentru orice, de la rafinarea designului interactiv până la prototiparea conversațională.

Cazurile de utilizare prezentate de OpenAI includ:

  • O bandă desenată cu patru panouri, cu un ritm narativ precis
  • O infografică a experimentului cu prisme Newton cu elemente vizuale încorporate și context din lumea reală
  • O scenă de stradă din Williamsburg, NY, plină de semne detaliate și credibile (și umor subtil)
  • Un meniu pentru un restaurant coreean, completat cu ilustrații elegante ale preparatelor și formatare corectă a textului

Urmărirea instrucțiunilor și precizia contextului

În teste, GPT-4o a demonstrat capacitatea de a reda până la 20 de obiecte distincte cu relații corecte, un domeniu în care modelele anterioare s-au luptat adesea. De asemenea, gestionează elemente textuale complexe, cum ar fi cărți de invitație, semne și machete interactive de interfață de utilizare, cu control fiabil de compunere și aspect.

De exemplu, utilizatorii pot solicita:

  • Un detectiv de pisici într-un cadru RPG misterios, cu suprapuneri de interfață de utilizare a jocului
  • O reclamă pentru un ferăstrău cu lanț obișnuia să sculpteze curcanul de Ziua Recunoștinței, cu un slogan plin de umor
  • O diagramă educațională detaliată despre balene în stil acuarelă

Siguranță, proveniență și transparență

În timp ce prezintă capacități creative impresionante, OpenAI își subliniază angajamentul față de siguranță și integritatea conținutului. Toate imaginile generate includ metadate C2PA, indicând că au fost create cu GPT-4o. Sistemul integrează, de asemenea, un instrument intern de căutare a imaginilor pentru a ajuta la verificarea autenticității.

OpenAI a antrenat un model de moderare bazat pe raționament pentru a asigura conformitatea cu politicile de siguranță, folosind reguli interpretabile scrise de oameni pentru a identifica cazurile marginale și pentru a bloca conținutul neadecvat, cum ar fi deepfake-urile sau violența grafică.

Limitările rămân încă, inclusiv:

  • Probleme ocazionale de tăiere
  • Difficulty redarea textului dens multilingv sau matematic
  • Editări inconsecvente în anumite regiuni ale imaginii (de exemplu, detalii faciale)

Compania spune că sunt în desfășurare îmbunătățiri, iar feedbackul utilizatorilor va juca un rol crucial în actualizările viitoare.

Disponibilitate și acces

Generatorul de imagini GPT-4o este disponibil începând de astăzi pentru utilizatorii Chat for Free, Plus, Pro și Team și va fi oferit în curând clienților Enterprise și Education. Accesul prin intermediul API-ului este așteptat în următoarele săptămâni, deblocând utilizarea programatică pentru dezvoltatori.

Utilizatorii pot genera și itera imagini prin intermediul unor mesaje conversaționale simple, specificând:

  • Raport de aspect (de exemplu, 16:9)
  • Culoare de fundal sau transparență
  • Stil de imagine (realist, infografic, benzi desenate etc.)
  • Elemente specifice de aspect (text, pictograme, poziționare)

Deși timpii de randare sunt mai lungi - adesea până la un minut - OpenAI susține că compromisul merită pentru detalii și precizie mai mari.

Un salt vizual pentru modelele de limbaj

Cu generarea nativă a imaginilor, GPT-4o face un pas decisiv către viitorul AI multimodal, unde comunicarea transcende textul. De la diagrame științifice la autocolante, prototipuri de jocuri video până la invitații de nuntă poetice, GPT-4o demonstrează că imaginația cu adevărat nu cunoaște limite.

Pe măsură ce granița dintre imagine și limbaj se dizolvă, cea mai recentă inovație a OpenAI s-ar putea să schimbe nu doar modul în care generăm imagini, ci și modul în care ne gândim să le folosim în totalitate.