OpenAI запускає генерацію зображень GPT-4o

Березень 28, 2025

OpenAI оголосила про запуск найдосконалішої можливості генерації зображень, яка тепер інтегрована в мультимодальну модель GPT-4o. У ході, який стирає межі між мовою та візуальним виразом, новий генератор зображень поєднує в собі красу з корисністю, надаючи користувачам можливість створювати фотореалістичні, точні до тексту та контекстні зображення за допомогою простих підказок у чаті.

GPT-4o Генерація зображень

Від мистецтва до інфографіки: генерація зображень зустрічається з реальним використанням

На відміну від традиційних моделей зображень, які віддають перевагу художньому сюрреалізму, нова функція генерації зображень GPT-4o розроблена для практичного застосування. Незалежно від того, чи створюєте ви навчальні діаграми, меню ресторану, інфографіку чи активи відеоігор, інструмент надає візуальні ефекти з точністю та з урахуванням контексту, що є кроком вперед для генеративного візуального штучного інтелекту.

OpenAI каже, що ця еволюція моделі «перетворює генерацію зображень на інструмент для спілкування», дозволяючи користувачам визначати не лише композицію та стиль, але й функціональні елементи, такі як розміщення тексту, символічне значення та безперервність сцени через ітерації.

«Ми вбудували наш найдосконаліший генератор зображень у GPT-4o», — оголосила компанія. «Результат – створення не тільки красивого, але й корисного зображення».

Нова основа для візуального розуміння

В основі цього прориву лежить оригінальна мультимодальна архітектура GPT-4o, яка об’єднує бачення та мову в єдиний трансформатор. Це дозволяє моделі посилатися на завантажені зображення, підтримувати узгодженість під час багатоетапного редагування та розумно реагувати на наступні підказки, що робить її добре придатною для всього, від інтерактивного вдосконалення дизайну до розмовного прототипування.

Варіанти використання, представлені OpenAI, включають:

  • Комікс із чотирьох панелей із точним темпом оповіді
  • Інфографіка експерименту з призмою Ньютона з вбудованими візуальними елементами та контекстом реального світу
  • Вулична сцена у Вільямсбурзі, штат Нью-Йорк, наповнена детальними, правдоподібними знаками (і тонким гумором)
  • Меню для корейського ресторану з елегантними ілюстраціями страв і правильним форматуванням тексту

Дотримання інструкцій і точність контексту

Під час тестування GPT-4o продемонстрував здатність відтворювати до 20 окремих об’єктів із правильними взаємозв’язками, у цій сфері попередні моделі часто мали проблеми. Він також обробляє складні текстові елементи, такі як запрошення, вивіски та інтерактивні макети інтерфейсу користувача, з надійним контролем набору тексту та макета.

Наприклад, користувачі можуть запитувати:

  • Котячий детектив у таємничій RPG із накладками інтерфейсу користувача
  • Реклама бензопили, якою вирізають індичку на День подяки, із жартівливим гаслом
  • Детальна освітня схема про китів у стилі акварелі

Безпека, походження та прозорість

Демонструючи вражаючі творчі здібності, OpenAI підкреслює свою відданість безпеці та цілісності вмісту. Усі створені зображення містять метадані C2PA, що вказує на те, що вони були створені за допомогою GPT-4o. Система також інтегрує внутрішній інструмент пошуку зображень, щоб допомогти перевірити автентичність.

OpenAI навчив модель модерації на основі аргументації, щоб забезпечити відповідність політикам безпеки, використовуючи написані людиною правила, які можна інтерпретувати, щоб ідентифікувати крайні випадки та блокувати неприйнятний вміст, наприклад глибокі фейки чи графічне насильство.

Обмеження все ще залишаються, зокрема:

  • Випадкові проблеми з кадруванням
  • важкоculty відтворення щільного багатомовного або математичного тексту
  • Непослідовне редагування окремих областей зображення (наприклад, деталей обличчя)

Компанія каже, що вдосконалення тривають, і відгуки користувачів відіграватимуть вирішальну роль у майбутніх оновленнях.

Доступність та доступ

Генератор зображень GPT-4o доступний з сьогоднішнього дня для користувачів Chat for Free, Plus, Pro та Team, а незабаром буде запропоновано клієнтам Enterprise та Education. Доступ через API очікується найближчими тижнями, що відкриє розробникам можливість програмного використання.

Користувачі можуть створювати та повторювати зображення за допомогою простих розмовних підказок, вказуючи:

  • Співвідношення сторін (наприклад, 16:9)
  • Колір фону або прозорість
  • Стиль зображення (реалістичний, інфографіка, комікс тощо)
  • Спеціальні елементи макета (текст, значки, позиціонування)

Хоча час візуалізації довший – часто до однієї хвилини – OpenAI стверджує, що компроміс того вартий для більшої деталізації та точності.

Візуальний стрибок для мовних моделей

Завдяки створенню оригінальних зображень GPT-4o робить рішучий крок до майбутнього мультимодального штучного інтелекту, де спілкування виходить за межі тексту. Від наукових схем до наклейок, прототипів відеоігор до поетичних запрошень на весілля, GPT-4o доводить, що уява справді не має меж.

Оскільки межа між зображенням і мовою зникає, остання інновація OpenAI може змінити не лише те, як ми створюємо зображення, але й те, як ми взагалі думаємо про їх використання.