OpenAI lança geração de imagens GPT-4o

28 de março de 2025

A OpenAI anunciou o lançamento de sua capacidade de geração de imagens mais avançada até agora, agora integrada nativamente em seu modelo multimodal, GPT-4o. Em um movimento que confunde os limites entre linguagem e expressão visual, o novo gerador de imagens combina beleza com utilidade, dando aos usuários a capacidade de gerar imagens fotorrealistas, precisas em texto e sensíveis ao contexto a partir de simples prompts baseados em bate-papo.

Geração de imagem GPT-4o

Da arte aos infográficos: a geração de imagens encontra o uso no mundo real

Diferentemente dos modelos de imagem tradicionais que priorizam o surrealismo artístico, a nova função de geração de imagem do GPT-4o é projetada para aplicação prática. Seja criando diagramas educacionais, cardápios de restaurantes, infográficos ou ativos de videogame, a ferramenta fornece visuais com precisão e consciência de contexto, um salto à frente para a IA visual generativa.

A OpenAI diz que essa evolução de seu modelo “transforma a geração de imagens em uma ferramenta de comunicação”, permitindo que os usuários especifiquem não apenas composição e estilo, mas também elementos funcionais como posicionamento de texto, significado simbólico e continuidade de cena entre iterações.

“Construímos nosso gerador de imagens mais avançado até agora no GPT-4o”, anunciou a empresa. “O resultado – geração de imagens que não é apenas bonita, mas útil.”

Uma nova base para a compreensão visual

No centro dessa inovação está a arquitetura nativamente multimodal do GPT-4o, que integra visão e linguagem em um transformador unificado. Isso permite que o modelo faça referência a imagens carregadas, mantenha a coerência em edições de várias etapas e responda de forma inteligente a prompts de acompanhamento, tornando-o adequado para tudo, desde o refinamento de design interativo até a prototipagem conversacional.

Os casos de uso apresentados pela OpenAI incluem:

  • Uma história em quadrinhos de quatro painéis com ritmo narrativo preciso
  • Um infográfico de experimento de prisma de Newton com visuais incorporados e contexto do mundo real
  • Uma cena de rua em Williamsburg, NY, repleta de placas detalhadas e críveis (e humor sutil)
  • Um menu para um restaurante coreano, completo com ilustrações elegantes de pratos e formatação de texto correta

Precisão de contexto e seguimento de instruções

Em testes, o GPT-4o demonstrou a capacidade de renderizar até 20 objetos distintos com relacionamentos corretos, uma área em que modelos anteriores frequentemente tinham dificuldades. Ele também lida com elementos textuais complexos, como cartões de convite, placas e mockups de UI interativos, com controle confiável de composição e layout.

Por exemplo, os usuários podem solicitar:

  • Um detetive gato em um cenário de RPG de mistério, com sobreposições de IU de jogo
  • Um anúncio de uma motosserra usada para cortar peru de Ação de Graças, com um slogan humorístico
  • Um gráfico educacional detalhado sobre baleias em estilo aquarela

Segurança, Proveniência e Transparência

Ao mesmo tempo em que demonstra capacidades criativas impressionantes, a OpenAI enfatiza seu comprometimento com a segurança e integridade do conteúdo. Todas as imagens geradas incluem metadados C2PA, indicando que foram criadas com GPT-4o. O sistema também integra uma ferramenta interna de busca de imagens para ajudar a verificar a autenticidade.

A OpenAI treinou um modelo de moderação baseado em raciocínio para garantir a conformidade com as políticas de segurança, usando regras interpretáveis ​​escritas por humanos para identificar casos extremos e bloquear conteúdo inapropriado, como deepfakes ou violência gráfica.

Ainda existem limitações, incluindo:

  • Problemas ocasionais de corte
  • Difícilculte renderizando texto denso multilíngue ou matemático
  • Edições inconsistentes em regiões específicas da imagem (por exemplo, detalhes faciais)

A empresa diz que melhorias estão em andamento e que o feedback dos usuários desempenhará um papel crucial em atualizações futuras.

Disponibilidade e acesso

O gerador de imagens GPT-4o está disponível a partir de hoje no Chat para usuários Free, Plus, Pro e Team, e em breve será oferecido para clientes Enterprise e Education. O acesso via API está previsto para as próximas semanas, liberando o uso programático para desenvolvedores.

Os usuários podem gerar e iterar imagens por meio de prompts de conversação simples, especificando:

  • Proporção de aspecto (por exemplo, 16:9)
  • Cor de fundo ou transparência
  • Estilo de imagem (realista, infográfico, cômico, etc.)
  • Elementos de layout específicos (texto, ícones, posicionamento)

Embora os tempos de renderização sejam maiores – geralmente até um minuto – a OpenAI afirma que a troca vale a pena para obter mais detalhes e precisão.

Um salto visual para modelos de linguagem

Com a geração de imagens nativas, o GPT-4o dá um passo decisivo em direção ao futuro da IA ​​multimodal, onde a comunicação transcende o texto. De diagramas científicos a adesivos, protótipos de videogame a convites de casamento poéticos, o GPT-4o está provando que a imaginação realmente não conhece limites.

À medida que a linha entre imagem e linguagem se dissolve, a mais recente inovação da OpenAI pode não apenas mudar a forma como geramos imagens, mas também a forma como pensamos sobre seu uso.