OpenAI lanza la generación de imágenes GPT-4o

28 de marzo de 2025

OpenAI ha anunciado el lanzamiento de su capacidad de generación de imágenes más avanzada hasta la fecha, ahora integrada de forma nativa en su modelo multimodal, GPT-4o. En una iniciativa que difumina las fronteras entre el lenguaje y la expresión visual, el nuevo generador de imágenes combina belleza y utilidad, ofreciendo a los usuarios la capacidad de generar imágenes fotorrealistas, con precisión textual y contextuales a partir de sencillas indicaciones de chat.

Generación de imágenes GPT-4o

Del arte a la infografía: la generación de imágenes se une al uso en el mundo real

A diferencia de los modelos de imagen tradicionales que priorizan el surrealismo artístico, la nueva función de generación de imágenes de GPT-4o está diseñada para aplicaciones prácticas. Ya sea para crear diagramas educativos, menús de restaurantes, infografías o recursos para videojuegos, la herramienta ofrece imágenes con precisión y conocimiento del contexto, un gran avance para la IA visual generativa.

OpenAI afirma que esta evolución de su modelo “transforma la generación de imágenes en una herramienta de comunicación”, permitiendo a los usuarios especificar no solo la composición y el estilo, sino también elementos funcionales como la ubicación del texto, el significado simbólico y la continuidad de la escena a lo largo de las iteraciones.

"Hemos integrado nuestro generador de imágenes más avanzado hasta la fecha en GPT-4o", anunció la compañía. "El resultado: una generación de imágenes que no solo es atractiva, sino también útil".

Una nueva base para la comprensión visual

En el centro de este avance se encuentra la arquitectura multimodal nativa de GPT-4o, que integra visión y lenguaje en un transformador unificado. Esto permite que el modelo haga referencia a imágenes cargadas, mantenga la coherencia durante ediciones de varios pasos y responda de forma inteligente a las indicaciones posteriores, lo que lo hace ideal para todo, desde el perfeccionamiento del diseño interactivo hasta la creación de prototipos conversacionales.

Los casos de uso mostrados por OpenAI incluyen:

  • Una tira cómica de cuatro paneles con un ritmo narrativo preciso.
  • Una infografía del experimento del prisma de Newton con elementos visuales integrados y contexto del mundo real.
  • Una escena callejera en Williamsburg, Nueva York, llena de carteles detallados y creíbles (y humor sutil)
  • Un menú para un restaurante coreano, completo con elegantes ilustraciones de platos y formato de texto correcto.

Seguimiento de instrucciones y precisión del contexto

En pruebas, GPT-4o ha demostrado su capacidad para renderizar hasta 20 objetos distintos con relaciones correctas, un aspecto donde los modelos anteriores solían presentar dificultades. También gestiona elementos textuales complejos, como tarjetas de invitación, letreros y maquetas interactivas de interfaz de usuario, con un control fiable de composición tipográfica y maquetación.

Por ejemplo, los usuarios pueden solicitar:

  • Un gato detective en un entorno de juego de rol misterioso, con superposiciones de interfaz de juego.
  • Un anuncio de una motosierra utilizada para cortar el pavo de Acción de Gracias, con un eslogan humorístico.
  • Un cuadro educativo detallado sobre las ballenas en estilo acuarela.

Seguridad, procedencia y transparencia

Además de demostrar unas impresionantes capacidades creativas, OpenAI enfatiza su compromiso con la seguridad y la integridad del contenido. Todas las imágenes generadas incluyen metadatos C2PA, lo que indica que fueron creadas con GPT-4o. El sistema también integra una herramienta interna de búsqueda de imágenes para verificar la autenticidad.

OpenAI ha entrenado un modelo de moderación basado en el razonamiento para garantizar el cumplimiento de las políticas de seguridad, utilizando reglas interpretables escritas por humanos para identificar casos extremos y bloquear contenido inapropiado, como deepfakes o violencia gráfica.

Aún persisten limitaciones, entre ellas:

  • Problemas ocasionales de recorte
  • Difícilculty renderizar texto denso multilingüe o matemático
  • Ediciones inconsistentes en regiones específicas de la imagen (por ejemplo, detalles faciales)

La compañía dice que se están realizando mejoras y que los comentarios de los usuarios jugarán un papel crucial en futuras actualizaciones.

Disponibilidad y acceso

El generador de imágenes GPT-4o está disponible desde hoy en Chat para usuarios de Free, Plus, Pro y Team, y próximamente estará disponible para clientes de Enterprise y Education. Se espera que el acceso a través de la API se realice en las próximas semanas, lo que facilitará el uso programático para desarrolladores.

Los usuarios pueden generar e iterar imágenes a través de indicaciones conversacionales simples, especificando:

  • Relación de aspecto (por ejemplo, 16:9)
  • Color de fondo o transparencia
  • Estilo de imagen (realista, infográfico, cómic, etc.)
  • Elementos de diseño específicos (texto, iconos, posicionamiento)

Si bien los tiempos de renderizado son más largos (a menudo hasta un minuto), OpenAI sostiene que vale la pena el esfuerzo para lograr un mayor nivel de detalle y precisión.

Un salto visual para los modelos lingüísticos

Con la generación nativa de imágenes, GPT-4o da un paso decisivo hacia el futuro de la IA multimodal, donde la comunicación trasciende el texto. Desde diagramas científicos hasta pegatinas, prototipos de videojuegos e invitaciones de boda poéticas, GPT-4o demuestra que la imaginación no tiene límites.

A medida que se disuelve la línea entre la imagen y el lenguaje, la última innovación de OpenAI puede no sólo cambiar el modo en que generamos imágenes, sino también cómo pensamos sobre su uso en general.