OpenAI ha vuelto a capturar la atención del mundo tecnológico con el anuncio de ChatGPT Images 2, el nuevo modelo de generación de imágenes que promete revolucionar la forma en que se crean contenidos visuales. Tras el reciente cierre de su aplicación de videos virales Sora, la empresa ha reafirmado su compromiso de centrarse en productos clave que aporten valor económico. Este lanzamiento es una clara apuesta por fortalecer su visión de una super aplicación que integre todas las capacidades de la inteligencia artificial que han desarrollado.
ChatGPT Images 2 se presenta como una herramienta orientada a la generación de imágenes con alto contenido textual, tales como infografías, guías de estudio, carteles científicos y materiales de marketing. OpenAI ha dejado atrás los días de videos extraños y memes inspirados en Studio Ghibli, para concentrarse en tareas creativas de valor económico, según explicó Adele Li, líder de producto de ChatGPT Images, durante una conferencia de prensa.
La nueva generación del modelo de imágenes mejora considerablemente aspectos como la tipografía, iconografía y composición, logrando imágenes más profesionales y precisas. Además, es capaz de generar texto en múltiples idiomas, una característica que representa un avance significativo respecto a modelos anteriores que tenían dificultades para crear texto legible y factualmente correcto. Google había intentado mejorar la representación del texto con su modelo Nano Banana Pro, pero incluso este enfrentó problemas de precisión.
El acceso a ChatGPT Images 2 está disponible para todos los usuarios, aunque la cantidad de imágenes que se pueden generar depende del plan de suscripción. Los desarrolladores que utilicen el modelo a través de la API pueden crear imágenes en resoluciones de 2K y 4K, aunque estas características aún se encuentran en fase beta y podrían presentar algunos fallos. Los usuarios con suscripción de pago tienen la opción de utilizar modelos de pensamiento y razonamiento para buscar información en la web, compilarla en un diseño legible y verificar su precisión.
A pesar de que el término “modelo de imagen” es técnicamente correcto, ChatGPT Images 2 se diferencia de otros generadores de imágenes AI como Midjourney, que se centra en el surrealismo artístico, o Adobe Firefly, que ofrece herramientas de edición profesional. Este nuevo modelo está diseñado para usuarios que necesitan crear contenido atractivo, posicionándose en un punto intermedio entre los entusiastas del arte de Midjourney y los creadores profesionales de Adobe.
ChatGPT Images 2 se dirige especialmente a profesionales como docentes y gerentes de marketing. Los profesores pueden utilizarlo para desarrollar guías de estudio y planes de lecciones ilustrados, mientras que los responsables de marketing pueden crear publicaciones para redes sociales y activos visuales. Es posible generar hasta ocho imágenes a partir de una sola entrada, manteniendo la consistencia visual en todas ellas.
Uno de los inconvenientes actuales es que, para modificar una imagen generada por AI, se debe volver a generar por completo, lo cual podría consumir créditos más rápidamente, especialmente en diseños con mucho texto. OpenAI ha señalado que se están enfocando en mantener un flujo de edición iterativo basado en prompts para garantizar su facilidad de uso.
En cuanto a la seguridad, OpenAI mantiene procedimientos similares a los de su modelo anterior. Las imágenes generadas incluyen metadatos a través del estándar C2PA para identificar su origen y se prohíbe la creación de imágenes abusivas o ilegales, una medida esencial para prevenir el uso indebido de la tecnología, como se ha visto en casos recientes de deepfakes generados por AI y contenido íntimo no consensuado.
Con este nuevo modelo, OpenAI no solo busca afianzar su posición en el mercado de la inteligencia artificial, sino también establecer un nuevo estándar en la creación de contenido visual que combina creatividad y funcionalidad en beneficio de los usuarios profesionales.