¿Recuerdas cuando las imágenes generadas por IA eran fáciles de detectar por sus textos llenos de errores? Esa era ha terminado. OpenAI acaba de lanzar ChatGPT Images 2.0, un nuevo modelo de generación de imágenes que promete una precisión sin precedentes, especialmente a la hora de renderizar texto.
Un salto cuántico en la legibilidad
Hace solo dos años, pedirle a un modelo como DALL-E 3 que creara un menú de comida mexicana resultaba en inventos culinarios como «enchuita», «churiros» o «margartas». Ahora, según pruebas de TechCrunch, el nuevo modelo de ChatGPT genera menús que podrían usarse en un restaurante sin que los clientes noten nada extraño. ¡El progreso es asombroso!
Pero, ¿por qué las IAs eran tan malas para deletrear? La explicación técnica apunta a los modelos de difusión. «Los modelos de difusión […] están reconstruyendo una entrada dada», explicó Asmelash Teka Hadgu, CEO de Lesan AI, a TechCrunch. El texto en una imagen es una parte minúscula de los píxeles, por lo que el generador aprendía los patrones que cubrían más área.
Más que solo imágenes bonitas
Aquí está el detalle clave: Images 2.0 no es solo un motor de imágenes más. Tiene «capacidades de pensamiento». Esto le permite buscar en la web, crear múltiples imágenes a partir de un solo prompt y verificar sus propias creaciones.
«Images 2.0 trae un nivel sin precedentes de especificidad y fidelidad a la creación de imágenes. Puede no solo conceptualizar imágenes más sofisticadas, sino que realmente da vida a esa visión de manera efectiva… todo con una resolución de hasta 2K», dijo OpenAI en un comunicado.
Estas capacidades abren la puerta a crear activos de marketing en varios tamaños, tiras cómicas de varios paneles e infografías detalladas. Por ejemplo, un usuario de Wired generó un pronóstico del tiempo para San Francisco con dibujos precisos de monumentos locales.
Personalización y disponibilidad global
El nuevo modelo también es más flexible. Los usuarios pueden ajustar la relación de aspecto de las imágenes, generando desde formatos 3:1 (anchos) hasta 1:3 (altos).
En cuanto al acceso, todos los usuarios de ChatGPT y Codex podrán usar Images 2.0 a partir del martes de lanzamiento, mientras que los usuarios de pago tendrán acceso a salidas más avanzadas. OpenAI también pondrá disponible la API gpt-image-2, con precios que dependen de la calidad y resolución de las salidas.
Un punto débil: los idiomas no latinos
OpenAI afirma que el modelo tiene una comprensión más sólida del renderizado de texto no latino en idiomas como japonés, coreano, hindi y bengalí. Sin embargo, las pruebas prácticas de Wired muestran que aún hay camino por recorrer.
Al pedir un póster en chino, el modelo generó texto que luego describió como «falso, o semi-galimatías vestido para parecer escritura de memes en chino», con caracteres malformados o mezclados con japonés. Así que, aunque el inglés va viento en popa, los resultados globales pueden variar.
El futuro ya está aquí (pero con datos de 2025)
Un detalle crucial para los creadores de contenido: el corte de conocimiento del modelo es diciembre de 2025. Esto podría afectar la precisión al generar prompts sobre noticias muy recientes.
La generación de imágenes complejas no es tan rápida como hacer una pregunta a ChatGPT, pero crear algo como una tira cómica de varios paneles sigue tomando solo unos minutos. La espera vale la pena por la calidad.
Con esta actualización, la línea entre lo creado por humanos y lo generado por IA se desdibuja aún más. ¿Estás listo para un mundo donde un menú de restaurante perfecto pueda ser creado en segundos? La revolución visual de la IA acaba de subir otro escalón.









