A los generadores de imágenes con IA les cuesta la ortografía porque dibujan imágenes, no texto. Aprenden cómo se ven las letras como formas y patrones de píxeles, y nunca escriben una palabra letra a letra, así que un pequeño desliz puede convertir «PANADERÍA» en «PANADRERÍA». Muchos de ellos también leen tu instrucción en fragmentos de palabra y no en letras individuales, lo que hace aún más difícil acertar con la ortografía exacta.
Los generadores más nuevos manejan el texto corto mucho mejor que los primeros, pero los pasajes largos, las letras pequeñas, los nombres poco habituales y las escrituras no latinas siguen causando errores. Si ya tienes una imagen con palabras rotas, a menudo puedes corregir el texto de las imágenes generadas con IA sin empezar de cero. Esta guía explica por qué ocurren los errores, cómo redactar la instrucción para obtener mejor texto y cómo repararlo después, tanto si la imagen salió de Midjourney, ChatGPT, Gemini o Stable Diffusion como de otro generador.
Cómo crean una imagen los generadores de IA
Muchos generadores de imágenes populares usan un método llamado modelo de difusión. El modelo parte de ruido aleatorio, parecido a la nieve de un televisor sin señal, y elimina un poco de ese ruido en cada uno de muchos pasos. Tu instrucción guía cada paso, de modo que el ruido se va convirtiendo poco a poco en una imagen que coincide con tu descripción. Toda la imagen se refina a la vez: el cielo, las caras y las letras van tomando forma al mismo tiempo.
No todos los generadores funcionan así. Algunos construyen la imagen como una secuencia de piezas pequeñas. Pero, en general, los modelos de texto a imagen comparten un rasgo importante: predicen cómo debería verse la imagen. No hay ningún paso en el que el modelo elija una fuente y escriba «P», luego «A» y luego «N». Las letras aparecen solo como formas que parecen correctas, y por eso pueden salir casi bien, pero no del todo.
Por qué el texto es tan difícil para los generadores de imágenes
Varias causas actúan a la vez. Cada una hace más probable un pequeño error, y el texto es un lugar donde los errores pequeños se ven con facilidad.
Las letras son detalles diminutos con reglas estrictas
Un árbol puede tener cualquier número de ramas y seguir pareciendo un árbol. Una palabra tiene exactamente una ortografía correcta. El texto también tiene reglas que se aplican a toda la palabra: todas las letras necesitan el mismo estilo y la misma altura, el espaciado debe ser uniforme y las letras deben apoyarse en la misma línea. Un trazo de más, una letra que falta o una letra duplicada se nota a cualquiera que lea el idioma, aunque el resto de la imagen parezca real.
Puede que el modelo nunca vea las letras que escribiste
Antes de que un generador pueda usar tu instrucción, un componente llamado codificador de texto la convierte en números. Muchos codificadores de texto empiezan dividiendo la instrucción en tokens. Las palabras comunes suelen convertirse en un solo token, mientras que las palabras menos frecuentes se dividen en varias piezas. Un método muy extendido para construir esas piezas es la codificación de pares de bytes. El enfoque es eficiente, pero el modelo recibe un identificador por cada pieza, no las letras que hay dentro. Tiene que aprender, a partir de ejemplos, que una determinada pieza se dibuja como una determinada fila de letras.
Un artículo de Google Research, Character-Aware Models Improve Visual Text Rendering, estudió esto directamente. Los investigadores compararon codificadores de texto que ven los caracteres individuales («character-aware», conscientes de los caracteres) con codificadores que solo ven fragmentos de palabra («character-blind», ciegos a los caracteres). Los modelos de imagen con codificadores conscientes de los caracteres representaban el texto visual con más exactitud y destacaban sobre todo con las palabras poco frecuentes. El artículo también observó que los modelos de lenguaje muy grandes y ciegos a los caracteres pueden aprender a deletrear bien, pero que esa capacidad no se trasladaba bien más allá del inglés y solo aparecía en modelos mucho más grandes que los codificadores de texto que solían usar los generadores de imágenes en aquel momento.
Las imágenes de entrenamiento suelen mostrar mal el texto
Los generadores aprenden a partir de colecciones muy grandes de imágenes emparejadas con descripciones. En esas imágenes, el texto suele ser pequeño, borroso, estar cortado, verse en ángulo o estar parcialmente oculto, y aparece en una enorme variedad de fuentes y estilos. La descripción que acompaña a una imagen puede no mencionar siquiera su texto. Así que el modelo ve muchos ejemplos de qué aspecto tiene el texto en general, pero menos ejemplos claros de cómo debe escribirse exactamente una palabra concreta.
El texto pequeño tiene muy pocos píxeles
Un titular puede ocupar cientos de píxeles, mientras que una palabra de letra pequeña quizá disponga de solo unos pocos píxeles por letra. Además, muchos generadores trabajan con una versión comprimida de la imagen y reconstruyen la imagen a tamaño completo al final, lo que deja todavía menos espacio para los detalles pequeños. Las líneas finas, como la barra de una «e» minúscula, se pierden con facilidad.
Por qué los modelos más nuevos escriben mejor el texto
Los generadores de imágenes han mejorado mucho con los titulares y las etiquetas cortos. En general, los sistemas más nuevos usan modelos de lenguaje más potentes para entender la instrucción, y los desarrolladores han prestado más atención al texto durante el entrenamiento. La investigación citada arriba apunta en la misma dirección: los modelos que reciben mejor información sobre las letras dibujan el texto con más exactitud.
La mejora es real, pero desigual. Un generador que escribe correctamente un título de tres palabras todavía puede tener dificultades con un párrafo, un menú o una etiqueta en un idioma que vio con menos frecuencia durante el entrenamiento.
Dónde siguen teniendo problemas los generadores de imágenes
- Texto largo. Párrafos, menús y listas, donde cada palabra de más es otra oportunidad de error
- Texto pequeño. Letra pequeña, etiquetas y texto lejano en una escena
- Palabras poco habituales. Nombres, palabras inventadas, términos nuevos y números largos, como números de teléfono o códigos
- Escrituras no latinas. Árabe, chino, hindi, japonés, coreano, tailandés y otros sistemas de escritura, así como las letras con acento
- Muchos bloques de texto. Carteles e infografías con varios fragmentos de texto separados
- Superficies curvas o inclinadas. Texto en una botella, una bandera o un cartel visto de lado
- Coherencia. Mantener idéntico el mismo texto en una serie de imágenes
Son patrones comunes y no reglas fijas, y varían según el generador y la versión.
Cómo conseguir mejor texto al generar una imagen
- Pon las palabras exactas entre comillas. Por ejemplo, pide un cartel con el título «MERCADO NOCTURNO» en lugar de un cartel sobre un mercado nocturno.
- Mantén el texto corto. Unas pocas palabras en tamaño grande son más fáciles de acertar que una frase completa. Pon el texto más largo en un pie de foto o en una página web.
- Indica dónde va el texto. Describe la ubicación y el tamaño, por ejemplo «título grande en la parte superior» o «etiqueta pequeña en el tarro».
- Pide letras sencillas. Unas mayúsculas gruesas y limpias sobre una zona lisa son más fáciles de dibujar para un modelo que una letra caligráfica decorativa sobre un fondo recargado.
- Haz varias versiones. Genera unas cuantas opciones, elige la que tenga mejor ortografía y corrige solo lo que quede.
- Añade el texto exacto después cuando importe. Para un menú, una lista de precios o cualquier cosa con letra pequeña, genera la imagen dejando un espacio vacío y compón el texto en una herramienta de diseño. Así el texto se escribe, no se dibuja.
Cómo corregir el texto después
Si la imagen está bien pero las palabras están mal, tienes cuatro opciones principales. Aquí van, de la que menos esfuerzo exige a la que más.
| Método | Esfuerzo | Qué más puede cambiar | Mejor cuando |
|---|---|---|---|
| Volver a generar la imagen | Bajo | Todo, porque obtienes una imagen nueva | Toda la imagen está mal o no te importa perder esta versión |
| Seleccionar y editar en el generador | Bajo | Las zonas cercanas también pueden volver a dibujarse | Quieres un arreglo rápido en la misma herramienta |
| Herramienta de sustitución de texto con IA | Bajo o medio | La zona del texto se vuelve a dibujar, así que revisa el resultado | La imagen está bien y solo las palabras están mal |
| Corregirlo a mano en un editor de imágenes | Alto | Solo lo que cambies | Necesitas control total, por ejemplo para impresión o trabajos para clientes |
Volver a generar la imagen
Volver a generar exige poco esfuerzo, pero el resultado es aleatorio. Un nuevo intento puede arreglar la palabra y estropear otra cosa, como una cara, una mano o la composición. Úsalo cuando todavía no hayas invertido mucho tiempo en esta imagen concreta.
Seleccionar y editar dentro del generador
Algunos generadores te permiten marcar una zona y describir un cambio. En ChatGPT, por ejemplo, puedes resaltar el texto con una herramienta de selección y escribir lo que debe decir. El centro de ayuda de OpenAI señala que las zonas resaltadas no siempre son precisas, así que los detalles cercanos al texto también pueden cambiar. Para verlo con más detalle, consulta si ChatGPT puede editar el texto de una imagen.
Usar una herramienta de sustitución de texto con IA
Una herramienta de sustitución de texto detecta el texto de la imagen por ti, así que solo tienes que escribir la ortografía correcta. Con EditText.ai, por ejemplo, editas el texto de una imagen línea por línea, y cada línea se vuelve a dibujar con el aspecto de las letras y del fondo originales. Para una sola letra o palabra equivocada, mira cómo corregir una errata en una imagen. Para titulares y letras decorativas en diseños de eventos, mira cómo cambiar el texto de un cartel.


Antes y después: un letrero de neón deformado en una imagen de IA, corregido escribiendo THEATER en EditText.ai.
Los resultados pueden variar, sobre todo con letras poco habituales o fondos con muchos detalles. Como el redibujado también lo hace un modelo de imagen, lee cada palabra nueva letra por letra a tamaño completo. Cualquier detección de texto también puede leer mal las letras deformadas, así que asegúrate de que cada línea detectada sea la que querías cambiar.
Corregirlo a mano
En Photoshop, Photopea o un editor similar, quitas las letras rotas, reconstruyes el fondo y compones el texto nuevo con una fuente. Esto te da el máximo control y sirve para impresión o trabajos para clientes, pero exige habilidad y tiempo. Las letras de la IA a menudo no son una fuente real, así que puede que un buscador de fuentes no encuentre ninguna coincidencia. Lee cómo identificar una fuente en una imagen para ver cómo encontrar un sustituto parecido.
Una regla sencilla ayuda a elegir: si toda la imagen está mal, vuelve a generarla. Si solo las palabras están mal, corrige las palabras.
Otras opciones
También puedes quitar texto de una imagen por completo y componer texto real sobre el fondo limpio en una herramienta de diseño, un buen enfoque para menús y listas de precios. Cuando el texto ya sea correcto, puedes traducir el texto de una imagen para crear versiones en otros idiomas.
Edita solo imágenes que sean tuyas o que tengas permiso para modificar, no quites marcas de agua ni créditos de autoría, y conserva las etiquetas de imagen generada con IA que exija una plataforma.
Corrige las palabras y conserva la imagen
Si la imagen está bien pero la ortografía está mal, no tienes que empezar de cero. Sube la imagen para corregir el texto de las imágenes de IA con EditText.ai, escribe las palabras correctas de cada línea y revisa el resultado antes de descargarlo.
Preguntas frecuentes
¿Por qué la IA falla con el texto de las imágenes?
Los generadores de imágenes con IA dibujan el texto como formas en lugar de escribirlo como letras, y muchos leen las instrucciones en fragmentos de palabra y no en caracteres sueltos. El texto también es un detalle pequeño con reglas estrictas, así que un trazo equivocado destaca. Las imágenes de entrenamiento suelen mostrar texto pequeño, borroso o en ángulo, lo que da a los modelos menos ejemplos claros de los que aprender.
¿Por qué la IA escribe palabras sin sentido en lugar de palabras reales?
Cuando un modelo no está seguro de cómo se escribe una palabra, igualmente dibuja formas que parecen letras, porque eso es lo que parece el texto en sus imágenes de entrenamiento. El resultado pueden ser marcas parecidas a letras, alfabetos mezclados o palabras inventadas. Ocurre sobre todo con texto largo, letras pequeñas y palabras poco habituales, y con menos frecuencia con una frase corta entre comillas.
¿Qué generador de imágenes con IA es mejor con el texto?
No hay una respuesta permanente, porque los modelos cambian a menudo y cada versión nueva puede comportarse de forma distinta. En general, los generadores recientes manejan mejor el texto corto y grande que los anteriores. La prueba más útil es tu propia instrucción: genera la misma frase corta en las herramientas a las que tengas acceso y comprueba la ortografía letra por letra antes de elegir una.
¿Puedo corregir el texto con errores de una imagen de IA sin volver a generarla?
Sí. Puedes seleccionar la zona y describir la corrección en el mismo generador, reescribir el texto a mano en un editor como Photoshop o Photopea, o usar una herramienta de sustitución de texto que detecte las palabras para que escribas la ortografía correcta. Uses el método que uses, compara el resultado con el original para detectar cambios cerca del texto.
¿Por qué un buscador de fuentes no identifica las letras de mi imagen de IA?
Los generadores de IA suelen dibujar las letras a partir de patrones que han aprendido, no a partir de un archivo de fuente instalado. Las letras pueden mezclar rasgos de varias tipografías o cambiar de forma de una letra a la siguiente. Un identificador de fuentes aún puede sugerir fuentes parecidas, lo que ayuda si piensas reescribir el texto, pero a menudo no existe una coincidencia exacta.