Les générateurs d’images IA ont du mal avec l’orthographe parce qu’ils dessinent des images, pas du texte. Ils apprennent l’aspect des lettres comme des formes et des motifs de pixels, et ne tapent jamais un mot lettre après lettre : un petit écart peut donc transformer « BAKERY » en « BAKRERY ». Beaucoup d’entre eux lisent aussi votre prompt par morceaux de mots plutôt que lettre par lettre, ce qui rend l’orthographe exacte encore plus difficile.
Les générateurs récents gèrent bien mieux les textes courts que les premiers, mais les longs passages, les petits lettrages, les noms inhabituels et les écritures non latines causent encore des erreurs. Si vous avez déjà une image avec des mots abîmés, vous pouvez souvent corriger le texte d’une image générée par IA sans tout recommencer. Ce guide explique pourquoi les erreurs arrivent, comment rédiger un prompt pour obtenir un meilleur texte et comment le réparer ensuite, que l’image vienne de Midjourney, de ChatGPT, de Gemini, de Stable Diffusion ou d’un autre générateur.
Comment les générateurs d’images IA créent une image
De nombreux générateurs d’images populaires utilisent une méthode appelée modèle de diffusion. Le modèle part d’un bruit aléatoire, semblable à la neige d’un écran sans signal, et retire un peu de ce bruit à chacune des nombreuses étapes. Votre prompt guide chaque étape : le bruit se transforme peu à peu en une image qui correspond à votre description. L’image entière est affinée en même temps : le ciel, les visages et le lettrage prennent forme simultanément.
Tous les générateurs ne fonctionnent pas ainsi. Certains construisent plutôt l’image comme une suite de petits morceaux. Mais en général, les modèles texte-image ont un point commun important : ils prédisent à quoi l’image devrait ressembler. Il n’y a aucune étape où le modèle choisit une police et tape « B », puis « A », puis « K ». Les lettres n’apparaissent que comme des formes qui ont l’air justes, ce qui explique qu’elles puissent sortir presque justes, mais pas tout à fait.
Pourquoi le texte est si difficile pour les générateurs d’images
Plusieurs causes se combinent. Chacune rend une petite erreur plus probable, et le texte est un endroit où les petites erreurs se voient facilement.
Les lettres sont de minuscules détails soumis à des règles strictes
Un arbre peut avoir n’importe quel nombre de branches et rester un arbre. Un mot n’a qu’une seule orthographe correcte. Le texte obéit aussi à des règles qui s’appliquent à tout le mot : chaque lettre doit avoir le même style et la même hauteur, l’espacement doit être régulier et les lettres doivent reposer sur la même ligne. Un trait en trop, une lettre manquante ou une lettre doublée saute aux yeux de toute personne qui lit la langue, même quand le reste de l’image paraît réaliste.
Le modèle ne voit peut-être jamais les lettres que vous avez tapées
Avant qu’un générateur puisse utiliser votre prompt, un composant appelé encodeur de texte le transforme en nombres. De nombreux encodeurs de texte découpent d’abord le prompt en tokens. Les mots courants deviennent souvent un seul token, tandis que les mots plus rares sont découpés en plusieurs morceaux. Une méthode très répandue pour construire ces morceaux est le byte-pair encoding. Cette approche est efficace, mais le modèle reçoit un identifiant pour chaque morceau, pas les lettres qu’il contient. Il doit apprendre, à partir d’exemples, qu’un certain morceau se dessine comme une certaine suite de lettres.
Un article de Google Research, Character-Aware Models Improve Visual Text Rendering, a étudié cette question directement. Les chercheurs ont comparé des encodeurs de texte qui voient les caractères individuels (« character-aware ») à des encodeurs qui ne voient que des morceaux de mots (« character-blind »). Les modèles d’image dotés d’encodeurs « character-aware » restituaient le texte visuel plus précisément, et se montraient particulièrement efficaces sur les mots rares. L’article a aussi constaté que de très grands modèles de langage « character-blind » peuvent apprendre à bien écrire, mais que cette capacité ne se transposait pas bien au-delà de l’anglais et n’apparaissait que dans des modèles bien plus grands que les encodeurs de texte généralement utilisés à l’époque par les générateurs d’images.
Les images d’entraînement montrent souvent mal le texte
Les générateurs apprennent à partir de très grandes collections d’images associées à des descriptions. Dans ces images, le texte est souvent petit, flou, coupé, vu en biais ou en partie caché, et il apparaît dans une immense variété de polices et de styles. La description associée à une image ne mentionne parfois pas du tout son texte. Le modèle voit donc de nombreux exemples de l’aspect que prend le texte en général, mais moins d’exemples clairs de la façon exacte dont un mot précis doit s’écrire.
Un petit texte compte très peu de pixels
Un titre peut s’étendre sur des centaines de pixels, alors qu’un mot en petits caractères ne dispose parfois que de quelques pixels par lettre. De nombreux générateurs travaillent aussi sur une version compressée de l’image et reconstruisent l’image en taille réelle à la fin, ce qui laisse encore moins de place aux petits détails. Les traits fins, comme la barre d’un « e » minuscule, se perdent facilement.
Pourquoi les modèles récents écrivent mieux
Les générateurs d’images sont devenus bien meilleurs pour les titres et les étiquettes courts. En général, les systèmes récents utilisent des modèles de langage plus puissants pour comprendre le prompt, et les développeurs ont accordé plus d’attention au texte pendant l’entraînement. Les recherches citées plus haut vont dans le même sens : les modèles qui reçoivent de meilleures informations sur les lettres dessinent le texte plus précisément.
L’amélioration est réelle, mais inégale. Un générateur qui écrit correctement un titre de trois mots peut encore avoir du mal avec un paragraphe, un menu ou une étiquette dans une langue qu’il a moins souvent vue pendant l’entraînement.
Là où les générateurs d’images IA ont encore du mal
- Les textes longs. Paragraphes, menus et listes, où chaque mot supplémentaire est une nouvelle occasion d’erreur
- Les petits textes. Mentions en petits caractères, étiquettes et texte lointain dans une scène
- Les mots inhabituels. Noms, mots inventés, termes nouveaux et longs nombres comme des numéros de téléphone ou des codes
- Les écritures non latines. Arabe, chinois, hindi, japonais, coréen, thaï et autres systèmes d’écriture, ainsi que les lettres accentuées
- Les nombreux blocs de texte. Affiches et infographies comportant plusieurs morceaux de texte distincts
- Les surfaces courbes ou inclinées. Texte sur une bouteille, un drapeau ou un panneau vu de côté
- La cohérence. Garder exactement le même texte dans toute une série d’images
Ce sont des tendances courantes plutôt que des règles fixes, et elles varient d’un générateur et d’une version à l’autre.
Comment obtenir un meilleur texte quand vous générez une image
- Mettez les mots exacts entre guillemets. Par exemple, demandez une affiche avec le titre « NIGHT MARKET » plutôt qu’une affiche sur un marché de nuit.
- Gardez le texte court. Quelques mots en grand sont plus faciles à réussir qu’une phrase entière. Placez plutôt le texte plus long dans une légende ou sur une page web.
- Dites où va le texte. Décrivez l’emplacement et la taille, par exemple « grand titre en haut » ou « petite étiquette sur le pot ».
- Demandez un lettrage simple. Des capitales grasses et nettes sur une zone unie sont plus faciles à dessiner pour un modèle qu’une écriture décorative sur un arrière-plan chargé.
- Faites plusieurs versions. Générez quelques options, choisissez celle dont l’orthographe est la meilleure et ne corrigez que ce qui reste.
- Ajoutez le texte exact plus tard quand cela compte. Pour un menu, une liste de prix ou tout ce qui comporte des petits caractères, générez l’image avec un espace vide et composez le texte dans un outil de design. Ainsi, le texte est tapé et non dessiné.
Comment corriger le texte ensuite
Si l’image est bonne mais que les mots sont faux, vous avez quatre options principales. Les voici, de la moins coûteuse en effort à la plus exigeante.
| Méthode | Effort | Ce qui peut changer d’autre | Idéale quand |
|---|---|---|---|
| Régénérer l’image | Faible | Tout, car vous obtenez une nouvelle image | Toute l’image est à refaire, ou vous ne craignez pas de perdre cette version |
| Sélectionner et modifier dans le générateur | Faible | Les zones voisines peuvent aussi être redessinées | Vous voulez une correction rapide dans le même outil |
| Outil de remplacement de texte par IA | Faible à moyen | La zone de texte est redessinée : vérifiez donc le résultat | L’image est bonne et seuls les mots sont faux |
| Corriger à la main dans un éditeur d’images | Élevé | Seulement ce que vous modifiez | Vous avez besoin d’un contrôle total, par exemple pour l’impression ou un travail pour un client |
Régénérer l’image
Régénérer demande peu d’effort, mais le résultat est aléatoire. Un nouvel essai peut corriger le mot et abîmer autre chose, comme un visage, une main ou la mise en page. Utilisez cette option quand vous n’avez pas encore passé beaucoup de temps sur cette image précise.
Sélectionner et modifier dans le générateur
Certains générateurs vous permettent de marquer une zone et de décrire un changement. Dans ChatGPT, par exemple, vous pouvez surligner le texte avec un outil de sélection et saisir ce qu’il doit dire. Le centre d’aide d’OpenAI note que les zones surlignées ne sont pas toujours précises : des détails proches du texte peuvent donc changer aussi. Pour y regarder de plus près, voyez si ChatGPT peut modifier le texte d’une image.
Utiliser un outil de remplacement de texte par IA
Un outil de remplacement de texte détecte le texte de l’image à votre place : vous n’avez qu’à saisir la bonne orthographe. Avec EditText.ai, par exemple, vous modifiez le texte d’une image ligne par ligne, et chaque ligne est redessinée dans l’aspect du lettrage et de l’arrière-plan d’origine. Pour une seule lettre ou un seul mot erroné, voyez comment corriger une faute de frappe dans une image. Pour les titres et les lettrages d’affichage sur des créations d’événements, voyez comment changer le texte d’une affiche.


Avant et après : une enseigne néon déformée dans une image IA, corrigée en saisissant THEATER dans EditText.ai.
Les résultats peuvent varier, surtout avec un lettrage inhabituel ou un arrière-plan détaillé. Comme le redessin est lui aussi réalisé par un modèle d’image, lisez chaque nouveau mot lettre par lettre en taille réelle. Toute détection de texte peut aussi mal lire des lettres déformées : assurez-vous donc que chaque ligne détectée est bien celle que vous vouliez modifier.
Corriger à la main
Dans Photoshop, Photopea ou un éditeur similaire, vous retirez les lettres abîmées, reconstituez l’arrière-plan et composez le nouveau texte dans une police. C’est la méthode qui offre le plus de contrôle et elle convient à l’impression ou aux travaux pour des clients, mais elle demande de la compétence et du temps. Le lettrage d’une IA n’est souvent pas une vraie police : un outil de recherche de police peut donc ne trouver aucune correspondance. Lisez comment identifier une police à partir d’une image pour trouver un substitut proche.
Une règle simple aide à choisir : si toute l’image est à refaire, régénérez-la. Si seuls les mots sont faux, corrigez les mots.
Autres options
Vous pouvez aussi supprimer le texte d’une image entièrement et composer du vrai texte sur l’arrière-plan propre dans un outil de design, une bonne approche pour les menus et les listes de prix. Une fois le texte correct, vous pouvez traduire le texte d’une image pour créer des versions dans d’autres langues.
Ne modifiez que des images qui vous appartiennent ou que vous avez l’autorisation de changer, ne supprimez ni filigranes ni crédits, et conservez les mentions d’image générée par IA qu’une plateforme exige.
Corrigez les mots et gardez l’image
Si l’image est bonne mais que l’orthographe est fausse, inutile de tout recommencer. Importez-la pour corriger le texte d’une image générée par IA avec EditText.ai, saisissez les bons mots de chaque ligne et vérifiez le résultat avant de le télécharger.
Questions fréquentes
Pourquoi l’IA se trompe-t-elle sur le texte des images ?
Les générateurs d’images IA dessinent le texte comme des formes au lieu de le taper en lettres, et beaucoup lisent les prompts par morceaux de mots plutôt que caractère par caractère. Le texte est aussi un petit détail soumis à des règles strictes : un seul trait faux se remarque. Les images d’entraînement montrent souvent un texte petit, flou ou vu en biais, ce qui donne aux modèles moins d’exemples clairs à partir desquels apprendre.
Pourquoi l’IA écrit-elle du charabia au lieu de vrais mots ?
Quand un modèle ne sait pas comment un mot s’écrit, il dessine quand même des formes qui ressemblent à des lettres, parce que c’est à cela que ressemble le texte dans ses images d’entraînement. Le résultat peut être des signes qui ressemblent à des lettres, des alphabets mélangés ou des mots inventés. Cela arrive surtout avec les textes longs, les petits lettrages et les mots inhabituels, et moins souvent avec une courte phrase entre guillemets.
Quel générateur d’images IA est le meilleur pour le texte ?
Il n’existe pas de réponse définitive, car les modèles changent souvent et chaque nouvelle version peut se comporter différemment. En général, les générateurs récents gèrent mieux les textes courts et grands que les anciens. Le test le plus utile est votre propre prompt : générez la même courte phrase dans les outils auxquels vous avez accès, puis vérifiez l’orthographe lettre par lettre avant d’en choisir un.
Puis-je corriger un texte mal orthographié dans une image IA sans la régénérer ?
Oui. Vous pouvez sélectionner la zone et décrire la correction dans le même générateur, retaper le texte à la main dans un éditeur comme Photoshop ou Photopea, ou utiliser un outil de remplacement de texte qui détecte les mots pour que vous saisissiez la bonne orthographe. Quelle que soit la méthode, comparez le résultat avec l’original pour repérer les changements autour du texte.
Pourquoi un outil de recherche de police n’identifie-t-il pas le lettrage de mon image IA ?
Les générateurs d’IA dessinent généralement le lettrage à partir de motifs appris, pas à partir d’un fichier de police installé. Les lettres peuvent mélanger les caractéristiques de plusieurs polices, ou changer de forme d’une lettre à l’autre. Un outil d’identification de police peut tout de même suggérer des polices similaires, ce qui aide si vous comptez retaper le texte, mais une correspondance exacte n’existe souvent pas.