I generatori di immagini IA fanno fatica con l'ortografia perché disegnano immagini, non testo. Imparano che aspetto hanno le lettere come forme e schemi di pixel e non scrivono mai una parola una lettera alla volta, quindi un piccolo scivolone può trasformare «BAKERY» in «BAKRERY». Molti di loro, inoltre, leggono il prompt per frammenti di parola e non per singole lettere, il che rende ancora più difficile un'ortografia esatta.
I generatori più recenti gestiscono il testo breve molto meglio di quanto facessero i primi, ma brani lunghi, scritte piccole, nomi insoliti e scritture non latine causano ancora errori. Se hai già un'immagine con parole sbagliate, spesso puoi correggere il testo nelle immagini generate dall'IA senza ricominciare da capo. Questa guida spiega perché avvengono gli errori, come scrivere prompt per ottenere testo migliore e come ripararlo in seguito, che l'immagine arrivi da Midjourney, ChatGPT, Gemini, Stable Diffusion o da un altro generatore.
Come i generatori di immagini IA creano un'immagine
Molti dei generatori di immagini più diffusi usano un metodo chiamato modello di diffusione. Il modello parte da rumore casuale, simile alle interferenze su uno schermo, e ne elimina un po' alla volta, in molti passaggi successivi. Il tuo prompt guida ogni passaggio, così il rumore si trasforma lentamente in un'immagine che corrisponde alla tua descrizione. L'intera immagine viene rifinita insieme: il cielo, i volti e le scritte prendono forma tutti nello stesso momento.
Non tutti i generatori funzionano così. Alcuni costruiscono invece l'immagine come una sequenza di piccoli pezzi. Ma in generale i modelli da testo a immagine hanno in comune una caratteristica importante: prevedono che aspetto debba avere l'immagine. Non c'è nessun passaggio in cui il modello sceglie un font e scrive «B», poi «A», poi «K». Le lettere compaiono solo come forme che sembrano giuste, ed è per questo che possono uscire quasi giuste, ma non del tutto.
Perché il testo è così difficile per i generatori di immagini
Diverse cause agiscono insieme. Ognuna rende più probabile un piccolo errore, e il testo è un punto in cui i piccoli errori si vedono facilmente.
Le lettere sono piccoli dettagli con regole rigide
Un albero può avere un numero qualsiasi di rami e sembrare comunque un albero. Una parola ha esattamente una sola ortografia corretta. Il testo ha anche regole che valgono per l'intera parola: ogni lettera deve avere lo stesso stile e la stessa altezza, la spaziatura deve essere regolare e le lettere devono poggiare sulla stessa linea. Un tratto in più, una lettera mancante o una lettera doppia sono evidenti per chiunque legga la lingua, anche quando il resto dell'immagine sembra reale.
Il modello potrebbe non vedere mai le lettere che hai scritto
Prima che un generatore possa usare il tuo prompt, un componente chiamato codificatore di testo lo trasforma in numeri. Molti codificatori di testo dividono prima il prompt in token. Le parole comuni diventano spesso un unico token, mentre quelle più rare vengono spezzate in più frammenti. Un metodo molto diffuso per costruire questi frammenti è la codifica byte-pair. L'approccio è efficiente, ma il modello riceve un ID per ogni frammento, non le lettere al suo interno. Deve imparare dagli esempi che un certo frammento si disegna come una certa sequenza di lettere.
Un articolo di Google Research, Character-Aware Models Improve Visual Text Rendering, ha studiato direttamente questo problema. I ricercatori hanno confrontato codificatori di testo che vedono i singoli caratteri («character-aware») con codificatori che vedono solo frammenti di parola («character-blind»). I modelli di immagini con codificatori character-aware hanno reso il testo visivo in modo più accurato e sono stati particolarmente bravi con le parole rare. L'articolo ha anche rilevato che modelli linguistici character-blind molto grandi possono imparare a scrivere bene, ma che questa capacità non si estendeva bene oltre l'inglese e compariva solo in modelli molto più grandi dei codificatori di testo che i generatori di immagini usavano di solito all'epoca.
Le immagini di addestramento mostrano spesso male il testo
I generatori imparano da raccolte molto grandi di immagini abbinate a descrizioni. In quelle immagini il testo è spesso piccolo, sfocato, tagliato, visto di sbieco o parzialmente nascosto e compare in una vastissima gamma di font e stili. La descrizione abbinata a un'immagine può non menzionare affatto il suo testo. Quindi il modello vede molti esempi di come appare il testo in generale, ma meno esempi chiari di come si scriva esattamente una parola specifica.
Il testo piccolo ha pochissimi pixel
Un titolo può estendersi per centinaia di pixel, mentre una parola in caratteri minuscoli può avere solo pochi pixel per lettera. Molti generatori lavorano inoltre su una versione compressa dell'immagine e ricostruiscono alla fine l'immagine a piena dimensione, il che lascia ancora meno spazio ai piccoli dettagli. Le linee sottili, come la barretta di una «e» minuscola, si perdono facilmente.
Perché i modelli più recenti scrivono testi migliori
I generatori di immagini sono diventati molto più bravi con titoli ed etichette brevi. In generale, i sistemi più recenti usano modelli linguistici più potenti per capire il prompt e gli sviluppatori hanno dato più attenzione al testo durante l'addestramento. La ricerca citata sopra va nella stessa direzione: i modelli che ricevono informazioni migliori sulle lettere disegnano il testo con più accuratezza.
Il miglioramento è reale ma disomogeneo. Un generatore che scrive correttamente un titolo di tre parole può comunque faticare con un paragrafo, un menu o un'etichetta in una lingua che ha visto meno spesso durante l'addestramento.
Dove i generatori di immagini IA fanno ancora fatica
- Testo lungo. Paragrafi, menu ed elenchi, dove ogni parola in più è un'altra occasione di errore
- Testo piccolo. Scritte minuscole, etichette e testo lontano nella scena
- Parole insolite. Nomi, parole inventate, termini nuovi e numeri lunghi come numeri di telefono o codici
- Scritture non latine. Arabo, cinese, hindi, giapponese, coreano, thailandese e altri sistemi di scrittura, oltre alle lettere accentate
- Molti blocchi di testo. Locandine e infografiche con diversi pezzi di testo separati
- Superfici curve o inclinate. Testo su una bottiglia, su una bandiera o su un cartello visto di lato
- Coerenza. Mantenere identico lo stesso testo in una serie di immagini
Sono schemi comuni più che regole fisse, e variano da un generatore e da una versione all'altra.
Come ottenere testo migliore quando generi un'immagine
- Metti le parole esatte tra virgolette. Per esempio, chiedi una locandina con il titolo «NIGHT MARKET» invece di una locandina su un mercato notturno.
- Mantieni il testo breve. Poche parole in grande sono più facili da ottenere correttamente di una frase intera. Metti il testo più lungo in una didascalia o in una pagina web.
- Indica dove va il testo. Descrivi posizione e dimensione, per esempio «titolo grande in alto» o «piccola etichetta sul barattolo».
- Chiedi scritte semplici. Lettere maiuscole nitide e in grassetto su un'area uniforme sono più facili da disegnare per un modello di un corsivo decorativo su uno sfondo complesso.
- Crea più versioni. Genera alcune alternative, scegli quella con l'ortografia migliore e correggi solo ciò che resta.
- Aggiungi il testo esatto dopo, quando conta. Per un menu, un listino prezzi o qualsiasi cosa con scritte minuscole, genera l'immagine con uno spazio vuoto e inserisci il testo in un programma di grafica. In questo modo il testo è scritto, non disegnato.
Come correggere il testo in seguito
Se l'immagine va bene ma le parole sono sbagliate, hai quattro opzioni principali. Eccole, dalla meno impegnativa alla più impegnativa.
| Metodo | Impegno | Cos'altro può cambiare | Ideale quando |
|---|---|---|---|
| Rigenerare l'immagine | Basso | Tutto, perché ottieni un'immagine nuova | L'intera immagine è sbagliata, o non ti dispiace perdere questa versione |
| Selezionare e modificare nel generatore | Basso | Anche le aree vicine possono essere ridisegnate | Vuoi una correzione veloce nello stesso strumento |
| Strumento di sostituzione del testo con l'IA | Da basso a medio | L'area del testo viene ridisegnata, quindi controlla il risultato | L'immagine va bene e sono sbagliate solo le parole |
| Correggere a mano in un editor di immagini | Alto | Solo ciò che cambi | Ti serve il controllo completo, per esempio per lavori di stampa o per clienti |
Rigenerare l'immagine
Rigenerare richiede poco impegno, ma il risultato è casuale. Un nuovo tentativo può correggere la parola e rovinare qualcos'altro, come un volto, una mano o l'impaginazione. Usalo quando non hai ancora dedicato molto tempo a questa immagine.
Selezionare e modificare dentro il generatore
Alcuni generatori permettono di segnare un'area e descrivere una modifica. In ChatGPT, per esempio, puoi evidenziare il testo con uno strumento di selezione e scrivere cosa deve dire. Il centro assistenza di OpenAI osserva che le aree evidenziate non sono sempre precise, quindi anche i dettagli vicini al testo possono cambiare. Per approfondire leggi ChatGPT può modificare il testo in un'immagine?.
Usare uno strumento di sostituzione del testo con l'IA
Uno strumento di sostituzione del testo rileva per te il testo nell'immagine, quindi devi solo scrivere l'ortografia corretta. Con EditText.ai, per esempio, modifichi il testo di un'immagine riga per riga e ogni riga viene ridisegnata con l'aspetto delle scritte e dello sfondo originali. Per una sola lettera o parola sbagliata, scopri come correggere un refuso in un'immagine. Per titoli e scritte decorative nei progetti per eventi, scopri come cambiare il testo di una locandina.


Prima e dopo: un'insegna al neon storpiata in un'immagine IA, corretta scrivendo THEATER in EditText.ai.
I risultati possono variare, soprattutto con scritte insolite o sfondi ricchi di dettagli. Poiché anche il ridisegno è eseguito da un modello di immagini, leggi ogni parola nuova lettera per lettera a dimensione reale. Qualsiasi rilevamento del testo può inoltre leggere male le lettere storpiate, quindi verifica che ogni riga rilevata sia quella che volevi cambiare.
Correggere a mano
In Photoshop, Photopea o in un editor simile rimuovi le lettere rovinate, ricostruisci lo sfondo e inserisci il testo nuovo con un font. È il metodo che offre più controllo e va bene per lavori di stampa o per clienti, ma richiede competenze e tempo. Le scritte dell'IA spesso non sono un vero font, quindi un identificatore di font potrebbe non trovare corrispondenze. Leggi come riconoscere un font da un'immagine per scoprire come trovare un sostituto simile.
Una regola semplice aiuta a scegliere: se l'intera immagine è sbagliata, rigenerala. Se sono sbagliate solo le parole, correggi le parole.
Altre opzioni
Puoi anche rimuovere del tutto il testo da un'immagine e comporre testo vero sullo sfondo pulito in un programma di grafica, un buon approccio per menu e listini prezzi. Una volta che il testo è giusto, puoi tradurre il testo di un'immagine per creare versioni in altre lingue.
Modifica solo immagini di tua proprietà o che hai il permesso di cambiare, non rimuovere filigrane né crediti e mantieni le eventuali etichette per le immagini generate dall'IA richieste da una piattaforma.
Correggi le parole e tieni l'immagine
Se l'immagine va bene ma l'ortografia è sbagliata, non devi ricominciare da capo. Caricala per correggere il testo nelle immagini IA con EditText.ai, scrivi le parole corrette per ogni riga e controlla il risultato prima di scaricarlo.
Domande frequenti
Perché l'IA sbaglia il testo nelle immagini?
I generatori di immagini IA disegnano il testo come forme invece di scriverlo come lettere, e molti leggono i prompt per frammenti di parola e non per singoli caratteri. Il testo è anche un piccolo dettaglio con regole rigide, quindi un tratto sbagliato salta subito all'occhio. Le immagini di addestramento mostrano spesso testo piccolo, sfocato o inclinato, il che offre ai modelli meno esempi chiari da cui imparare.
Perché l'IA scrive parole senza senso invece di parole vere?
Quando un modello non è sicuro di come si scriva una parola, disegna comunque forme che sembrano lettere, perché è questo l'aspetto del testo nelle sue immagini di addestramento. Il risultato possono essere segni simili a lettere, alfabeti mescolati o parole inventate. Succede soprattutto con testi lunghi, scritte piccole e parole insolite, e più raramente con una frase breve tra virgolette.
Quale generatore di immagini IA è il migliore con il testo?
Non esiste una risposta definitiva, perché i modelli cambiano spesso e ogni nuova versione può comportarsi in modo diverso. In generale i generatori recenti gestiscono meglio di quelli più vecchi il testo breve e grande. Il test più utile è il tuo prompt: genera la stessa frase breve negli strumenti a cui hai accesso, poi controlla l'ortografia lettera per lettera prima di sceglierne uno.
Posso correggere il testo sbagliato in un'immagine IA senza rigenerarla?
Sì. Puoi selezionare l'area e descrivere la correzione nello stesso generatore, riscrivere il testo a mano in un editor come Photoshop o Photopea, oppure usare uno strumento di sostituzione del testo che rileva le parole così da poter scrivere l'ortografia corretta. Qualunque metodo usi, confronta il risultato con l'originale per individuare i cambiamenti vicino al testo.
Perché un identificatore di font non riconosce le scritte della mia immagine IA?
I generatori di IA di solito disegnano le scritte a partire da schemi che hanno imparato, non da un file di font installato. Le lettere possono mescolare caratteristiche di più caratteri tipografici o cambiare forma da una lettera all'altra. Un identificatore di font può comunque suggerire font simili, il che aiuta se hai intenzione di riscrivere il testo, ma spesso una corrispondenza esatta non esiste.