edittext.ai

De ce scriu greșit generatoarele de imagini AI (și cum se repară)

De ce scriu greșit generatoarele de imagini AI? Desenează literele ca forme, nu ca text. Află ce provoacă cuvintele deformate și cum le repari în imagini.

Generatoarele de imagini AI se descurcă greu cu ortografia, pentru că desenează imagini, nu text. Ele învață cum arată literele ca forme și tipare de pixeli și nu scriu niciodată un cuvânt literă cu literă, așa că o mică scăpare poate transforma „BAKERY” în „BAKRERY”. Multe dintre ele citesc și promptul în bucăți de cuvinte, nu în litere individuale, ceea ce face ortografia exactă și mai grea.

Generatoarele mai noi se descurcă mult mai bine cu textul scurt decât cele de la început, dar pasajele lungi, literele mici, numele neobișnuite și sistemele de scriere non-latine încă provoacă greșeli. Dacă ai deja o imagine cu cuvinte stricate, de multe ori poți corecta textul din imaginile generate cu AI fără să o iei de la capăt. Ghidul explică de ce apar erorile, cum scrii promptul pentru un text mai bun și cum repari textul după aceea, indiferent dacă imaginea provine din Midjourney, ChatGPT, Gemini, Stable Diffusion sau alt generator.

Cum creează generatoarele AI o imagine

Multe generatoare populare de imagini folosesc o metodă numită model de difuzie. Modelul pornește de la zgomot aleatoriu, asemănător cu paraziții de pe un ecran, și îndepărtează câte puțin din acel zgomot în multe etape succesive. Promptul tău ghidează fiecare etapă, așa că zgomotul se transformă treptat într-o imagine care corespunde descrierii tale. Întreaga imagine este rafinată împreună: cerul, fețele și literele prind formă în același timp.

Nu toate generatoarele funcționează așa. Unele construiesc imaginea ca o succesiune de bucăți mici. Dar, în general, modelele text-to-image au în comun o trăsătură importantă: prezic cum ar trebui să arate imaginea. Nu există un pas în care modelul alege un font și scrie „B”, apoi „A”, apoi „K”. Literele apar doar ca forme care par corecte, de aceea pot ieși aproape bine, dar nu tocmai.

De ce este textul atât de greu pentru generatoarele de imagini

Mai multe cauze acționează împreună. Fiecare face mai probabilă o mică eroare, iar textul este un loc în care micile erori se văd ușor.

Literele sunt detalii mici, cu reguli stricte

Un copac poate avea orice număr de ramuri și tot arată ca un copac. Un cuvânt are exact o singură ortografie corectă. Textul are și reguli care se aplică pe tot cuvântul: fiecare literă trebuie să aibă același stil și aceeași înălțime, spațierea trebuie să fie egală, iar literele trebuie să stea pe aceeași linie. O trăsătură în plus, o literă lipsă sau o literă dublată se observă imediat pentru oricine citește limba respectivă, chiar dacă restul imaginii pare real.

Modelul poate să nu vadă niciodată literele pe care le-ai scris

Înainte ca un generator să poată folosi promptul tău, o componentă numită encoder de text îl transformă în numere. Multe encodere de text împart mai întâi promptul în tokenuri. Cuvintele obișnuite devin adesea un singur token, în timp ce cuvintele mai rare sunt sparte în mai multe bucăți. O metodă folosită pe scară largă pentru a construi aceste bucăți este byte-pair encoding. Abordarea este eficientă, dar modelul primește un ID pentru fiecare bucată, nu literele din interiorul ei. El trebuie să învețe din exemple că o anumită bucată se desenează ca un anumit șir de litere.

O lucrare Google Research, Character-Aware Models Improve Visual Text Rendering, a studiat direct această problemă. Cercetătorii au comparat encoderele de text care văd caracterele individuale („character-aware”) cu encoderele care văd doar bucăți de cuvinte („character-blind”). Modelele de imagini cu encodere care văd caracterele au redat textul vizual mai exact și au fost mai bune mai ales la cuvintele rare. Lucrarea a constatat și că modelele de limbaj foarte mari, care nu văd caracterele, pot învăța să scrie corect, dar că această capacitate nu s-a transferat bine dincolo de engleză și a apărut doar în modele mult mai mari decât encoderele de text folosite de obicei, la acea vreme, de generatoarele de imagini.

Imaginile de antrenament arată adesea textul prost

Generatoarele învață din colecții foarte mari de imagini asociate cu descrieri. În acele imagini, textul este adesea mic, neclar, tăiat, văzut din unghi sau parțial ascuns și apare într-o gamă uriașă de fonturi și stiluri. Descrierea asociată unei imagini poate să nu menționeze deloc textul din ea. Așa că modelul vede multe exemple despre cum arată textul în general, dar mai puține exemple clare despre cum trebuie scris exact un anumit cuvânt.

Textul mic are foarte puțini pixeli

Un titlu poate ocupa sute de pixeli, în timp ce un cuvânt de text mărunt poate primi doar câțiva pixeli pe literă. Multe generatoare lucrează și pe o versiune comprimată a imaginii și reconstruiesc imaginea la dimensiunea completă la final, ceea ce lasă și mai puțin loc pentru detaliile mici. Liniile fine, cum este bara din litera „e” mică, se pierd ușor.

De ce modelele mai noi scriu un text mai bun

Generatoarele de imagini au devenit mult mai bune la titluri și etichete scurte. În general, sistemele mai noi folosesc modele de limbaj mai puternice ca să înțeleagă promptul, iar dezvoltatorii au acordat mai multă atenție textului în timpul antrenării. Cercetarea de mai sus indică în aceeași direcție: modelele care primesc informații mai bune despre litere desenează textul mai exact.

Îmbunătățirea este reală, dar inegală. Un generator care scrie corect un titlu de trei cuvinte se poate descurca totuși greu cu un paragraf, un meniu sau o etichetă într-o limbă pe care a văzut-o mai rar în timpul antrenării.

Unde mai întâmpină dificultăți generatoarele de imagini AI

  • Text lung. Paragrafe, meniuri și liste, unde fiecare cuvânt în plus este încă o șansă de eroare
  • Text mic. Text mărunt, etichete și text aflat departe într-o scenă
  • Cuvinte neobișnuite. Nume, cuvinte inventate, termeni noi și numere lungi, cum ar fi numerele de telefon sau codurile
  • Sisteme de scriere non-latine. Araba, chineza, hindi, japoneza, coreeana, thailandeza și alte sisteme de scriere, precum și literele cu diacritice
  • Multe blocuri de text. Afișe și infografice cu mai multe bucăți de text separate
  • Suprafețe curbe sau înclinate. Text pe o sticlă, pe un steag sau pe un panou văzut din lateral
  • Consecvența. Păstrarea identică a aceleiași formulări într-o serie de imagini

Acestea sunt tipare frecvente, nu reguli fixe, și variază de la un generator și de la o versiune la alta.

Cum obții un text mai bun când generezi o imagine

  1. Pune cuvintele exacte între ghilimele. De exemplu, cere un afiș cu titlul „NIGHT MARKET”, nu un afiș despre o piață de noapte.
  2. Păstrează textul scurt. Câteva cuvinte scrise mare sunt mai ușor de obținut corect decât o propoziție întreagă. Pune în schimb textul mai lung într-o legendă sau pe o pagină web.
  3. Spune unde se așază textul. Descrie poziția și dimensiunea, de exemplu „titlu mare în partea de sus” sau „etichetă mică pe borcan”.
  4. Cere litere simple. Majusculele aldine și curate pe o zonă uniformă sunt mai ușor de desenat pentru un model decât scrisul decorativ peste un fundal încărcat.
  5. Fă mai multe versiuni. Generează câteva variante, alege-o pe cea cu cea mai bună ortografie și repară doar ce a mai rămas.
  6. Adaugă textul exact mai târziu, când contează. Pentru un meniu, o listă de prețuri sau orice are text mărunt, generează imaginea cu spațiu liber și așază textul într-un instrument de design. Astfel formularea este scrisă, nu desenată.

Cum repari textul după aceea

Dacă imaginea este bună, dar cuvintele sunt greșite, ai patru variante principale. Iată-le, de la cea mai puțin laborioasă la cea mai laborioasă.

MetodăEfortCe altceva se poate schimbaIdeal când
Regenerezi imagineaMicTotul, pentru că primești o imagine nouăÎntreaga imagine este greșită sau nu te deranjează să pierzi această versiune
Selectezi și editezi în generatorMicZonele din apropiere pot fi redesenate și eleVrei o corecție rapidă în același instrument
Instrument de înlocuire a textului cu AIMic spre mediuZona textului este redesenată, așa că verifică rezultatulImaginea este bună și doar cuvintele sunt greșite
Repari manual într-un editor de imaginiMareDoar ce schimbi tuAi nevoie de control complet, de exemplu pentru tipar sau pentru lucrări pentru clienți

Regenerează imaginea

Regenerarea cere puțin efort, dar rezultatul este aleatoriu. O nouă încercare poate corecta cuvântul și strica altceva, cum ar fi o față, o mână sau aspectul. Folosește-o atunci când nu ai petrecut încă mult timp cu această imagine anume.

Selectează și editează în interiorul generatorului

Unele generatoare îți permit să marchezi o zonă și să descrii o modificare. În ChatGPT, de exemplu, poți marca textul cu un instrument de selecție și poți scrie ce trebuie să spună. Centrul de ajutor OpenAI precizează că marcajele nu sunt întotdeauna precise, așa că și detaliile din apropierea textului se pot schimba. Pentru o privire mai atentă, vezi poate ChatGPT să editeze text dintr-o imagine.

Folosește un instrument de înlocuire a textului cu AI

Un instrument de înlocuire a textului detectează textul din imagine în locul tău, așa că tu scrii doar ortografia corectă. Cu EditText.ai, de exemplu, editezi textul dintr-o imagine rând cu rând, iar fiecare rând este redesenat în aspectul literelor originale și al fundalului. Pentru o singură literă sau un singur cuvânt greșit, vezi cum să corectezi o greșeală de scriere într-o imagine. Pentru titluri și litere de afiș din designurile pentru evenimente, vezi cum să schimbi textul de pe un afiș.

Înainte: ilustrație retro generată cu AI, cu o stradă din New York noaptea, cu un panou înalt de neon roșu pe care scrie textul fără sens NEYAHRD
După: aceeași ilustrație, cu panoul de neon roșu care spune acum THEATER, în timp ce silueta orașului, taxiurile și titlul NEW YORK rămân neschimbate

Înainte și după: un panou de neon cu text deformat într-o imagine AI, corectat prin scrierea cuvântului THEATER în EditText.ai.

Rezultatele pot varia, mai ales în cazul literelor neobișnuite sau al fundalurilor încărcate. Pentru că redesenarea este făcută tot de un model de imagini, citește fiecare cuvânt nou literă cu literă, la dimensiunea reală. Orice detectare a textului poate citi greșit literele deformate, așa că asigură-te că fiecare rând detectat este cel pe care voiai să-l schimbi.

Repară manual

În Photoshop, Photopea sau un editor asemănător, elimini literele stricate, reconstruiești fundalul și așezi textul nou cu un font. Asta îți dă cel mai mult control și se potrivește pentru lucrări de tipar sau pentru clienți, dar cere pricepere și timp. Literele generate cu AI nu sunt adesea un font real, așa că este posibil ca un identificator de fonturi să nu găsească nicio potrivire. Citește cum afli ce font este într-o imagine pentru modalități de a găsi un înlocuitor apropiat.

O regulă simplă te ajută să alegi: dacă întreaga imagine este greșită, regenerează-o. Dacă doar cuvintele sunt greșite, repară cuvintele.

Alte variante

Poți și să ștergi complet textul dintr-o imagine și să așezi text real pe fundalul curat, într-un instrument de design, o abordare bună pentru meniuri și liste de prețuri. După ce formularea este corectă, poți traduce textul dintr-o imagine ca să faci versiuni pentru alte limbi.

Editează doar imagini care îți aparțin sau pe care ai permisiunea să le modifici, nu elimina filigranele sau mențiunile de autor și păstrează orice etichete pentru imagini AI pe care le cere o platformă.

Repară cuvintele și păstrează imaginea

Dacă imaginea este bună, dar ortografia este greșită, nu trebuie să o iei de la capăt. Încarcă imaginea ca să corectezi textul din imaginile AI cu EditText.ai, scrie cuvintele corecte pentru fiecare rând și verifică rezultatul înainte să-l descarci.

Întrebări frecvente

De ce încurcă AI-ul textul din imagini?

Generatoarele de imagini AI desenează textul ca forme, în loc să-l scrie ca litere, iar multe citesc prompturile în bucăți de cuvinte, nu în caractere separate. Textul este și un detaliu mic, cu reguli stricte, așa că o singură trăsătură greșită iese în evidență. Imaginile de antrenament arată adesea text mic, neclar sau văzut din unghi, ceea ce oferă modelelor mai puține exemple clare din care să învețe.

De ce scrie AI-ul texte fără sens în loc de cuvinte reale?

Când un model nu este sigur cum se scrie un cuvânt, desenează totuși forme care seamănă cu litere, pentru că așa arată textul în imaginile lui de antrenament. Rezultatele pot fi semne asemănătoare literelor, alfabete amestecate sau cuvinte inventate. Se întâmplă cel mai des la text lung, la litere mici și la cuvinte neobișnuite și mai rar la o frază scurtă pusă între ghilimele.

Care generator de imagini AI este cel mai bun la text?

Nu există un răspuns permanent, pentru că modelele se schimbă des, iar fiecare versiune nouă se poate comporta diferit. În general, generatoarele recente se descurcă mai bine cu textul scurt și mare decât cele mai vechi. Cel mai util test este propriul tău prompt: generează aceeași frază scurtă în instrumentele la care ai acces, apoi verifică ortografia literă cu literă înainte să alegi unul.

Pot corecta textul scris greșit dintr-o imagine AI fără s-o regenerez?

Da. Poți selecta zona și descrie corecția în același generator, poți rescrie textul manual într-un editor precum Photoshop sau Photopea sau poți folosi un instrument de înlocuire a textului care detectează cuvintele, ca să scrii ortografia corectă. Indiferent de metoda aleasă, compară rezultatul cu originalul ca să observi modificările din apropierea textului.

De ce nu poate un identificator de fonturi să recunoască literele din imaginea mea AI?

Generatoarele AI desenează de obicei literele pornind de la tipare învățate, nu dintr-un fișier de font instalat. Literele pot combina trăsături ale mai multor fonturi sau își pot schimba forma de la o literă la alta. Un identificator de fonturi poate totuși sugera fonturi asemănătoare, ceea ce ajută dacă plănuiești să rescrii textul, dar adesea nu există o potrivire exactă.