AI-billedgeneratorer har svært ved at stave, fordi de tegner billeder og ikke tekst. De lærer, hvordan bogstaver ser ud som former og mønstre af pixels, og de skriver aldrig et ord ét bogstav ad gangen, så en lille fejl kan gøre »BAKERY« til »BAKRERY«. Mange af dem læser også din prompt i ordbidder og ikke i enkelte bogstaver, hvilket gør præcis stavning endnu sværere.
Nyere generatorer klarer kort tekst meget bedre end de tidlige, men lange passager, lille tekst, usædvanlige navne og ikke-latinske skriftsystemer giver stadig fejl. Hvis du allerede har et billede med ødelagte ord, kan du ofte rette tekst i AI-genererede billeder, uden at du skal starte forfra. Denne guide forklarer, hvorfor fejlene opstår, hvordan du skriver en prompt, der giver bedre tekst, og hvordan du reparerer den bagefter, uanset om billedet kommer fra Midjourney, ChatGPT, Gemini, Stable Diffusion eller en anden generator.
Sådan laver AI-billedgeneratorer et billede
Mange populære billedgeneratorer bruger en metode, der kaldes en diffusionsmodel. Modellen starter med tilfældig støj, ligesom den »sne«, man ser på en skærm uden signal, og fjerner lidt af støjen ad gangen i mange trin. Din prompt styrer hvert trin, så støjen langsomt bliver til et billede, der svarer til din beskrivelse. Hele billedet forfines samlet: Himlen, ansigterne og bogstaverne tager form på samme tid.
Ikke alle generatorer virker på den måde. Nogle bygger i stedet billedet op som en række små dele. Men generelt har tekst-til-billede-modeller ét vigtigt træk til fælles: De forudsiger, hvordan billedet skal se ud. Der er intet trin, hvor modellen vælger en skrifttype og skriver »B«, derefter »A« og så »K«. Bogstaver optræder kun som former, der ser rigtige ud, og derfor kan de blive næsten rigtige, men ikke helt.
Hvorfor tekst er så svært for billedgeneratorer
Flere årsager virker sammen. Hver af dem gør en lille fejl mere sandsynlig, og tekst er et sted, hvor små fejl er lette at se.
Bogstaver er små detaljer med strenge regler
Et træ kan have et hvilket som helst antal grene og stadig ligne et træ. Et ord har præcis én korrekt stavemåde. Tekst har også regler, der gælder på tværs af hele ordet: Hvert bogstav skal have samme stil og højde, afstanden skal være jævn, og bogstaverne skal stå på samme linje. En ekstra streg, et manglende bogstav eller et fordoblet bogstav er tydeligt for enhver, der læser sproget, selv når resten af billedet ser ægte ud.
Modellen ser måske aldrig de bogstaver, du har skrevet
Før en generator kan bruge din prompt, bliver den omdannet til tal af en komponent, der kaldes en tekstencoder. Mange tekstencodere deler først prompten op i tokens. Almindelige ord bliver ofte til ét token, mens sjældnere ord deles op i flere stykker. En udbredt metode til at lave de stykker er byte-pair encoding. Metoden er effektiv, men modellen får et id for hvert stykke og ikke de bogstaver, det består af. Den må lære af eksempler, at et bestemt stykke tegnes som en bestemt række bogstaver.
En artikel fra Google Research, Character-Aware Models Improve Visual Text Rendering, undersøgte det direkte. Forskerne sammenlignede tekstencodere, der ser enkelte tegn (»character-aware«), med encodere, der kun ser ordbidder (»character-blind«). Billedmodeller med character-aware-encodere gengav visuel tekst mere nøjagtigt, og de var særligt gode til sjældne ord. Artiklen fandt også, at meget store character-blind-sprogmodeller kan lære at stave godt, men at den evne ikke kunne overføres godt til andre sprog end engelsk og kun optrådte i modeller, der var langt større end de tekstencodere, billedgeneratorer typisk brugte dengang.
Træningsbilleder viser ofte tekst dårligt
Generatorer lærer af meget store samlinger af billeder med tilhørende beskrivelser. I de billeder er tekst ofte lille, sløret, afskåret, set skråt eller delvist skjult, og den optræder i et enormt udvalg af skrifttyper og stilarter. Beskrivelsen, der hører til et billede, nævner måske slet ikke dets tekst. Så modellen ser mange eksempler på, hvordan tekst ser ud generelt, men færre tydelige eksempler på, hvordan et bestemt ord præcis skal staves.
Lille tekst har meget få pixels
En overskrift kan fylde hundredvis af pixels, mens et ord i det med småt måske kun får nogle få pixels pr. bogstav. Mange generatorer arbejder også med en komprimeret version af billedet og genopbygger billedet i fuld størrelse til sidst, og det levner endnu mindre plads til små detaljer. Fine streger, fx tværstregen i et lille »e«, går let tabt.
Hvorfor nyere modeller skriver bedre tekst
Billedgeneratorer er blevet meget bedre til korte overskrifter og etiketter. Generelt bruger nyere systemer stærkere sprogmodeller til at forstå prompten, og udviklerne har givet tekst mere opmærksomhed under træningen. Forskningen ovenfor peger i samme retning: Modeller, der får bedre information om bogstaver, tegner tekst mere nøjagtigt.
Forbedringen er reel, men ujævn. En generator, der skriver en titel på tre ord korrekt, kan stadig have svært ved et afsnit, et menukort eller en etiket på et sprog, den så sjældnere under træningen.
Hvor AI-billedgeneratorer stadig har problemer
- Lang tekst. Afsnit, menukort og lister, hvor hvert ekstra ord er en ny risiko for fejl
- Lille tekst. Det med småt, etiketter og tekst langt væk i en scene
- Usædvanlige ord. Navne, opfundne ord, nye termer og lange tal som telefonnumre eller koder
- Ikke-latinske skriftsystemer. Arabisk, kinesisk, hindi, japansk, koreansk, thai og andre skriftsystemer samt bogstaver med accenttegn
- Mange tekstblokke. Plakater og infografikker med flere adskilte stykker tekst
- Buede eller skrå flader. Tekst på en flaske, et flag eller et skilt, der ses fra siden
- Ensartethed. At holde den samme ordlyd identisk på tværs af en serie billeder
Det er almindelige mønstre og ikke faste regler, og de varierer fra generator til generator og fra version til version.
Sådan får du bedre tekst, når du genererer et billede
- Sæt de præcise ord i anførselstegn. Bed fx om en plakat med titlen »NIGHT MARKET« i stedet for en plakat om et natmarked.
- Hold teksten kort. Nogle få ord i stor størrelse er lettere at få rigtige end en hel sætning. Læg længere tekst i en billedtekst eller på en webside i stedet.
- Sig, hvor teksten skal stå. Beskriv placering og størrelse, fx »stor titel hen over toppen« eller »lille etiket på glasset«.
- Bed om enkle bogstaver. Fede, rene versaler på et roligt område er lettere for en model at tegne end dekorativ skriveskrift over en urolig baggrund.
- Lav flere versioner. Generér nogle få muligheder, vælg den med den bedste stavning, og ret kun det, der er tilbage.
- Tilføj den præcise tekst bagefter, når det er vigtigt. Til et menukort, en prisliste eller alt, der indeholder det med småt, skal du generere billedet med tom plads og sætte teksten i et designværktøj. På den måde bliver ordlyden skrevet og ikke tegnet.
Sådan retter du teksten bagefter
Hvis billedet er rigtigt, men ordene er forkerte, har du fire hovedmuligheder. Her er de, fra den mindste indsats til den største.
| Metode | Indsats | Hvad der ellers kan ændre sig | Bedst når |
|---|---|---|---|
| Generér billedet igen | Lav | Alt, fordi du får et nyt billede | Hele billedet er forkert, eller du ikke har noget imod at miste denne version |
| Markér og rediger i generatoren | Lav | Områder i nærheden kan også blive tegnet om | Du vil have en hurtig rettelse i det samme værktøj |
| Værktøj til tekstudskiftning med AI | Lav til middel | Tekstområdet tegnes om, så tjek resultatet | Billedet er rigtigt, og det kun er ordene, der er forkerte |
| Ret det i hånden i et billedredigeringsprogram | Høj | Kun det, du selv ændrer | Du har brug for fuld kontrol, fx til tryk eller kundearbejde |
Generér billedet igen
Det kræver kun lidt indsats at generere igen, men resultatet er tilfældigt. Et nyt forsøg kan rette ordet og ødelægge noget andet, fx et ansigt, en hånd eller layoutet. Gør det, når du endnu ikke har brugt meget tid på netop dette billede.
Markér og rediger i generatoren
Nogle generatorer lader dig markere et område og beskrive en ændring. I ChatGPT kan du fx markere teksten med et markeringsværktøj og skrive, hvad der skal stå. OpenAI's hjælpecenter bemærker, at markeringer ikke altid er præcise, så detaljer i nærheden af teksten kan også ændre sig. Læs mere i Kan ChatGPT redigere tekst i et billede?.
Brug et værktøj til tekstudskiftning med AI
Et værktøj til tekstudskiftning genkender teksten i billedet for dig, så du kun skriver den rigtige stavemåde. Med EditText.ai kan du fx redigere tekst i et billede linje for linje, og hver linje tegnes om i de oprindelige bogstavers og baggrundens stil. Hvis det kun er ét forkert bogstav eller ord, kan du se, hvordan du kan rette en tastefejl i et billede. Til overskrifter og displaybogstaver på eventdesigns kan du se, hvordan du kan ændre tekst på en plakat.


Før og efter: et neonskilt med volapyk i et AI-billede, rettet ved at skrive THEATER i EditText.ai.
Resultaterne kan variere, især ved usædvanlige bogstaver eller detaljerede baggrunde. Fordi omtegningen også udføres af en billedmodel, skal du læse hvert nyt ord bogstav for bogstav i fuld størrelse. Enhver tekstgenkendelse kan også læse uforståelige bogstaver forkert, så sørg for, at hver genkendt linje er den, du ville ændre.
Ret det i hånden
I Photoshop, Photopea eller et lignende redigeringsprogram fjerner du de ødelagte bogstaver, genskaber baggrunden og sætter ny tekst i en skrifttype. Det giver dig mest kontrol og passer til tryk eller kundearbejde, men det kræver færdigheder og tid. AI-bogstaver er ofte ikke en rigtig skrifttype, så en skrifttypefinder finder måske intet match. Læs guiden Find skrifttypen i et billede for at se, hvordan du finder en tæt erstatning.
En enkel regel hjælper dig med at vælge: Hvis hele billedet er forkert, så generér det igen. Hvis det kun er ordene, der er forkerte, så ret ordene.
Andre muligheder
Du kan også fjerne tekst fra et billede helt og sætte rigtig tekst på den rene baggrund i et designværktøj, og det er en god fremgangsmåde til menukort og prislister. Når ordlyden er rigtig, kan du oversætte tekst i et billede for at lave versioner på andre sprog.
Rediger kun billeder, du ejer, eller som du har tilladelse til at ændre, fjern ikke vandmærker eller krediteringer, og behold den AI-mærkning, som en platform kræver.
Ret ordene, og behold billedet
Hvis billedet er rigtigt, men stavningen er forkert, behøver du ikke starte forfra. Upload det for at rette tekst i AI-billeder med EditText.ai, skriv de rigtige ord for hver linje, og tjek resultatet, før du downloader det.
Ofte stillede spørgsmål
Hvorfor ødelægger AI tekst i billeder?
AI-billedgeneratorer tegner tekst som former i stedet for at skrive den som bogstaver, og mange læser prompts i ordbidder og ikke i enkelte tegn. Tekst er også en lille detalje med strenge regler, så én forkert streg springer i øjnene. Træningsbilleder viser ofte tekst, der er lille, sløret eller set skråt, og det giver modellerne færre tydelige eksempler at lære af.
Hvorfor skriver AI volapyk i stedet for rigtige ord?
Når en model er usikker på, hvordan et ord staves, tegner den stadig former, der ligner bogstaver, fordi det er sådan, tekst ser ud i dens træningsbilleder. Resultatet kan være mærker, der ligner bogstaver, blandede alfabeter eller opfundne ord. Det sker oftest med lang tekst, lille tekst og usædvanlige ord og sjældnere med en kort frase i anførselstegn.
Hvilken AI-billedgenerator er bedst til tekst?
Der findes intet varigt svar, fordi modeller ændrer sig ofte, og hver ny version kan opføre sig anderledes. Generelt klarer nyere generatorer kort, stor tekst bedre end ældre. Den mest nyttige test er din egen prompt: Generér den samme korte frase i de værktøjer, du har adgang til, og tjek derefter stavningen bogstav for bogstav, før du vælger et.
Kan jeg rette fejlstavet tekst i et AI-billede uden at generere det igen?
Ja. Du kan markere området og beskrive rettelsen i den samme generator, skrive teksten ind igen manuelt i et redigeringsprogram som Photoshop eller Photopea eller bruge et værktøj til tekstudskiftning, der genkender ordene, så du kan skrive den rigtige stavemåde. Uanset hvilken metode du bruger, bør du sammenligne resultatet med originalen for at opdage ændringer i nærheden af teksten.
Hvorfor kan en skrifttypefinder ikke genkende bogstaverne i mit AI-billede?
AI-generatorer tegner som regel bogstaver ud fra mønstre, de har lært, og ikke ud fra en installeret skriftfil. Bogstaverne kan blande træk fra flere skrifttyper eller skifte form fra det ene bogstav til det næste. En skrifttypefinder kan stadig foreslå lignende skrifttyper, og det hjælper, hvis du planlægger at skrive teksten igen, men et præcist match findes ofte ikke.