edittext.ai

Hvorfor KI-bildegeneratorer ikke kan stave (og slik retter du det)

Hvorfor kan ikke KI-bildegeneratorer stave? De tegner bokstaver som former, ikke tekst. Se hva som gir forvrengte ord, og hvordan du retter dem.

KI-bildegeneratorer sliter med staving fordi de tegner bilder, ikke tekst. De lærer hvordan bokstaver ser ut som former og mønstre av piksler, og de skriver aldri et ord én bokstav om gangen, så en liten glipp kan gjøre «BAKERI» til «BAKRERI». Mange av dem leser dessuten prompten din i ordbiter i stedet for enkeltbokstaver, noe som gjør nøyaktig staving enda vanskeligere.

Nyere generatorer håndterer kort tekst mye bedre enn de første gjorde, men lange tekstpartier, liten skrift, uvanlige navn og ikke-latinske skriftsystemer gir fortsatt feil. Hvis du allerede har et bilde med ødelagte ord, kan du ofte rette tekst i KI-genererte bilder uten å begynne på nytt. Denne veiledningen forklarer hvorfor feilene oppstår, hvordan du skriver prompter som gir bedre tekst, og hvordan du reparerer den etterpå, enten bildet kom fra Midjourney, ChatGPT, Gemini, Stable Diffusion eller en annen generator.

Slik lager KI-bildegeneratorer et bilde

Mange populære bildegeneratorer bruker en metode som kalles en diffusjonsmodell. Modellen starter med tilfeldig støy, som snø på en TV-skjerm, og fjerner litt av denne støyen i hvert av mange trinn. Prompten din styrer hvert trinn, så støyen gradvis blir til et bilde som passer til beskrivelsen din. Hele bildet finpusses samtidig: himmelen, ansiktene og bokstavene tar form på samme tid.

Ikke alle generatorer fungerer slik. Noen bygger i stedet opp bildet som en rekke små biter. Men generelt har tekst-til-bilde-modeller ett viktig trekk til felles: de forutsier hvordan bildet skal se ut. Det finnes ikke noe trinn der modellen velger en skrifttype og skriver «B», deretter «A», deretter «K». Bokstaver dukker bare opp som former som ser riktige ut, og derfor kan de komme ut nesten riktige, men ikke helt.

Hvorfor tekst er så vanskelig for bildegeneratorer

Flere årsaker virker sammen. Hver av dem gjør en liten feil mer sannsynlig, og tekst er et sted der små feil er lette å se.

Bokstaver er små detaljer med strenge regler

Et tre kan ha et hvilket som helst antall grener og fortsatt se ut som et tre. Et ord har nøyaktig én riktig stavemåte. Tekst har også regler som gjelder hele ordet: hver bokstav må ha samme stil og høyde, avstanden må være jevn, og bokstavene må stå på samme linje. En ekstra strek, en manglende bokstav eller en doblet bokstav er tydelig for alle som leser språket, selv når resten av bildet ser ekte ut.

Modellen ser kanskje aldri bokstavene du skrev

Før en generator kan bruke prompten din, gjør en komponent som kalles en tekstenkoder den om til tall. Mange tekstenkodere deler først prompten opp i tokener. Vanlige ord blir ofte ett token, mens sjeldnere ord brytes opp i flere biter. En mye brukt metode for å lage disse bitene er byte-pair encoding. Tilnærmingen er effektiv, men modellen får en ID for hver bit, ikke bokstavene inni den. Den må lære av eksempler at en bestemt bit tegnes som en bestemt rekke bokstaver.

En artikkel fra Google Research, Character-Aware Models Improve Visual Text Rendering, undersøkte dette direkte. Forskerne sammenlignet tekstenkodere som ser enkelttegn («character-aware») med enkodere som bare ser ordbiter («character-blind»). Bildemodeller med tegnbevisste enkodere gjengav visuell tekst mer nøyaktig, og de var særlig sterke på sjeldne ord. Artikkelen fant også at svært store språkmodeller som ikke ser tegn, kan lære å stave godt, men at denne evnen ikke overførte seg godt utover engelsk og bare dukket opp i modeller som var langt større enn tekstenkoderne bildegeneratorer vanligvis brukte på den tiden.

Treningsbilder viser ofte tekst dårlig

Generatorer lærer av svært store samlinger av bilder som er paret med beskrivelser. I disse bildene er tekst ofte liten, uskarp, avkuttet, sett fra en vinkel eller delvis skjult, og den finnes i et enormt spenn av skrifttyper og stiler. Beskrivelsen som hører til et bilde, nevner kanskje ikke teksten i det i det hele tatt. Modellen ser dermed mange eksempler på hvordan tekst ser ut generelt, men færre tydelige eksempler på nøyaktig hvordan et bestemt ord skal staves.

Liten tekst har svært få piksler

En overskrift kan strekke seg over hundrevis av piksler, mens et ord i liten skrift kanskje bare får noen få piksler per bokstav. Mange generatorer jobber dessuten på en komprimert versjon av bildet og bygger opp bildet i full størrelse til slutt, noe som levner enda mindre plass til små detaljer. Fine streker, som tverrstreken i en liten «e», er lette å miste.

Hvorfor nyere modeller skriver bedre tekst

Bildegeneratorer har blitt mye bedre på korte overskrifter og etiketter. Generelt bruker nyere systemer sterkere språkmodeller til å forstå prompten, og utviklerne har gitt tekst mer oppmerksomhet under treningen. Forskningen ovenfor peker i samme retning: modeller som får bedre informasjon om bokstaver, tegner tekst mer nøyaktig.

Forbedringen er reell, men ujevn. En generator som skriver en tittel på tre ord riktig, kan fortsatt slite med et avsnitt, en meny eller en etikett på et språk den så sjeldnere under treningen.

Hvor KI-bildegeneratorer fortsatt sliter

  • Lang tekst. Avsnitt, menyer og lister, der hvert ekstra ord er en ny mulighet for feil
  • Liten tekst. Liten skrift, etiketter og tekst langt unna i en scene
  • Uvanlige ord. Navn, oppdiktede ord, nye begreper og lange tall som telefonnumre eller koder
  • Ikke-latinske skriftsystemer. Arabisk, kinesisk, hindi, japansk, koreansk, thai og andre skriftsystemer, samt bokstaver med aksenter
  • Mange tekstblokker. Plakater og infografikk med flere adskilte tekststykker
  • Buede eller skrå flater. Tekst på en flaske, et flagg eller et skilt sett fra siden
  • Konsistens. Å holde den samme ordlyden identisk gjennom en serie bilder

Dette er vanlige mønstre, ikke faste regler, og de varierer fra generator til generator og fra versjon til versjon.

Slik får du bedre tekst når du genererer et bilde

  1. Sett de nøyaktige ordene i anførselstegn. Be for eksempel om en plakat med tittelen «NATTMARKED» i stedet for en plakat om et nattmarked.
  2. Hold teksten kort. Noen få ord i stor størrelse er lettere å få riktig enn en hel setning. Legg lengre tekst i en bildetekst eller på en nettside i stedet.
  3. Si hvor teksten skal stå. Beskriv plassering og størrelse, for eksempel «stor tittel øverst» eller «liten etikett på glasset».
  4. Be om enkel skrift. Fete, rene store bokstaver på et enkelt område er lettere for en modell å tegne enn dekorativ skriveskrift over en travel bakgrunn.
  5. Lag flere versjoner. Generer noen alternativer, velg det med best staving, og rett bare det som er igjen.
  6. Legg til nøyaktig tekst senere når det er viktig. For en meny, en prisliste eller noe med liten skrift genererer du bildet med tomt rom og setter teksten i et designverktøy. Slik er ordlyden skrevet, ikke tegnet.

Slik retter du teksten etterpå

Hvis bildet er riktig, men ordene er feil, har du fire hovedalternativer. Her er de, fra minst til mest innsats.

MetodeInnsatsHva annet kan endre segBest når
Generere bildet på nyttLavAlt, fordi du får et nytt bildeHele bildet er feil, eller du ikke har noe imot å miste denne versjonen
Markere og redigere i generatorenLavOmråder i nærheten kan også bli tegnet på nyttDu vil ha en rask løsning i samme verktøy
Verktøy for KI-erstatning av tekstLav til middelsTekstområdet tegnes på nytt, så sjekk resultatetBildet er riktig og bare ordene er feil
Rette det for hånd i et bildeprogramHøyBare det du endrerDu trenger full kontroll, for eksempel til trykk eller kundearbeid

Generer bildet på nytt

Å generere på nytt krever lite innsats, men resultatet er tilfeldig. Et nytt forsøk kan rette ordet og ødelegge noe annet, for eksempel et ansikt, en hånd eller oppsettet. Bruk det når du ikke har brukt mye tid på akkurat dette bildet ennå.

Marker og rediger inne i generatoren

Noen generatorer lar deg markere et område og beskrive en endring. I ChatGPT kan du for eksempel markere teksten med et utvalgsverktøy og skrive hva den skal si. OpenAIs hjelpesenter oppgir at markeringer ikke alltid er presise, så detaljer nær teksten kan også endre seg. For en nærmere titt, se kan ChatGPT endre tekst i et bilde.

Bruk et verktøy for KI-erstatning av tekst

Et verktøy for tekstutskifting gjenkjenner teksten i bildet for deg, så du bare skriver den riktige stavemåten. Med EditText.ai kan du for eksempel redigere tekst i et bilde linje for linje, og hver linje tegnes på nytt i utseendet til de opprinnelige bokstavene og bakgrunnen. For én enkelt feil bokstav eller ett enkelt ord, se hvordan du retter en skrivefeil i et bilde. For overskrifter og displayskrift i arrangementsdesign, se hvordan du endrer tekst på en plakat.

Før: KI-generert retroillustrasjon av en gate i New York om natten, med et høyt rødt neonskilt der det står den meningsløse teksten NEYAHRD
Etter: den samme illustrasjonen der det røde neonskiltet nå lyder THEATER, mens silhuetten av byen, drosjene og overskriften NEW YORK er uendret

Før og etter: et forvrengt neonskilt i et KI-bilde, rettet ved å skrive THEATER i EditText.ai.

Resultatene kan variere, særlig med uvanlig skrift eller detaljerte bakgrunner. Fordi nytegningen også gjøres av en bildemodell, bør du lese hvert nye ord bokstav for bokstav i full størrelse. Tekstgjenkjenning kan også lese forvrengte bokstaver feil, så sørg for at hver gjenkjente linje er den du mente å endre.

Rett det for hånd

I Photoshop, Photopea eller et lignende program fjerner du de ødelagte bokstavene, bygger opp bakgrunnen igjen og setter ny tekst i en skrifttype. Dette gir deg mest kontroll og passer for trykk eller kundearbeid, men det krever ferdigheter og tid. KI-bokstaver er ofte ikke en ekte skrifttype, så en skrifttypefinner finner kanskje ikke noe treff. Les slik finner du skrifttypen i et bilde for måter å finne en nær erstatning på.

En enkel regel hjelper deg å velge: Hvis hele bildet er feil, genererer du det på nytt. Hvis bare ordene er feil, retter du ordene.

Andre alternativer

Du kan også fjerne tekst fra et bilde helt og sette ekte tekst på den rene bakgrunnen i et designverktøy, en god fremgangsmåte for menyer og prislister. Når ordlyden er riktig, kan du oversette tekst i et bilde for å lage versjoner på andre språk.

Rediger bare bilder du eier eller har tillatelse til å endre, ikke fjern vannmerker eller bildekrediteringer, og behold eventuelle merkinger av KI-bilder som en plattform krever.

Rett ordene og behold bildet

Hvis bildet er riktig, men stavemåten er feil, trenger du ikke begynne på nytt. Last det opp for å rette tekst i KI-bilder med EditText.ai, skriv de riktige ordene for hver linje, og sjekk resultatet før du laster det ned.

Vanlige spørsmål

Hvorfor roter KI til tekst i bilder?

KI-bildegeneratorer tegner tekst som former i stedet for å skrive den som bokstaver, og mange leser prompter i ordbiter i stedet for enkelttegn. Tekst er også en liten detalj med strenge regler, så én feil strek skiller seg ut. Treningsbilder viser ofte tekst som er liten, uskarp eller sett fra en vinkel, noe som gir modellene færre tydelige eksempler å lære av.

Hvorfor skriver KI meningsløs tekst i stedet for ekte ord?

Når en modell er usikker på hvordan et ord staves, tegner den likevel former som ser ut som bokstaver, fordi det er slik tekst ser ut i treningsbildene. Resultatet kan bli bokstavlignende tegn, blandede alfabeter eller oppdiktede ord. Det skjer oftest med lang tekst, liten skrift og uvanlige ord, og sjeldnere med en kort frase i anførselstegn.

Hvilken KI-bildegenerator er best på tekst?

Det finnes ikke noe varig svar, fordi modellene endrer seg ofte og hver nye versjon kan oppføre seg annerledes. Generelt håndterer nyere generatorer kort, stor tekst bedre enn eldre. Den mest nyttige testen er din egen prompt: generer den samme korte frasen i verktøyene du har tilgang til, og sjekk deretter staving bokstav for bokstav før du velger ett.

Kan jeg rette feilstavet tekst i et KI-bilde uten å generere det på nytt?

Ja. Du kan markere området og beskrive rettelsen i den samme generatoren, skrive teksten på nytt for hånd i et program som Photoshop eller Photopea, eller bruke et verktøy for tekstutskifting som gjenkjenner ordene slik at du kan skrive riktig stavemåte. Uansett hvilken metode du bruker, bør du sammenligne resultatet med originalen for å oppdage endringer nær teksten.

Hvorfor kan ikke en skrifttypefinner gjenkjenne bokstavene i KI-bildet mitt?

KI-generatorer tegner vanligvis bokstaver ut fra mønstre de har lært, ikke fra en installert skriftfil. Bokstavene kan blande trekk fra flere skrifttyper eller endre form fra den ene bokstaven til den neste. Et verktøy for skrifttypegjenkjenning kan fortsatt foreslå lignende skrifttyper, noe som hjelper hvis du planlegger å skrive teksten på nytt, men en eksakt match finnes ofte ikke.