edittext.ai

Miksi tekoäly ei osaa kirjoittaa kuviin tekstiä – ja miten sen korjaa

Miksi tekoäly ei osaa kirjoittaa kuviin tekstiä? Se piirtää kirjaimet muotoina, ei tekstinä. Opi sekavien sanojen syyt ja tavat korjata ne.

Tekoälykuvageneraattorit kamppailevat oikeinkirjoituksen kanssa, koska ne piirtävät kuvia eivätkä tekstiä. Ne oppivat, miltä kirjaimet näyttävät muotoina ja pikselikuvioina, eivätkä ne koskaan kirjoita sanaa yksi kirjain kerrallaan, joten pieni lipsahdus voi muuttaa sanan ”BAKERY” sanaksi ”BAKRERY”. Monet niistä myös lukevat kehotteesi sananpaloina yksittäisten kirjainten sijaan, mikä tekee täsmällisestä oikeinkirjoituksesta vielä vaikeampaa.

Uudemmat generaattorit käsittelevät lyhyttä tekstiä paljon paremmin kuin varhaiset, mutta pitkät kappaleet, pienet kirjaimet, epätavalliset nimet ja ei-latinalaiset kirjoitusjärjestelmät aiheuttavat yhä virheitä. Jos sinulla on jo kuva, jonka sanat ovat rikki, voit usein korjata tekoälyllä luodun kuvan tekstin aloittamatta alusta. Tämä opas selittää, miksi virheitä syntyy, miten kehotteella saa parempaa tekstiä ja miten tekstin voi korjata jälkikäteen, tulipa kuva sitten Midjourneystä, ChatGPT:stä, Geministä, Stable Diffusionista tai jostain muusta generaattorista.

Miten tekoälykuvageneraattorit tekevät kuvan

Monet suositut kuvageneraattorit käyttävät menetelmää, jota kutsutaan diffuusiomalliksi. Malli aloittaa satunnaisesta kohinasta, joka muistuttaa television lumisadetta, ja poistaa siitä hieman kohinaa jokaisella monesta vaiheesta. Kehotteesi ohjaa jokaista vaihetta, joten kohina muuttuu hitaasti kuvaukseesi sopivaksi kuvaksi. Koko kuvaa tarkennetaan yhdessä: taivas, kasvot ja kirjaimet saavat muotonsa samaan aikaan.

Kaikki generaattorit eivät toimi näin. Jotkin rakentavat kuvan sen sijaan pienten palasten jonona. Mutta yleisesti ottaen kuvageneraattoreilla on yksi tärkeä yhteinen piirre: ne ennustavat, miltä kuvan pitäisi näyttää. Ei ole vaihetta, jossa malli valitsisi fontin ja kirjoittaisi ”B”, sitten ”A” ja sitten ”K”. Kirjaimet ilmestyvät vain oikealta näyttävinä muotoina, minkä vuoksi ne voivat tulla melkein oikein mutta eivät aivan.

Miksi teksti on kuvageneraattoreille niin vaikeaa

Useat syyt vaikuttavat yhdessä. Jokainen niistä tekee pienestä virheestä todennäköisemmän, ja teksti on paikka, jossa pienet virheet on helppo nähdä.

Kirjaimet ovat pieniä yksityiskohtia, joilla on tiukat säännöt

Puussa voi olla mikä tahansa määrä oksia, ja se näyttää silti puulta. Sanalla on täsmälleen yksi oikea kirjoitusasu. Tekstillä on myös sääntöjä, jotka koskevat koko sanaa: jokaisella kirjaimella täytyy olla sama tyyli ja korkeus, välistyksen täytyy olla tasainen ja kirjainten täytyy olla samalla viivalla. Yksi ylimääräinen viiva, puuttuva kirjain tai kaksinkertainen kirjain on ilmeinen jokaiselle, joka lukee kieltä, vaikka muu kuva näyttäisi todelliselta.

Malli ei välttämättä koskaan näe kirjoittamiasi kirjaimia

Ennen kuin generaattori voi käyttää kehotettasi, tekstienkooderiksi kutsuttu komponentti muuttaa sen numeroiksi. Monet tekstienkooderit jakavat kehotteen ensin tokeneiksi. Yleiset sanat muuttuvat usein yhdeksi tokeniksi, kun taas harvinaisemmat sanat pilkotaan useaksi palaksi. Laajasti käytetty menetelmä näiden palasten muodostamiseen on tavuparikoodaus. Menetelmä on tehokas, mutta malli saa kustakin palasta tunnisteen, ei sen sisällä olevia kirjaimia. Sen täytyy oppia esimerkeistä, että tietty pala piirretään tietyksi kirjainriviksi.

Google Researchin tutkimusartikkeli Character-Aware Models Improve Visual Text Rendering tutki tätä suoraan. Tutkijat vertasivat tekstienkoodereita, jotka näkevät yksittäiset merkit (”character-aware”), enkoodereihin, jotka näkevät vain sananpalat (”character-blind”). Kuvamallit, joissa oli merkit huomioivat enkooderit, piirsivät visuaalisen tekstin tarkemmin, ja ne olivat erityisen vahvoja harvinaisissa sanoissa. Artikkelissa havaittiin myös, että hyvin suuret merkkejä huomiotta jättävät kielimallit voivat oppia kirjoittamaan hyvin, mutta tämä kyky ei siirtynyt hyvin englannin ulkopuolelle ja ilmeni vain malleissa, jotka olivat paljon suurempia kuin tekstienkooderit, joita kuvageneraattorit tuolloin tyypillisesti käyttivät.

Koulutuskuvat esittävät tekstin usein huonosti

Generaattorit oppivat hyvin suurista kuvakokoelmista, joihin on liitetty kuvauksia. Näissä kuvissa teksti on usein pientä, sumeaa, katkennutta, nähty vinosti tai osittain piilossa, ja se esiintyy valtavassa määrässä fontteja ja tyylejä. Kuvaan liitetty kuvaus ei välttämättä mainitse sen tekstiä lainkaan. Malli näkee siis monta esimerkkiä siitä, miltä teksti yleisesti näyttää, mutta vähemmän selkeitä esimerkkejä siitä, miten täsmälleen tietty sana kirjoitetaan.

Pienessä tekstissä on hyvin vähän pikseleitä

Otsikko voi ulottua satoihin pikseleihin, kun taas pienen präntin sana voi saada vain muutaman pikselin kirjainta kohti. Monet generaattorit myös työskentelevät kuvan pakatulla versiolla ja rakentavat täysikokoisen kuvan lopuksi, mikä jättää pienille yksityiskohdille vielä vähemmän tilaa. Hienot viivat, kuten pienen ”e”-kirjaimen poikkiviiva, katoavat helposti.

Miksi uudemmat mallit kirjoittavat parempaa tekstiä

Kuvageneraattorit ovat tulleet paljon paremmiksi lyhyissä otsikoissa ja nimikkeissä. Yleisesti ottaen uudemmat järjestelmät käyttävät vahvempia kielimalleja kehotteen ymmärtämiseen, ja kehittäjät ovat kiinnittäneet tekstiin enemmän huomiota koulutuksen aikana. Yllä oleva tutkimus osoittaa samaan suuntaan: mallit, jotka saavat parempaa tietoa kirjaimista, piirtävät tekstiä tarkemmin.

Parannus on todellinen mutta epätasainen. Generaattori, joka kirjoittaa kolmen sanan otsikon oikein, voi silti kamppailla kappaleen, ruokalistan tai sellaisen kielen nimikkeen kanssa, jota se näki koulutuksen aikana harvemmin.

Missä tekoälykuvageneraattorit yhä kamppailevat

  • Pitkä teksti. Kappaleet, ruokalistat ja luettelot, joissa jokainen ylimääräinen sana on uusi mahdollisuus virheeseen
  • Pieni teksti. Pieni präntti, nimikkeet ja kaukana kuvassa oleva teksti
  • Epätavalliset sanat. Nimet, keksityt sanat, uudet termit ja pitkät numerot, kuten puhelinnumerot tai koodit
  • Ei-latinalaiset kirjoitusjärjestelmät. Arabia, kiina, hindi, japani, korea, thai ja muut kirjoitusjärjestelmät sekä aksenttikirjaimet
  • Monta tekstilohkoa. Julisteet ja infografiikat, joissa on useita erillisiä tekstikohtia
  • Kaarevat tai vinot pinnat. Teksti pullossa, lipussa tai sivulta nähdyssä kyltissä
  • Yhdenmukaisuus. Saman sanamuodon pitäminen identtisenä kuvasarjassa

Nämä ovat yleisiä malleja eivätkä kiinteitä sääntöjä, ja ne vaihtelevat generaattorista ja versiosta toiseen.

Näin saat parempaa tekstiä kuvaa luodessasi

  1. Laita täsmälliset sanat lainausmerkkeihin. Pyydä esimerkiksi julistetta, jonka otsikko on ”NIGHT MARKET”, sen sijaan että pyytäisit julistetta yötorista.
  2. Pidä teksti lyhyenä. Muutama sana suurella koolla on helpompi saada oikein kuin kokonainen lause. Laita pidempi teksti sen sijaan kuvatekstiin tai verkkosivulle.
  3. Kerro, minne teksti tulee. Kuvaile sijoitus ja koko, esimerkiksi ”suuri otsikko yläreunan poikki” tai ”pieni etiketti purkissa”.
  4. Pyydä yksinkertaisia kirjaimia. Lihavat, siistit isot kirjaimet tasaisella alueella on mallin helpompi piirtää kuin koristeellinen kaunokirjoitus vilkkaan taustan päällä.
  5. Tee useita versioita. Luo muutama vaihtoehto, valitse se, jonka kirjoitusasu on paras, ja korjaa vain se, mikä jää jäljelle.
  6. Lisää täsmällinen teksti myöhemmin, kun sillä on merkitystä. Luo ruokalistaa, hinnastoa tai mitä tahansa pientä präntiä sisältävää varten kuva tyhjällä tilalla ja aseta teksti suunnittelutyökalussa. Näin sanamuoto kirjoitetaan eikä piirretä.

Näin korjaat tekstin jälkikäteen

Jos kuva on oikea mutta sanat ovat väärin, sinulla on neljä pääasiallista vaihtoehtoa. Tässä ne vähiten vaivaa vaativasta eniten vaativaan.

MenetelmäVaivaMikä muu voi muuttuaParhaiten sopii, kun
Kuvan luominen uudelleenVähäinenKaikki, koska saat uuden kuvanKoko kuva on väärin tai et välitä menettää tätä versiota
Valinta ja muokkaus generaattorissaVähäinenLähellä olevat alueet voidaan myös piirtää uudelleenHaluat nopean korjauksen samassa työkalussa
Tekoälypohjainen tekstinkorvaustyökaluVähäinen tai keskisuuriTekstialue piirretään uudelleen, joten tarkista tulosKuva on oikea ja vain sanat ovat väärin
Korjaus käsin kuvaeditorissaSuuriVain se, mitä muutatTarvitset täyttä hallintaa, esimerkiksi painoon tai asiakastyöhön

Luo kuva uudelleen

Uudelleen luominen vaatii vähän vaivaa, mutta tulos on sattumanvarainen. Uusi yritys voi korjata sanan ja rikkoa jotain muuta, kuten kasvot, käden tai asettelun. Käytä sitä, kun et ole vielä käyttänyt paljon aikaa juuri tähän kuvaan.

Valitse ja muokkaa generaattorin sisällä

Joissakin generaattoreissa voit merkitä alueen ja kuvailla muutoksen. ChatGPT:ssä voit esimerkiksi merkitä tekstin valintatyökalulla ja kirjoittaa, mitä sen pitäisi sanoa. OpenAI:n ohjekeskus huomauttaa, että merkinnät eivät aina ole tarkkoja, joten myös tekstin lähellä olevat yksityiskohdat voivat muuttua. Tarkemman katsauksen löydät artikkelista voiko ChatGPT muokata tekstiä kuvassa.

Käytä tekoälypohjaista tekstinkorvaustyökalua

Tekstinkorvaustyökalu tunnistaa kuvan tekstin puolestasi, joten kirjoitat vain oikean kirjoitusasun. EditText.ai:ssa voit esimerkiksi muokata tekstiä kuvassa rivi riviltä, ja jokainen rivi piirretään uudelleen alkuperäisten kirjainten ja taustan ulkoasulla. Yksittäisen väärän kirjaimen tai sanan kohdalla katso, miten korjaat kirjoitusvirheen kuvassa. Tapahtumagrafiikan otsikoiden ja koristekirjainten kohdalla katso, miten muokkaat julisteen tekstiä.

Ennen: tekoälyllä luotu retrotyylinen kuvitus New Yorkin kadusta yöllä; korkeassa punaisessa neonkyltissä lukee sekavaa tekstiä NEYAHRD
Jälkeen: sama kuvitus, jossa punaisessa neonkyltissä lukee nyt THEATER, kun taas siluetti, taksit ja NEW YORK -otsikko ovat ennallaan

Ennen ja jälkeen: sekava neonkyltti tekoälykuvassa korjattuna kirjoittamalla THEATER EditText.ai:ssa.

Tulokset voivat vaihdella, erityisesti epätavallisilla kirjaimilla tai yksityiskohtaisilla taustoilla. Koska myös uudelleenpiirron tekee kuvamalli, lue jokainen uusi sana kirjain kirjaimelta täysikokoisena. Mikä tahansa tekstintunnistus voi myös lukea sekavia kirjaimia väärin, joten varmista, että jokainen tunnistettu rivi on se, jonka tarkoitit muuttaa.

Korjaa käsin

Photoshopissa, Photopeassa tai vastaavassa editorissa poistat rikkinäiset kirjaimet, rakennat taustan uudelleen ja asetat uuden tekstin fontilla. Tämä antaa eniten hallintaa ja sopii painotöihin tai asiakastöihin, mutta vaatii osaamista ja aikaa. Tekoälyn kirjaimet eivät usein ole oikea fontti, joten fonttihaku ei välttämättä löydä vastinetta. Oppaassa näin tunnistat fontin kuvasta on keinoja läheisen vastineen löytämiseen.

Yksinkertainen sääntö auttaa valitsemaan: jos koko kuva on väärin, luo se uudelleen. Jos vain sanat ovat väärin, korjaa sanat.

Muita vaihtoehtoja

Voit myös poistaa tekstin kuvasta kokonaan ja asettaa oikean tekstin puhtaalle taustalle suunnittelutyökalussa, mikä on hyvä lähestymistapa ruokalistoihin ja hinnastoihin. Kun sanamuoto on oikein, voit kääntää kuvan tekstin tehdäksesi versiot muille kielille.

Muokkaa vain kuvia, jotka omistat tai joiden muuttamiseen sinulla on lupa, älä poista vesileimoja tai tekijämainintoja ja säilytä kaikki tekoälykuvien merkinnät, joita alusta edellyttää.

Korjaa sanat ja säilytä kuva

Jos kuva on oikea mutta kirjoitusasu väärin, sinun ei tarvitse aloittaa alusta. Lähetä se EditText.ai:hin korjataksesi tekoälyllä luodun kuvan tekstin, kirjoita oikeat sanat jokaiselle riville ja tarkista tulos, ennen kuin lataat sen.

Usein kysytyt kysymykset

Miksi tekoäly sotkee tekstin kuvissa?

Tekoälykuvageneraattorit piirtävät tekstin muotoina sen sijaan, että kirjoittaisivat sen kirjaimina, ja monet lukevat kehotteet sananpaloina yksittäisten merkkien sijaan. Teksti on myös pieni yksityiskohta, jolla on tiukat säännöt, joten yksi väärä viiva erottuu. Koulutuskuvissa teksti on usein pientä, sumeaa tai vinossa, mikä antaa malleille vähemmän selkeitä esimerkkejä, joista oppia.

Miksi tekoäly kirjoittaa sekavaa tekstiä oikeiden sanojen sijaan?

Kun malli ei ole varma sanan kirjoitusasusta, se piirtää silti kirjaimilta näyttäviä muotoja, koska juuri sellaiselta teksti näyttää sen koulutuskuvissa. Tuloksena voi olla kirjaimenkaltaisia merkkejä, sekoittuneita aakkosia tai keksittyjä sanoja. Tätä tapahtuu eniten pitkän tekstin, pienten kirjainten ja epätavallisten sanojen kanssa ja harvemmin lainausmerkeissä olevan lyhyen ilmauksen kanssa.

Mikä tekoälykuvageneraattori on paras tekstissä?

Pysyvää vastausta ei ole, koska mallit muuttuvat usein ja jokainen uusi versio voi käyttäytyä eri tavalla. Yleisesti ottaen viimeaikaiset generaattorit käsittelevät lyhyttä, suurta tekstiä paremmin kuin vanhemmat. Hyödyllisin testi on oma kehotteesi: luo sama lyhyt ilmaus käyttämissäsi työkaluissa ja tarkista sitten kirjoitusasu kirjain kirjaimelta, ennen kuin valitset yhden.

Voinko korjata väärin kirjoitetun tekstin tekoälykuvassa luomatta kuvaa uudelleen?

Kyllä. Voit valita alueen ja kuvailla korjauksen samassa generaattorissa, kirjoittaa tekstin uudelleen käsin editorissa, kuten Photoshopissa tai Photopeassa, tai käyttää tekstinkorvaustyökalua, joka tunnistaa sanat, jotta voit kirjoittaa oikean kirjoitusasun. Mitä menetelmää tahansa käytätkin, vertaa tulosta alkuperäiseen havaitaksesi tekstin lähellä tapahtuneet muutokset.

Miksi fonttihaku ei tunnista tekoälykuvani kirjaimia?

Tekoälygeneraattorit piirtävät kirjaimet yleensä oppimiensa kuvioiden pohjalta, eivät asennetusta fonttitiedostosta. Kirjaimissa voi olla useiden kirjasintyyppien piirteitä, tai ne voivat muuttaa muotoaan kirjaimesta toiseen. Fonttitunnistin voi silti ehdottaa samankaltaisia fontteja, mikä auttaa, jos aiot kirjoittaa tekstin uudelleen, mutta täsmällistä vastinetta ei usein ole.