Tehisintellekti pildigeneraatoritel on õigekirjaga raskusi, sest nad joonistavad pilte, mitte teksti. Nad õpivad, millised tähed välja näevad kujude ja pikslimustritena, ega kirjuta kunagi sõna ühe tähe kaupa, seega võib väike eksimus muuta „BAKERY“ sõnaks „BAKRERY“. Paljud neist loevad sinu prompti ka sõnatükkidena, mitte üksikute tähtedena, mis teeb täpse õigekirja veelgi raskemaks.
Uuemad generaatorid saavad lühikese tekstiga palju paremini hakkama kui varased, kuid pikad lõigud, väike kiri, ebatavalised nimed ja mitteladina kirjasüsteemid põhjustavad ikka vigu. Kui sul on juba pilt katkiste sõnadega, saad sageli parandada teksti tehisintellekti loodud piltidel ilma otsast alustamata. See juhend selgitab, miks vead tekivad, kuidas parema teksti saamiseks prompti koostada ja kuidas seda hiljem parandada, olenemata sellest, kas pilt pärineb Midjourneyst, ChatGPT-st, Geminist, Stable Diffusionist või mõnest muust generaatorist.
Kuidas tehisintellekti pildigeneraatorid pilti teevad
Paljud populaarsed pildigeneraatorid kasutavad meetodit nimega difusioonimudel. Mudel alustab juhusliku müraga, mis meenutab ekraani lumesadu, ja eemaldab sellest paljude sammude jooksul iga sammuga veidi müra. Sinu prompt juhib iga sammu, seega muutub müra aeglaselt pildiks, mis vastab sinu kirjeldusele. Kogu pilti täpsustatakse koos: taevas, näod ja kiri võtavad kõik samal ajal kuju.
Mitte iga generaator ei tööta nii. Mõned ehitavad pildi hoopis väikeste tükkide jadana. Kuid üldiselt on tekstist pilti loovatel mudelitel üks oluline ühine joon: nad ennustavad, milline pilt peaks välja nägema. Puudub samm, kus mudel valib fondi ja kirjutab „B“, seejärel „A“ ja siis „K“. Tähed ilmuvad ainult kujudena, mis näevad õiged välja, mistõttu võivad need tulla peaaegu õiged, kuid mitte päris.
Miks on tekst pildigeneraatoritele nii raske
Mitu põhjust mõjuvad koos. Igaüks neist muudab väikese vea tõenäolisemaks ja tekst on koht, kus väikesed vead on kergesti näha.
Tähed on pisidetailid rangete reeglitega
Puul võib olla mis tahes arv oksi ja see näeb ikka välja nagu puu. Sõnal on täpselt üks õige kirjapilt. Tekstil on ka reeglid, mis kehtivad kogu sõna ulatuses: igal tähel peab olema sama stiil ja kõrgus, vahed peavad olema ühtlased ja tähed peavad asuma samal real. Üks lisajoon, puuduv täht või kahekordne täht on kõigile, kes keelt loevad, ilmne, isegi kui ülejäänud pilt näeb päris välja.
Mudel ei pruugi sinu kirjutatud tähti kunagi näha
Enne kui generaator saab sinu prompti kasutada, muudab komponent nimega tekstikodeerija selle arvudeks. Paljud tekstikodeerijad jagavad prompti esmalt tokeniteks. Tavalised sõnad muutuvad sageli üheks tokeniks, harvemad sõnad aga tükeldatakse mitmeks osaks. Laialt kasutatav meetod nende osade loomiseks on baidipaaride kodeerimine (byte-pair encoding). See lähenemine on tõhus, kuid mudel saab iga osa kohta ID, mitte selle sees olevaid tähti. Ta peab näidetest õppima, et teatud osa joonistatakse teatud tähtede reana.
Google Researchi artikkel Character-Aware Models Improve Visual Text Rendering uuris seda otse. Teadlased võrdlesid tekstikodeerijaid, mis näevad üksikuid märke („character-aware“), kodeerijatega, mis näevad ainult sõnatükke („character-blind“). Pildimudelid, mille kodeerijad nägid üksikuid märke, renderdasid visuaalset teksti täpsemalt ja olid eriti tugevad harvaesinevate sõnade puhul. Artikkel leidis ka, et väga suured keelemudelid, mis üksikuid märke ei näe, võivad õppida hästi kirjutama, kuid see võime ei kandunud hästi üle inglise keelest kaugemale ja ilmnes ainult mudelites, mis olid palju suuremad kui tekstikodeerijad, mida pildigeneraatorid tol ajal tavaliselt kasutasid.
Treeningpildid näitavad teksti sageli halvasti
Generaatorid õpivad väga suurtest piltide kogudest, millega on seotud kirjeldused. Nendel piltidel on tekst sageli väike, hägune, ära lõigatud, nurga alt nähtav või osaliselt peidetud ning see esineb väga paljudes fontides ja stiilides. Pildiga seotud kirjeldus ei pruugi selle teksti üldse mainida. Seega näeb mudel palju näiteid selle kohta, milline tekst üldiselt välja näeb, kuid vähem selgeid näiteid selle kohta, kuidas konkreetne sõna täpselt kirjutada.
Väikesel tekstil on väga vähe piksleid
Pealkiri võib ulatuda sadade pikslite peale, samas kui väikese kirja sõna võib saada vaid mõne piksli tähe kohta. Paljud generaatorid töötavad ka pildi kokkusurutud versiooniga ja taastavad täissuuruses pildi lõpus, mis jätab väikestele detailidele veelgi vähem ruumi. Peeni jooni, näiteks väikese „e“ ristjoont, on kerge kaotada.
Miks uuemad mudelid kirjutavad paremat teksti
Pildigeneraatorid on lühikeste pealkirjade ja siltidega palju paremaks muutunud. Üldiselt kasutavad uuemad süsteemid prompti mõistmiseks tugevamaid keelemudeleid ja arendajad on treenimise ajal tekstile rohkem tähelepanu pööranud. Ülaltoodud uuring osutab samas suunas: mudelid, mis saavad tähtede kohta paremat teavet, joonistavad teksti täpsemalt.
Paranemine on tõeline, kuid ebaühtlane. Generaator, mis kirjutab kolmesõnalise pealkirja õigesti, võib ikka hätta jääda lõigu, menüü või sildiga keeles, mida ta treenimise ajal harvemini nägi.
Kus tehisintellekti pildigeneraatoritel on ikka raskusi
- Pikk tekst. Lõigud, menüüd ja loendid, kus iga lisasõna on veel üks võimalus veaks
- Väike tekst. Väike kiri, sildid ja stseenis kaugel olev tekst
- Ebatavalised sõnad. Nimed, väljamõeldud sõnad, uued terminid ja pikad numbrid, näiteks telefoninumbrid või koodid
- Mitteladina kirjasüsteemid. Araabia, hiina, hindi, jaapani, korea, tai ja muud kirjasüsteemid, samuti diakriitiliste märkidega tähed
- Palju tekstiplokke. Plakatid ja infograafikud, millel on mitu eraldi tekstiosa
- Kaarduvad või nurga all olevad pinnad. Pudelil, lipul või küljelt nähtaval sildil olev tekst
- Järjepidevus. Sama sõnastuse identsena hoidmine piltide seerias
Need on pigem tavalised mustrid kui kindlad reeglid ja need varieeruvad generaatorist ja versioonist teise.
Kuidas pildi genereerimisel paremat teksti saada
- Pane täpsed sõnad jutumärkidesse. Näiteks palu plakatit pealkirjaga „NIGHT MARKET“, mitte plakatit öisest turust.
- Hoia tekst lühike. Mõned sõnad suures suuruses on lihtsam õigesti kätte saada kui terve lause. Pane pikem tekst hoopis pealdisse või veebilehele.
- Ütle, kuhu tekst läheb. Kirjelda asukohta ja suurust, näiteks „suur pealkiri üleval üle kogu laiuse“ või „väike silt purgil“.
- Palu lihtsat kirja. Paksud, puhtad suurtähed ühtlasel alal on mudelil lihtsam joonistada kui dekoratiivne kaunkiri kirjul taustal.
- Tee mitu versiooni. Genereeri mõned valikud, vali parima õigekirjaga ja paranda ainult see, mis alles jääb.
- Lisa täpne tekst hiljem, kui see on oluline. Menüü, hinnakirja või muu väikese kirjaga asja jaoks genereeri pilt tühja ruumiga ja lisa tekst disainitööriistas. Nii on sõnastus kirjutatud, mitte joonistatud.
Kuidas teksti hiljem parandada
Kui pilt on õige, kuid sõnad on valed, on sul neli peamist võimalust. Siin on need vähimast vaevast suurimani.
| Meetod | Vaev | Mis veel võib muutuda | Sobib kõige paremini, kui |
|---|---|---|---|
| Genereeri pilt uuesti | Väike | Kõik, sest saad uue pildi | Kogu pilt on vale või sa ei pane pahaks selle versiooni kaotamist |
| Vali ja muuda generaatoris | Väike | Lähedal olevad alad võidakse samuti uuesti joonistada | Soovid kiiret parandust samas tööriistas |
| Tehisintellekti teksti asendamise tööriist | Väike kuni keskmine | Tekstiala joonistatakse uuesti, seega kontrolli tulemust | Pilt on õige ja ainult sõnad on valed |
| Paranda käsitsi pildiredaktoris | Suur | Ainult see, mida muudad | Vajad täielikku kontrolli, näiteks trüki- või klienditöö jaoks |
Genereeri pilt uuesti
Uuesti genereerimine nõuab vähe vaeva, kuid tulemus on juhuslik. Uus katse võib sõna parandada ja midagi muud, näiteks nägu, kätt või paigutust, rikkuda. Kasuta seda siis, kui sa pole selle konkreetse pildiga veel palju aega veetnud.
Vali ja muuda generaatori sees
Mõned generaatorid lasevad ala märkida ja muudatust kirjeldada. ChatGPT-s saad näiteks teksti valikutööriistaga esile tõsta ja kirjutada, mida see peaks ütlema. OpenAI abikeskus märgib, et esiletõstmised ei ole alati täpsed, seega võivad ka teksti lähedal olevad detailid muutuda. Lähema ülevaate saamiseks vaata kas ChatGPT oskab pildil teksti muuta.
Kasuta tehisintellekti teksti asendamise tööriista
Teksti asendamise tööriist tuvastab pildil oleva teksti sinu eest, nii et pead sisestama ainult õige kirjapildi. Tööriistaga EditText.ai muudad pildil olevat teksti rida-realt ja iga rida joonistatakse uuesti algse kirja ja tausta ilmega. Ühe vale tähe või sõna puhul vaata, kuidas parandada pildil trükiviga. Ürituste kujunduste pealkirjade ja dekoratiivse kirja puhul vaata, kuidas muuta plakatil olevat teksti.


Enne ja pärast: moonutatud neoonsilt tehisintellekti pildil, parandatud, sisestades tööriistas EditText.ai sõna THEATER.
Tulemused võivad erineda, eriti ebatavalise kirja või detailse tausta korral. Kuna ka ümberjoonistamise teeb pildimudel, loe iga uut sõna täissuuruses täht-tähe haaval. Ka tekstituvastus võib moonutatud tähti valesti lugeda, seega veendu, et iga tuvastatud rida on see, mida tahtsid muuta.
Paranda käsitsi
Photoshopis, Photopeas või sarnases redaktoris eemaldad katkised tähed, taastad tausta ja kirjutad uue teksti fondiga. See annab sulle kõige rohkem kontrolli ning sobib trüki- või klienditööks, kuid nõuab oskusi ja aega. Tehisintellekti loodud kiri ei ole sageli päris font, seega ei pruugi fondituvastaja vastet leida. Loe kuidas pildi järgi fonti tuvastada, et leida lähedast asendust.
Valikut aitab teha lihtne reegel: kui kogu pilt on vale, genereeri see uuesti. Kui ainult sõnad on valed, paranda sõnad.
Muud võimalused
Saad ka eemaldada pildilt teksti täielikult ja lisada puhtale taustale päris kiri disainitööriistas, mis on hea lähenemine menüüde ja hinnakirjade puhul. Kui sõnastus on õige, saad tõlkida pildil olevat teksti, et teha versioone teistele keeltele.
Muuda ainult pilte, mis kuuluvad sulle või mida sul on luba muuta, ära eemalda vesimärke ega autorsusviiteid ning säilita kõik tehisintellekti piltide märgised, mida platvorm nõuab.
Paranda sõnad ja säilita pilt
Kui pilt on õige, kuid õigekiri vale, ei pea sa otsast alustama. Laadi see üles, et parandada teksti AI-piltidel tööriistaga EditText.ai, sisesta igale reale õiged sõnad ja kontrolli tulemust enne allalaadimist.
Korduma kippuvad küsimused
Miks tehisintellekt piltidel teksti rikub?
Tehisintellekti pildigeneraatorid joonistavad teksti kujudena, mitte ei kirjuta seda tähtedena, ning paljud loevad prompte sõnatükkidena, mitte üksikute märkidena. Tekst on ka väike detail rangete reeglitega, seega paistab üks vale joon silma. Treeningpiltidel on tekst sageli väike, hägune või nurga all, mis annab mudelitele vähem selgeid näiteid, millest õppida.
Miks tehisintellekt kirjutab päris sõnade asemel mõttetust?
Kui mudel pole kindel, kuidas sõna kirjutatakse, joonistab ta ikka tähtedega sarnaseid kujusid, sest just selline näeb tekst tema treeningpiltidel välja. Tulemuseks võivad olla tähelaadsed märgid, segatud tähestikud või väljamõeldud sõnad. See juhtub kõige sagedamini pika teksti, väikese kirja ja ebatavaliste sõnadega ning harvem jutumärkides lühikese fraasiga.
Milline tehisintellekti pildigeneraator on tekstiga kõige parem?
Püsivat vastust pole, sest mudelid muutuvad sageli ja iga uus versioon võib käituda teisiti. Üldiselt saavad hiljutised generaatorid lühikese ja suure tekstiga paremini hakkama kui vanemad. Kõige kasulikum test on sinu enda prompt: genereeri sama lühike fraas tööriistades, millele sul on ligipääs, ja kontrolli enne valimist õigekirja täht-tähe haaval.
Kas saan AI-pildil valesti kirjutatud teksti parandada ilma uuesti genereerimata?
Jah. Saad valida ala ja kirjeldada parandust samas generaatoris, kirjutada teksti käsitsi uuesti sellises redaktoris nagu Photoshop või Photopea või kasutada teksti asendamise tööriista, mis tuvastab sõnad, nii et saad sisestada õige kirjapildi. Olenemata sellest, millist meetodit kasutad, võrdle tulemust originaaliga, et märgata muudatusi teksti lähedal.
Miks fondituvastaja ei suuda mu AI-pildil kirja tuvastada?
Tehisintellekti generaatorid joonistavad kirja tavaliselt õpitud mustrite järgi, mitte paigaldatud fondifailist. Tähed võivad segada mitme kirjatüübi jooni või muuta kuju tähelt tähele. Fondituvastaja võib siiski soovitada sarnaseid fonte, mis aitab, kui plaanid teksti uuesti kirjutada, kuid täpne vaste sageli puudub.