DI vaizdų generatoriams sunkiai sekasi rašyba, nes jie piešia paveikslėlius, o ne tekstą. Jie išmoksta, kaip atrodo raidės: tai formos ir pikselių raštai, o žodžio niekada neįveda raidė po raidės, todėl nedidelė klaida gali „BAKERY“ paversti „BAKRERY“. Daugelis jų taip pat skaito jūsų užklausą žodžių dalimis, o ne pavienėmis raidėmis, todėl tiksli rašyba tampa dar sunkesnė.
Naujesni generatoriai trumpą tekstą tvarko daug geriau nei ankstyvieji, tačiau ilgos pastraipos, smulkios raidės, neįprasti vardai ir nelotyniško rašto kalbos vis dar sukelia klaidų. Jei jau turite vaizdą su sugadintais žodžiais, dažnai galite pataisyti tekstą DI sugeneruotuose vaizduose nepradėdami iš naujo. Šiame vadove paaiškinama, kodėl atsiranda klaidų, kaip rašyti užklausas, kad tekstas išeitų geresnis, ir kaip jį ištaisyti vėliau, nesvarbu, ar vaizdą sukūrė Midjourney, ChatGPT, Gemini, Stable Diffusion ar kitas generatorius.
Kaip DI vaizdų generatoriai sukuria paveikslėlį
Daugelis populiarių vaizdų generatorių naudoja metodą, vadinamą difuzijos modeliu. Modelis pradeda nuo atsitiktinio triukšmo, panašaus į ekrano „sniegą“, ir kiekviename iš daugelio žingsnių pašalina nedidelę to triukšmo dalį. Jūsų užklausa nukreipia kiekvieną žingsnį, todėl triukšmas pamažu virsta jūsų aprašymą atitinkančiu paveikslėliu. Visas vaizdas detalizuojamas kartu: dangus, veidai ir raidės formuojasi vienu metu.
Ne visi generatoriai veikia taip. Kai kurie vaizdą kuria kaip mažų dalių seką. Tačiau apskritai teksto į vaizdą modeliai turi vieną svarbią bendrą savybę: jie numato, kaip turėtų atrodyti paveikslėlis. Nėra žingsnio, kuriame modelis pasirinktų šriftą ir įvestų „B“, paskui „A“, paskui „K“. Raidės atsiranda tik kaip formos, kurios atrodo tinkamai, todėl jos gali išeiti beveik teisingos, bet ne visai.
Kodėl tekstas vaizdų generatoriams toks sunkus
Čia veikia kelios priežastys kartu. Kiekviena didina nedidelės klaidos tikimybę, o tekste nedideles klaidas lengva pastebėti.
Raidės – smulkios detalės su griežtomis taisyklėmis
Medis gali turėti bet kiek šakų ir vis tiek atrodyti kaip medis. Žodis turi tiksliai vieną teisingą rašybą. Tekstui taip pat galioja taisyklės, apimančios visą žodį: kiekviena raidė turi būti to paties stiliaus ir aukščio, tarpai turi būti vienodi, o raidės turi stovėti vienoje linijoje. Vienas papildomas brūkšnys, trūkstama ar dvigubai parašyta raidė akivaizdi bet kam, kas skaito tą kalbą, net kai likusi vaizdo dalis atrodo tikroviškai.
Modelis gali niekada nepamatyti jūsų įvestų raidžių
Prieš generatoriui panaudojant jūsų užklausą, komponentas, vadinamas teksto kodavimo moduliu, ją paverčia skaičiais. Daugelis teksto kodavimo modulių pirmiausia užklausą išskaido į žetonus (angl. tokens). Įprasti žodžiai dažnai tampa vienu žetonu, o retesni žodžiai skaidomi į kelias dalis. Plačiai naudojamas šių dalių sudarymo metodas yra baitų porų kodavimas. Šis būdas efektyvus, tačiau modelis gauna kiekvienos dalies ID, o ne joje esančias raides. Jis turi iš pavyzdžių išmokti, kad tam tikra dalis piešiama kaip tam tikra raidžių eilė.
Google Research straipsnis „Character-Aware Models Improve Visual Text Rendering“ tai tyrė tiesiogiai. Tyrėjai palygino teksto kodavimo modulius, kurie mato atskirus simbolius („character-aware“), su moduliais, kurie mato tik žodžių dalis („character-blind“). Vaizdų modeliai su simbolius matančiais moduliais vaizdinį tekstą atvaizdavo tiksliau, ypač gerai jiems sekėsi su retais žodžiais. Straipsnyje taip pat nustatyta, kad labai dideli simbolių nematantys kalbos modeliai gali išmokti gerai rašyti, tačiau šis gebėjimas nelabai persikėlė už anglų kalbos ribų ir pasirodė tik modeliuose, kur kas didesniuose už teksto kodavimo modulius, kuriuos tuo metu paprastai naudojo vaizdų generatoriai.
Mokymo vaizduose tekstas dažnai rodomas prastai
Generatoriai mokosi iš labai didelių vaizdų rinkinių su aprašymais. Tuose vaizduose tekstas dažnai mažas, neryškus, nukirptas, matomas kampu ar iš dalies paslėptas, be to, jis pasirodo labai įvairiais šriftais ir stiliais. Prie vaizdo pateiktas aprašymas gali apskritai neminėti jo teksto. Todėl modelis mato daug pavyzdžių, kaip apskritai atrodo tekstas, bet mažiau aiškių pavyzdžių, kaip tiksliai turi būti parašytas konkretus žodis.
Smulkus tekstas turi labai mažai pikselių
Antraštė gali užimti šimtus pikselių, o smulkaus šrifto žodyje vienai raidei gali tekti vos keli pikseliai. Daugelis generatorių taip pat dirba su suspausta vaizdo versija ir pilno dydžio paveikslėlį atkuria pabaigoje, todėl smulkioms detalėms lieka dar mažiau vietos. Smulkias linijas, pavyzdžiui, mažosios „e“ skersinę, lengva prarasti.
Kodėl naujesni modeliai tekstą rašo geriau
Vaizdų generatoriai daug geriau tvarko trumpas antraštes ir etiketes. Apskritai naujesnės sistemos naudoja galingesnius kalbos modelius užklausai suprasti, o kūrėjai mokymo metu tekstui skyrė daugiau dėmesio. Aukščiau aprašytas tyrimas rodo tą pačią kryptį: modeliai, gaunantys geresnę informaciją apie raides, tekstą piešia tiksliau.
Pagerėjimas realus, bet netolygus. Generatorius, kuris teisingai parašo trijų žodžių pavadinimą, vis dar gali susidurti su sunkumais rašydamas pastraipą, valgiaraštį ar etiketę kalba, kurią mokymo metu matė rečiau.
Kur DI vaizdų generatoriams vis dar sunku
- Ilgas tekstas. Pastraipos, valgiaraščiai ir sąrašai, kur kiekvienas papildomas žodis – dar viena klaidos galimybė
- Smulkus tekstas. Smulkus šriftas, etiketės ir scenoje toli esantis tekstas
- Neįprasti žodžiai. Vardai, išgalvoti žodžiai, nauji terminai ir ilgi skaičiai, pavyzdžiui, telefono numeriai ar kodai
- Nelotyniško rašto kalbos. Arabų, kinų, hindi, japonų, korėjiečių, tajų ir kitos rašto sistemos, taip pat raidės su diakritiniais ženklais
- Daug teksto blokų. Plakatai ir infografikai su keliomis atskiromis teksto dalimis
- Išlenkti ar pasvirę paviršiai. Tekstas ant butelio, vėliavos ar iš šono matomos iškabos
- Nuoseklumas. Vienodos formuluotės išlaikymas visoje vaizdų serijoje
Tai dažni dėsningumai, o ne griežtos taisyklės, ir jie skiriasi priklausomai nuo generatoriaus ir versijos.
Kaip gauti geresnį tekstą generuojant vaizdą
- Tikslius žodžius rašykite kabutėse. Pavyzdžiui, prašykite plakato su pavadinimu „NIGHT MARKET“, o ne plakato apie naktinį turgų.
- Rašykite trumpą tekstą. Kelis žodžius dideliu dydžiu lengviau parašyti teisingai nei visą sakinį. Ilgesnį tekstą verčiau perkelkite į aprašą ar tinklalapį.
- Nurodykite, kur turi būti tekstas. Aprašykite vietą ir dydį, pavyzdžiui, „didelis pavadinimas viršuje per visą plotį“ arba „maža etiketė ant stiklainio“.
- Prašykite paprastų raidžių. Riebias, švarias didžiąsias raides ant vienodos srities modeliui lengviau nupiešti nei dekoratyvią rašyseną ant margo fono.
- Sukurkite kelias versijas. Sugeneruokite keletą variantų, pasirinkite tą, kurio rašyba geriausia, ir ištaisykite tik tai, kas liko.
- Tikslų tekstą pridėkite vėliau, kai tai svarbu. Valgiaraščiui, kainoraščiui ar bet kam su smulkiu šriftu vaizdą sugeneruokite su laisva vieta, o tekstą užrašykite dizaino įrankyje. Taip formuluotė įvedama, o ne nupiešiama.
Kaip ištaisyti tekstą vėliau
Jei paveikslėlis tinkamas, bet žodžiai neteisingi, turite keturis pagrindinius variantus. Štai jie nuo mažiausių pastangų iki didžiausių.
| Būdas | Pastangos | Kas dar gali pasikeisti | Geriausiai tinka, kai |
|---|---|---|---|
| Sugeneruoti vaizdą iš naujo | Nedidelės | Viskas, nes gaunate naują paveikslėlį | Neteisingas visas vaizdas arba nesvarbu prarasti šią versiją |
| Pažymėti ir redaguoti generatoriuje | Nedidelės | Šalia esančios sritys taip pat gali būti perpieštos | Norite greito taisymo tame pačiame įrankyje |
| DI teksto keitimo įrankis | Nedidelės ar vidutinės | Teksto sritis perpiešiama, todėl patikrinkite rezultatą | Paveikslėlis tinkamas ir neteisingi tik žodžiai |
| Taisyti rankomis vaizdų redaktoriuje | Didelės | Tik tai, ką keičiate | Reikia visiško valdymo, pavyzdžiui, spaudai ar klientų darbams |
Sugeneruokite vaizdą iš naujo
Generuoti iš naujo reikia mažai pastangų, bet rezultatas atsitiktinis. Naujas bandymas gali ištaisyti žodį ir sugadinti ką nors kita, pavyzdžiui, veidą, ranką ar maketą. Naudokite, kai dar nesugaišote daug laiko būtent šiam vaizdui.
Pažymėkite ir redaguokite generatoriuje
Kai kurie generatoriai leidžia pažymėti sritį ir aprašyti pakeitimą. Pavyzdžiui, ChatGPT programoje galite pasirinkimo įrankiu pažymėti tekstą ir įvesti, ką jis turi sakyti. OpenAI pagalbos centras pažymi, kad pažymėta sritis ne visada tiksli, todėl gali pasikeisti ir šalia teksto esančios detalės. Išsamiau žr. ar ChatGPT gali redaguoti tekstą nuotraukoje.
Naudokite DI teksto keitimo įrankį
Teksto keitimo įrankis atpažįsta vaizde esantį tekstą už jus, todėl jums tereikia įvesti teisingą rašybą. Pavyzdžiui, su EditText.ai redaguojate tekstą nuotraukoje eilutė po eilutės, o kiekviena eilutė perpiešiama originalių raidžių ir fono stiliumi. Vienai klaidingai raidei ar žodžiui žr., kaip ištaisyti rašybos klaidą paveikslėlyje. Antraštėms ir dekoratyvinėms raidėms renginių dizainuose žr., kaip pakeisti tekstą plakate.


Prieš ir po: iškraipyta neoninė iškaba DI vaizde, ištaisyta EditText.ai įvedus THEATER.
Rezultatai gali skirtis, ypač kai raidės neįprastos ar fonas detalus. Kadangi perpiešimą taip pat atlieka vaizdų modelis, perskaitykite kiekvieną naują žodį raidė po raidės pilnu dydžiu. Bet kuris teksto atpažinimas taip pat gali neteisingai perskaityti iškraipytas raides, todėl įsitikinkite, kad kiekviena atpažinta eilutė yra ta, kurią norėjote pakeisti.
Taisykite rankomis
Photoshop, Photopea ar panašiame redaktoriuje pašalinate sugadintas raides, atkuriate foną ir užrašote naują tekstą šriftu. Tai suteikia daugiausia valdymo ir tinka spaudai ar klientų darbams, bet reikia įgūdžių ir laiko. DI raidės dažnai nėra tikras šriftas, todėl šriftų paieškos įrankis atitikmens gali nerasti. Skaitykite kaip atpažinti šriftą iš nuotraukos, kad sužinotumėte, kaip rasti artimą pakaitalą.
Paprasta taisyklė padeda pasirinkti: jei neteisingas visas vaizdas, sugeneruokite jį iš naujo. Jei neteisingi tik žodžiai, taisykite žodžius.
Kiti variantai
Taip pat galite visiškai pašalinti tekstą iš nuotraukos ir dizaino įrankyje ant švaraus fono užrašyti tikrą tekstą – tai geras būdas valgiaraščiams ir kainoraščiams. Kai formuluotė teisinga, galite išversti tekstą paveikslėlyje, kad sukurtumėte versijas kitomis kalbomis.
Redaguokite tik tuos vaizdus, kurie jums priklauso arba kuriuos turite leidimą keisti, nešalinkite vandens ženklų ar autorystės nuorodų ir palikite visus DI vaizdų žymėjimus, kurių reikalauja platforma.
Pataisykite žodžius ir palikite paveikslėlį
Jei vaizdas tinkamas, bet rašyba neteisinga, pradėti iš naujo nereikia. Įkelkite jį į EditText.ai, kad pataisytumėte tekstą DI vaizduose, įveskite teisingus kiekvienos eilutės žodžius ir prieš atsisiųsdami patikrinkite rezultatą.
Dažnai užduodami klausimai
Kodėl DI sugadina tekstą vaizduose?
DI vaizdų generatoriai tekstą piešia kaip formas, o ne įveda kaip raides, o daugelis užklausas skaito žodžių dalimis, o ne pavieniais simboliais. Tekstas taip pat yra smulki detalė su griežtomis taisyklėmis, todėl vienas klaidingas brūkšnys krenta į akis. Mokymo vaizduose tekstas dažnai mažas, neryškus ar matomas kampu, todėl modeliai turi mažiau aiškių pavyzdžių, iš kurių galėtų mokytis.
Kodėl DI rašo beprasmius žodžius vietoj tikrų?
Kai modelis nėra tikras, kaip rašomas žodis, jis vis tiek piešia raides primenančias formas, nes būtent taip tekstas atrodo jo mokymo vaizduose. Rezultatas gali būti raides primenantys ženklai, sumaišytos abėcėlės ar išgalvoti žodžiai. Dažniausiai taip nutinka su ilgu tekstu, smulkiomis raidėmis ir neįprastais žodžiais, o rečiau – su trumpa fraze kabutėse.
Kuris DI vaizdų generatorius geriausiai tvarko tekstą?
Nuolatinio atsakymo nėra, nes modeliai dažnai keičiasi, o kiekviena nauja versija gali elgtis kitaip. Apskritai naujesni generatoriai trumpą, stambų tekstą tvarko geriau nei senesni. Naudingiausias bandymas – jūsų pačių užklausa: sugeneruokite tą pačią trumpą frazę prieinamuose įrankiuose, tada prieš rinkdamiesi patikrinkite rašybą raidė po raidės.
Ar galiu ištaisyti klaidingą tekstą DI vaizde jo nesugeneruodamas iš naujo?
Taip. Galite pažymėti sritį ir aprašyti taisymą tame pačiame generatoriuje, perrašyti tekstą rankomis redaktoriuje, pavyzdžiui, Photoshop ar Photopea, arba naudoti teksto keitimo įrankį, kuris atpažįsta žodžius, kad galėtumėte įvesti teisingą rašybą. Kad ir kokį būdą pasirinktumėte, palyginkite rezultatą su originalu, kad pastebėtumėte pakeitimus šalia teksto.
Kodėl šriftų paieškos įrankis neatpažįsta raidžių mano DI vaizde?
DI generatoriai raides paprastai piešia pagal išmoktus raštus, o ne iš įdiegto šrifto failo. Raidės gali sumaišyti kelių šriftų bruožus arba keisti formą nuo vienos raidės prie kitos. Šrifto atpažinimo įrankis vis tiek gali pasiūlyti panašius šriftus, o tai padeda, jei planuojate perrašyti tekstą, tačiau tikslus atitikmuo dažnai neegzistuoja.