edittext.ai

Kāpēc MI attēlu ģeneratori nemāk uzrakstīt vārdus un kā to labot

Kāpēc MI attēlu ģeneratori nemāk uzrakstīt vārdus? Tie zīmē burtus kā formas, nevis tekstu. Uzziniet, kāpēc vārdi tiek sagrozīti un kā tos labot attēlos.

MI attēlu ģeneratoriem ar pareizrakstību klājas grūti, jo tie zīmē attēlus, nevis tekstu. Tie apgūst, kā burti izskatās formu un pikseļu rakstu veidā, un nekad neraksta vārdu pa vienam burtam, tāpēc neliela kļūme var pārvērst „BAKERY” par „BAKRERY”. Daudzi no tiem arī nolasa jūsu uzvedni vārdu daļās, nevis atsevišķos burtos, un tas padara precīzu pareizrakstību vēl grūtāku.

Jaunāki ģeneratori ar īsu tekstu tiek galā daudz labāk nekā agrīnie, taču gari fragmenti, mazi burti, neparasti vārdi un nelatīņu rakstības joprojām rada kļūdas. Ja jums jau ir attēls ar sabojātiem vārdiem, bieži varat labot tekstu MI ģenerētos attēlos, nesākot no jauna. Šajā pamācībā paskaidrots, kāpēc kļūdas rodas, kā uzvednē pieprasīt labāku tekstu un kā to vēlāk salabot neatkarīgi no tā, vai attēls radies Midjourney, ChatGPT, Gemini, Stable Diffusion vai citā ģeneratorā.

Kā MI attēlu ģeneratori izveido attēlu

Daudzi populāri attēlu ģeneratori izmanto metodi, ko sauc par difūzijas modeli. Modelis sāk ar nejaušu troksni, kas līdzīgs traucējumiem uz ekrāna, un katrā no daudziem soļiem noņem nelielu daļu šī trokšņa. Jūsu uzvedne vada katru soli, tāpēc troksnis pakāpeniski pārvēršas attēlā, kas atbilst jūsu aprakstam. Viss attēls tiek precizēts kopā: debesis, sejas un burti iegūst formu vienlaikus.

Ne visi ģeneratori darbojas šādi. Daži attēlu veido kā nelielu gabaliņu virkni. Taču kopumā modeļiem, kas ģenerē attēlus no teksta apraksta, ir viena svarīga kopīga iezīme: tie prognozē, kā jāizskatās attēlam. Nav soļa, kurā modelis izvēlas fontu un ieraksta „B”, tad „A”, tad „K”. Burti parādās tikai kā formas, kas izskatās pareizi, tāpēc tie var iznākt gandrīz pareizi, bet ne gluži.

Kāpēc teksts attēlu ģeneratoriem ir tik grūts

Vairāki iemesli darbojas kopā. Katrs no tiem palielina nelielas kļūdas iespējamību, un tekstā mazas kļūdas ir viegli pamanīt.

Burti ir sīkas detaļas ar stingriem noteikumiem

Kokam var būt jebkurš zaru skaits, un tas joprojām izskatīsies pēc koka. Vārdam ir tieši viena pareiza rakstība. Tekstam ir arī noteikumi, kas attiecas uz visu vārdu: katram burtam vajag vienādu stilu un augstumu, atstarpēm jābūt vienmērīgām, un burtiem jāatrodas uz vienas līnijas. Viens lieks triepiens, trūkstošs burts vai dubultots burts ir acīmredzams ikvienam, kas lasa valodu, pat ja pārējais attēls izskatās īsts.

Modelis var nekad neredzēt jūsu ierakstītos burtus

Pirms ģenerators var izmantot jūsu uzvedni, komponents, ko sauc par teksta kodētāju, pārvērš to skaitļos. Daudzi teksta kodētāji vispirms sadala uzvedni tokenos. Izplatīti vārdi bieži kļūst par vienu tokenu, bet retāki vārdi tiek sadalīti vairākos gabalos. Plaši izmantota metode šo gabalu veidošanai ir baitu pāru kodēšana (byte-pair encoding). Šī pieeja ir efektīva, taču modelis saņem katra gabala ID, nevis tajā esošos burtus. No piemēriem tam jāiemācās, ka noteikts gabals tiek zīmēts kā noteikta burtu virkne.

Google Research raksts Character-Aware Models Improve Visual Text Rendering to pētīja tieši. Pētnieki salīdzināja teksta kodētājus, kas redz atsevišķas rakstzīmes („character-aware”), ar kodētājiem, kas redz tikai vārdu daļas („character-blind”). Attēlu modeļi ar rakstzīmēm jutīgiem kodētājiem vizuālo tekstu atveidoja precīzāk, un tie bija īpaši spēcīgi ar retiem vārdiem. Rakstā arī konstatēts, ka ļoti lieli rakstzīmēm nejutīgi valodas modeļi var iemācīties labi rakstīt, taču šī spēja nepārgāja labi ārpus angļu valodas un parādījās tikai modeļos, kas ir daudz lielāki par teksta kodētājiem, ko attēlu ģeneratori tolaik parasti izmantoja.

Apmācības attēlos teksts bieži ir redzams slikti

Ģeneratori mācās no ļoti lielām attēlu kolekcijām ar pievienotiem aprakstiem. Šajos attēlos teksts bieži ir mazs, izplūdis, apgriezts, redzams leņķī vai daļēji aizsegts, un tas parādās milzīgā fontu un stilu daudzveidībā. Attēlam pievienotajā aprakstā tā teksts var nebūt minēts vispār. Tāpēc modelis redz daudz piemēru tam, kā teksts izskatās kopumā, bet mazāk skaidru piemēru tam, kā tieši jāraksta konkrēts vārds.

Mazam tekstam ir ļoti maz pikseļu

Virsraksts var aizņemt simtiem pikseļu, bet sīkās drukas vārds var iegūt tikai dažus pikseļus uz burtu. Daudzi ģeneratori strādā arī ar saspiestu attēla versiju un beigās atjauno pilna izmēra attēlu, un tas atstāj vēl mazāk vietas sīkām detaļām. Smalkas līnijas, piemēram, mazā burta „e” šķērssvītra, ir viegli pazaudēt.

Kāpēc jaunāki modeļi raksta labāku tekstu

Attēlu ģeneratori ir kļuvuši daudz labāki ar īsiem virsrakstiem un uzrakstiem. Kopumā jaunākās sistēmas izmanto spēcīgākus valodas modeļus, lai saprastu uzvedni, un izstrādātāji apmācības laikā ir pievērsuši tekstam lielāku uzmanību. Iepriekš minētais pētījums norāda tajā pašā virzienā: modeļi, kas saņem labāku informāciju par burtiem, tekstu zīmē precīzāk.

Uzlabojums ir īsts, bet nevienmērīgs. Ģenerators, kas pareizi uzraksta trīs vārdu virsrakstu, joprojām var nespēt tikt galā ar rindkopu, ēdienkarti vai uzrakstu valodā, ko apmācības laikā redzējis retāk.

Kur MI attēlu ģeneratoriem joprojām ir grūtības

  • Garš teksts. Rindkopas, ēdienkartes un saraksti, kur katrs papildu vārds ir vēl viena kļūdas iespēja
  • Mazs teksts. Sīkā druka, uzraksti un teksts tālu ainā
  • Neparasti vārdi. Personvārdi un nosaukumi, izdomāti vārdi, jauni termini un gari skaitļi, piemēram, tālruņa numuri vai kodi
  • Nelatīņu rakstības. Arābu, ķīniešu, hindi, japāņu, korejiešu, taju un citas rakstības sistēmas, kā arī burti ar diakritiskajām zīmēm
  • Daudz teksta bloku. Plakāti un infografikas ar vairākiem atsevišķiem teksta gabaliem
  • Izliektas vai slīpas virsmas. Teksts uz pudeles, karoga vai izkārtnes, ko redz no sāna
  • Konsekvence. Tā paša teksta identiska saglabāšana attēlu sērijā

Tās ir izplatītas likumsakarības, nevis stingri noteikumi, un tās atšķiras no viena ģeneratora un versijas uz nākamo.

Kā iegūt labāku tekstu, ģenerējot attēlu

  1. Ierakstiet precīzos vārdus pēdiņās. Piemēram, pieprasiet plakātu ar virsrakstu „NAKTS TIRGUS”, nevis plakātu par nakts tirgu.
  2. Saglabājiet tekstu īsu. Dažus vārdus lielā izmērā ir vieglāk uzrakstīt pareizi nekā pilnu teikumu. Garāku tekstu tā vietā ievietojiet parakstā vai tīmekļa lapā.
  3. Pasakiet, kur teksts atrodas. Aprakstiet novietojumu un izmēru, piemēram, „liels virsraksts pāri augšai” vai „maza etiķete uz burkas”.
  4. Pieprasiet vienkāršus burtus. Treknus, tīrus lielos burtus uz vienkārša laukuma modelim ir vieglāk uzzīmēt nekā dekoratīvu rokrakstu uz raiba fona.
  5. Izveidojiet vairākas versijas. Ģenerējiet dažus variantus, izvēlieties to ar vislabāko pareizrakstību un labojiet tikai atlikušo.
  6. Precīzo tekstu pievienojiet vēlāk, ja tas ir svarīgi. Ēdienkartei, cenrādim vai jebkam ar sīko druku ģenerējiet attēlu ar tukšu vietu un tekstu saliciet dizaina rīkā. Tādā veidā formulējums tiek ierakstīts, nevis uzzīmēts.

Kā labot tekstu pēc tam

Ja attēls ir pareizs, bet vārdi nav, jums ir četras galvenās iespējas. Tās ir sakārtotas no vismazākā līdz vislielākajam piepūles apjomam.

MetodePiepūleKas vēl var mainītiesVislabāk, ja
Ģenerēt attēlu no jaunaNelielaViss, jo iegūstat jaunu attēluViss attēls ir nepareizs vai jums nav žēl zaudēt šo versiju
Atlasīt un rediģēt ģeneratorāNelielaTuvumā esošie apgabali var tikt pārzīmēti arīVēlaties ātru labojumu tajā pašā rīkā
MI teksta aizstāšanas rīksNeliela līdz vidējaTeksta apgabals tiek pārzīmēts, tāpēc pārbaudiet rezultātuAttēls ir pareizs un nepareizi ir tikai vārdi
Labot ar roku attēlu redaktorāLielaTikai tas, ko mainatVajadzīga pilnīga kontrole, piemēram, drukai vai klientu darbam

Ģenerējiet attēlu no jauna

Atkārtota ģenerēšana prasa maz piepūles, taču rezultāts ir nejaušs. Jauns mēģinājums var salabot vārdu un sabojāt kaut ko citu, piemēram, seju, roku vai izkārtojumu. Izmantojiet to, ja uz tieši šo attēlu vēl neesat pavadījuši daudz laika.

Atlasiet un rediģējiet pašā ģeneratorā

Daži ģeneratori ļauj atzīmēt apgabalu un aprakstīt izmaiņu. Piemēram, ChatGPT varat ar atlases rīku iezīmēt tekstu un ierakstīt, kas tajā jāraksta. OpenAI palīdzības centrs norāda, ka iezīmējumi ne vienmēr ir precīzi, tāpēc var mainīties arī detaļas teksta tuvumā. Sīkāk skatiet rakstā vai ChatGPT var mainīt tekstu attēlā.

Izmantojiet MI teksta aizstāšanas rīku

Teksta aizstāšanas rīks atpazīst tekstu attēlā jūsu vietā, tāpēc jums jāieraksta tikai pareizā rakstība. Piemēram, ar EditText.ai jūs rediģējat tekstu attēlā rindu pa rindai, un katra rinda tiek pārzīmēta oriģinālo burtu un fona izskatā. Vienam nepareizam burtam vai vārdam skatiet, kā labot drukas kļūdu attēlā. Virsrakstiem un lieliem dekoratīviem burtiem pasākumu dizainos skatiet, kā mainīt tekstu plakātā.

Pirms: MI ģenerēta retro ilustrācija ar Ņujorkas ielu naktī un augstu sarkanu neona izkārtni, kurā rakstīts nesakarīgais uzraksts NEYAHRD
Pēc: tā pati ilustrācija ar sarkano neona izkārtni, kurā tagad rakstīts THEATER, bet pilsētas siluets, taksometri un virsraksts NEW YORK ir nemainīti

Pirms un pēc: sagrozīta neona izkārtne MI attēlā, izlabota, rīkā EditText.ai ierakstot THEATER.

Rezultāti var atšķirties, īpaši ar neparastiem burtiem vai detalizētiem foniem. Tā kā pārzīmēšanu veic arī attēlu modelis, izlasiet katru jauno vārdu burtu pa burtam pilnā izmērā. Jebkura teksta atpazīšana var arī nepareizi nolasīt sagrozītus burtus, tāpēc pārliecinieties, ka katra atpazītā rinda ir tā, ko vēlējāties mainīt.

Labojiet ar roku

Photoshop, Photopea vai līdzīgā redaktorā jūs noņemat sabojātos burtus, atjaunojat fonu un saliekat jaunu tekstu fontā. Tas dod vislielāko kontroli un der drukai vai klientu darbam, taču prasa prasmes un laiku. MI burti bieži nav īsts fonts, tāpēc fontu meklētājs var neatrast atbilstību. Izlasiet kā noteikt fontu pēc attēla, lai uzzinātu, kā atrast tuvu aizvietotāju.

Izvēlēties palīdz vienkāršs noteikums: ja nepareizs ir viss attēls, ģenerējiet to no jauna. Ja nepareizi ir tikai vārdi, labojiet vārdus.

Citas iespējas

Varat arī pilnībā noņemt tekstu no attēla un tīrajā fonā saliekt īstu tekstu dizaina rīkā — tā ir laba pieeja ēdienkartēm un cenrāžiem. Kad formulējums ir pareizs, varat tulkot tekstu attēlā, lai izveidotu versijas citām valodām.

Rediģējiet tikai tos attēlus, kas jums pieder vai kurus jums ir atļauts mainīt, nenoņemiet ūdenszīmes vai autoru norādes un saglabājiet visus MI attēlu marķējumus, ko prasa platforma.

Izlabojiet vārdus un saglabājiet attēlu

Ja attēls ir pareizs, bet rakstība nav, jums nav jāsāk no jauna. Augšupielādējiet to, lai ar EditText.ai labotu tekstu MI attēlos, ierakstiet pareizos vārdus katrai rindai un pirms lejupielādes pārbaudiet rezultātu.

Bieži uzdotie jautājumi

Kāpēc MI sabojā tekstu attēlos?

MI attēlu ģeneratori tekstu zīmē kā formas, nevis raksta kā burtus, un daudzi uzvednes nolasa vārdu daļās, nevis atsevišķās rakstzīmēs. Teksts ir arī sīka detaļa ar stingriem noteikumiem, tāpēc viens nepareizs triepiens krīt acīs. Apmācības attēlos teksts bieži ir mazs, izplūdis vai redzams leņķī, un tas dod modeļiem mazāk skaidru piemēru, no kuriem mācīties.

Kāpēc MI raksta nesakarīgu tekstu īstu vārdu vietā?

Ja modelis nav pārliecināts, kā vārds tiek rakstīts, tas tomēr zīmē formas, kas izskatās pēc burtiem, jo tieši tā apmācības attēlos izskatās teksts. Rezultāts var būt burtiem līdzīgas zīmes, sajaukti alfabēti vai izdomāti vārdi. Visbiežāk tas notiek ar garu tekstu, maziem burtiem un neparastiem vārdiem, bet retāk ar īsu frāzi pēdiņās.

Kurš MI attēlu ģenerators vislabāk tiek galā ar tekstu?

Pastāvīgas atbildes nav, jo modeļi mainās bieži un katra jauna versija var uzvesties citādi. Kopumā jaunākie ģeneratori ar īsu, lielu tekstu tiek galā labāk nekā vecāki. Visnoderīgākais tests ir jūsu pašu uzvedne: ģenerējiet vienu un to pašu īso frāzi rīkos, kam varat piekļūt, pēc tam pirms izvēles pārbaudiet pareizrakstību burtu pa burtam.

Vai varu labot kļūdaini uzrakstītu tekstu MI attēlā, neģenerējot to no jauna?

Jā. Varat atlasīt apgabalu un aprakstīt labojumu tajā pašā ģeneratorā, pārrakstīt tekstu ar roku redaktorā, piemēram, Photoshop vai Photopea, vai izmantot teksta aizstāšanas rīku, kas atpazīst vārdus, lai varētu ierakstīt pareizo rakstību. Neatkarīgi no izvēlētās metodes salīdziniet rezultātu ar oriģinālu, lai pamanītu izmaiņas teksta tuvumā.

Kāpēc fontu meklētājs nespēj noteikt burtus manā MI attēlā?

MI ģeneratori burtus parasti zīmē no apgūtiem paraugiem, nevis no instalēta fonta faila. Burti var sajaukt vairāku fontu iezīmes vai mainīt formu no viena burta uz nākamo. Fontu atpazīšanas rīks tomēr var ieteikt līdzīgus fontus, kas palīdz, ja plānojat tekstu pārrakstīt, taču precīza atbilstība bieži vien neeksistē.