Az MI-képgenerátoroknak azért okoz gondot a helyesírás, mert képeket rajzolnak, nem szöveget. Megtanulják, hogyan néznek ki a betűk alakzatokként és pixelmintákként, és soha nem gépelnek be egy szót betűről betűre, ezért egy apró botlás a „BAKERY” szóból „BAKRERY” szót csinálhat. Sokuk a promptodat is szótöredékekben olvassa, nem egyes betűkként, ami még nehezebbé teszi a pontos helyesírást.
Az újabb generátorok sokkal jobban kezelik a rövid szöveget, mint a korai változatok, de a hosszú szövegrészek, az apró betűk, a szokatlan nevek és a nem latin írásrendszerek még mindig hibákat okoznak. Ha már van egy képed törött szavakkal, gyakran anélkül is kijavíthatod a szöveget az MI-vel generált képeken, hogy elölről kezdenéd. Ez az útmutató elmagyarázza, miért keletkeznek a hibák, hogyan kérj jobb szöveget, és hogyan javítsd meg utólag, akár a Midjourney, a ChatGPT, a Gemini, a Stable Diffusion vagy más generátor készítette a képet.
Hogyan készítenek képet az MI-képgenerátorok
Sok népszerű képgenerátor a diffúziós modell nevű módszert használja. A modell a képernyő statikus zajához hasonló véletlenszerű zajjal indul, és a sok lépés mindegyikében eltávolít egy kicsit ebből a zajból. A promptod minden lépést irányít, így a zaj lassan a leírásodnak megfelelő képpé alakul. A teljes képet egyszerre finomítja a rendszer: az ég, az arcok és a betűk egyszerre öltenek alakot.
Nem minden generátor működik így. Egyesek a képet kis darabok sorozataként építik fel. De általában a szövegből képet generáló modellek egy fontos tulajdonságban megegyeznek: megjósolják, hogyan nézzen ki a kép. Nincs olyan lépés, amelyben a modell kiválaszt egy betűtípust, és beírja a „B”, majd az „A”, majd a „K” betűt. A betűk csak olyan alakzatokként jelennek meg, amelyek jónak látszanak, ezért lehetnek majdnem jók, de mégsem egészen.
Miért olyan nehéz a szöveg a képgenerátoroknak
Több ok hat együtt. Mindegyik valószínűbbé tesz egy kis hibát, a szöveg pedig olyan hely, ahol a kis hibák könnyen észrevehetők.
A betűk apró részletek szigorú szabályokkal
Egy fának akárhány ága lehet, és még mindig fának néz ki. Egy szónak pontosan egy helyes írásmódja van. A szövegnek az egész szóra vonatkozó szabályai is vannak: minden betűnek ugyanolyan stílusúnak és magasságúnak kell lennie, a térköznek egyenletesnek, a betűknek pedig ugyanazon a vonalon kell állniuk. Egy extra vonás, egy hiányzó betű vagy egy megduplázott betű mindenkinek szembetűnő, aki olvassa a nyelvet, még akkor is, ha a kép többi része valósághűnek tűnik.
A modell talán soha nem látja az általad beírt betűket
Mielőtt egy generátor felhasználhatná a promptodat, egy szövegkódolónak nevezett összetevő számokká alakítja. Sok szövegkódoló először tokenekre bontja a promptot. A gyakori szavakból gyakran egyetlen token lesz, a ritkább szavakat pedig több darabra törik. Ezeknek a szótöredékeknek az előállítására széles körben használt módszer a bájtpár-kódolás. A megközelítés hatékony, de a modell minden töredékhez egy azonosítót kap, nem pedig a benne lévő betűket. Példákból kell megtanulnia, hogy egy bizonyos töredéket egy bizonyos betűsorként kell megrajzolni.
Egy Google Research-tanulmány, a Character-Aware Models Improve Visual Text Rendering, közvetlenül ezt vizsgálta. A kutatók összehasonlították azokat a szövegkódolókat, amelyek az egyes karaktereket látják („character-aware”), azokkal, amelyek csak szótöredékeket látnak („character-blind”). A karaktereket is figyelembe vevő kódolókkal rendelkező képmodellek pontosabban jelenítették meg a vizuális szöveget, és különösen erősek voltak a ritka szavaknál. A tanulmány azt is megállapította, hogy a nagyon nagy, csak szótöredékeket látó nyelvmodellek megtanulhatnak helyesen írni, de ez a képesség az angolon kívüli nyelvekre nem terjedt át jól, és csak olyan modelleknél jelent meg, amelyek jóval nagyobbak voltak, mint a szövegkódolók, amelyeket a képgenerátorok akkoriban jellemzően használtak.
A tanítóképek gyakran rosszul mutatják a szöveget
A generátorok nagyon nagy, leírásokkal párosított képgyűjteményekből tanulnak. Ezeken a képeken a szöveg gyakran apró, elmosódott, levágott, szögből látott vagy részben takart, és rengeteg betűtípusban és stílusban jelenik meg. Előfordulhat, hogy a képhez tartozó leírás egyáltalán nem említi a benne lévő szöveget. A modell tehát sok példát lát arra, hogyan néz ki általában a szöveg, de kevesebb világos példát arra, hogyan kell pontosan leírni egy adott szót.
Az apró szövegnek nagyon kevés pixele van
Egy címsor több száz pixelen is elterülhet, míg egy apró betűs szó betűnként csak néhány pixelt kaphat. Sok generátor a kép tömörített változatán dolgozik, és a teljes méretű képet a végén építi újra, ami még kevesebb helyet hagy az apró részleteknek. A finom vonalak, például a kisbetűs „e” keresztvonala, könnyen elvesznek.
Miért írnak jobb szöveget az újabb modellek
A képgenerátorok sokkal jobbak lettek a rövid címsorokban és feliratokban. Általában az újabb rendszerek erősebb nyelvmodelleket használnak a prompt megértéséhez, a fejlesztők pedig több figyelmet fordítottak a szövegre a tanítás során. A fenti kutatás ugyanebbe az irányba mutat: azok a modellek rajzolják pontosabban a szöveget, amelyek jobb információt kapnak a betűkről.
A fejlődés valós, de egyenetlen. Egy generátor, amely helyesen ír egy háromszavas címet, még mindig küszködhet egy bekezdéssel, egy étlappal vagy egy olyan nyelvű felirattal, amelyet a tanítás során ritkábban látott.
Hol küszködnek még az MI-képgenerátorok
- Hosszú szöveg. Bekezdések, étlapok és listák, ahol minden további szó újabb esély a hibára
- Apró szöveg. Apró betűs rész, címkék és a jelenetben távol lévő szöveg
- Szokatlan szavak. Nevek, kitalált szavak, új kifejezések és hosszú számok, például telefonszámok vagy kódok
- Nem latin írásrendszerek. Arab, kínai, hindi, japán, koreai, thai és más írásrendszerek, valamint az ékezetes betűk
- Sok szövegblokk. Plakátok és infografikák több különálló szövegrésszel
- Íves vagy ferde felületek. Szöveg egy palackon, egy zászlón vagy oldalról látott táblán
- Következetesség. Ugyanazt a megfogalmazást változatlanul megjeleníteni egy képsorozat minden darabján
Ezek inkább gyakori minták, mint szigorú szabályok, és generátoronként és verziónként eltérnek.
Hogyan kapj jobb szöveget, amikor képet generálsz
- Tedd idézőjelbe a pontos szavakat. Például kérj egy plakátot „NIGHT MARKET” címmel, ne csupán egy éjszakai piacról szóló plakátot.
- Tartsd rövidnek a szöveget. Néhány szó nagy méretben könnyebben sikerül, mint egy teljes mondat. A hosszabb szöveget inkább tedd egy képaláírásba vagy egy weboldalra.
- Mondd meg, hová kerül a szöveg. Írd le az elhelyezést és a méretet, például „nagy cím a tetején végig” vagy „kis címke az üvegen”.
- Kérj egyszerű betűket. A félkövér, tiszta nagybetűket egy sima területen könnyebb megrajzolnia egy modellnek, mint a díszes írott betűket zsúfolt háttéren.
- Készíts több változatot. Generálj néhány lehetőséget, válaszd ki a legjobb helyesírásút, és csak azt javítsd, ami megmaradt.
- A pontos szöveget add hozzá később, ha számít. Étlaphoz, árlistához vagy bármihez, amiben apró betűs rész van, generáld a képet üres hellyel, és a szöveget szedd be egy dizájneszközben. Így a megfogalmazás begépelt szöveg lesz, nem megrajzolt.
Hogyan javítsd ki utólag a szöveget
Ha a kép jó, de a szavak rosszak, négy fő lehetőséged van. Íme a lehetőségek a legkisebb ráfordítástól a legnagyobbig haladva.
| Módszer | Ráfordítás | Mi változhat még | Mikor a legjobb |
|---|---|---|---|
| A kép újragenerálása | Alacsony | Minden, mert új képet kapsz | Az egész kép rossz, vagy nem baj, ha elveszik ez a változat |
| Kijelölés és szerkesztés a generátorban | Alacsony | A közeli területek is újrarajzolódhatnak | Gyors javítást szeretnél ugyanabban az eszközben |
| MI-alapú szövegcserélő eszköz | Alacsony vagy közepes | A szövegterület újrarajzolódik, ezért ellenőrizd az eredményt | A kép jó, és csak a szavak rosszak |
| Kézi javítás képszerkesztőben | Magas | Csak az, amit megváltoztatsz | Teljes kontrollra van szükséged, például nyomtatáshoz vagy ügyfélmunkához |
A kép újragenerálása
Az újragenerálás kevés munkával jár, de az eredmény véletlenszerű. Egy új próbálkozás kijavíthatja a szót, de elronthat valami mást, például egy arcot, egy kezet vagy az elrendezést. Akkor használd, ha még nem töltöttél sok időt ezzel a konkrét képpel.
Kijelölés és szerkesztés a generátoron belül
Egyes generátorok lehetővé teszik, hogy kijelölj egy területet, és leírj egy változtatást. A ChatGPT-ben például kijelölőeszközzel kiemelheted a szöveget, és beírhatod, mit mondjon. Az OpenAI súgóközpontja megjegyzi, hogy a kijelölések nem mindig pontosak, ezért a szöveg közelében lévő részletek is megváltozhatnak. Részletesebben lásd a tud-e a ChatGPT szöveget szerkeszteni képen cikket.
Használj MI-alapú szövegcserélő eszközt
Egy szövegcserélő eszköz helyetted ismeri fel a szöveget a képen, így neked csak a helyes írásmódot kell beírnod. Az EditText.ai használatakor például sorról sorra szerkesztheted a szöveget a képen, és minden sor az eredeti betűk és háttér megjelenésében rajzolódik újra. Egyetlen téves betű vagy szó esetén lásd az elírás javítása képen oldalt. Rendezvénygrafikák címsoraihoz és díszbetűs feliratokhoz lásd a szöveg módosítása plakáton oldalt.


Előtte és utána: egy torz neonfelirat egy MI-képen, kijavítva a THEATER szó beírásával az EditText.ai felületén.
Az eredmények eltérhetnek, főleg szokatlan betűk vagy részletgazdag hátterek esetén. Mivel az újrarajzolást is egy képmodell végzi, minden új szót olvass el betűről betűre, teljes méretben. A szövegfelismerés a torz betűket is félreolvashatja, ezért ellenőrizd, hogy minden felismert sor az-e, amelyet módosítani szerettél volna.
Javítás kézzel
Photoshop, Photopea vagy hasonló szerkesztő használatával eltávolítod a törött betűket, újraépíted a hátteret, és új szöveget szedsz be egy betűtípussal. Ez adja a legtöbb kontrollt, és nyomtatáshoz vagy ügyfélmunkához való, de tudást és időt igényel. Az MI-betűk gyakran nem valódi betűtípusok, ezért előfordulhat, hogy egy betűtípus-kereső nem talál egyezést. Olvasd el a betűtípus felismerése képről útmutatót, ha közeli helyettesítőt keresel.
Egy egyszerű szabály segít a választásban: ha az egész kép rossz, generáld újra. Ha csak a szavak rosszak, a szavakat javítsd.
Egyéb lehetőségek
A szöveg eltávolítása képről teljes eltüntetést is jelenthet: a tiszta háttérre valódi szöveget szedhetsz be egy dizájneszközben, ami jó megoldás étlapokhoz és árlistákhoz. Ha a megfogalmazás már helyes, a szöveg fordítása képen segítségével elkészítheted a változatokat más nyelvekre.
Csak olyan képet szerkessz, amely a tiéd, vagy amelynek módosítására engedélyed van, ne távolítsd el a vízjeleket és a szerzői megjelöléseket, és hagyd meg az MI-képek azon jelöléseit, amelyeket egy platform megkövetel.
Javítsd a szavakat, és tartsd meg a képet
Ha a kép jó, de a helyesírás rossz, nem kell elölről kezdened. Töltsd fel az EditText.ai oldalán a szöveg javítása MI-vel generált képen funkcióhoz, írd be a helyes szavakat minden sorhoz, és a letöltés előtt ellenőrizd az eredményt.
Gyakran ismételt kérdések
Miért rontja el az MI a szöveget a képeken?
Az MI-képgenerátorok alakzatokként rajzolják meg a szöveget, nem betűkként gépelik be, és sokan a promptokat szótöredékekben olvassák, nem egyes karakterekként. A szöveg emellett kis részlet szigorú szabályokkal, ezért egyetlen téves vonás is feltűnik. A tanítóképeken a szöveg gyakran apró, elmosódott vagy szögből látott, ami kevesebb világos példát ad a modelleknek a tanuláshoz.
Miért ír az MI értelmetlen szöveget valódi szavak helyett?
Amikor egy modell nem biztos abban, hogyan kell írni egy szót, akkor is betűszerű alakzatokat rajzol, mert a tanítóképein így néz ki a szöveg. Az eredmény lehet betűszerű jel, kevert ábécé vagy kitalált szó. Leggyakrabban hosszú szövegnél, apró betűknél és szokatlan szavaknál fordul elő, ritkábban egy idézőjelbe tett rövid kifejezésnél.
Melyik MI-képgenerátor a legjobb a szövegben?
Nincs végleges válasz, mert a modellek gyakran változnak, és minden új verzió másképp viselkedhet. Általában a legújabb generátorok jobban kezelik a rövid, nagy szöveget, mint a régebbiek. A leghasznosabb teszt a saját promptod: generáld ugyanazt a rövid kifejezést az elérhető eszközökben, majd a választás előtt ellenőrizd betűről betűre a helyesírást.
Kijavíthatom az elírt szöveget egy MI-képen újragenerálás nélkül?
Igen. Kijelölheted a területet, és ugyanabban a generátorban leírhatod a javítást, kézzel újragépelheted a szöveget egy olyan szerkesztőben, mint a Photoshop vagy a Photopea, vagy használhatsz olyan szövegcserélő eszközt, amely felismeri a szavakat, így beírhatod a helyes írásmódot. Bármelyik módszert használod, hasonlítsd össze az eredményt az eredetivel, hogy észrevedd a szöveg közelében bekövetkezett változásokat.
Miért nem tudja a betűtípus-kereső azonosítani az MI-képem betűit?
Az MI-generátorok a betűket általában a megtanult minták alapján rajzolják meg, nem egy telepített betűtípusfájlból. A betűk több betűtípus jellemzőit keverhetik, vagy betűről betűre megváltoztathatják az alakjukat. Egy betűtípus-azonosító még így is javasolhat hasonló betűtípusokat, ami segít, ha újra szeretnéd gépelni a szöveget, de pontos egyezés gyakran nem létezik.