AI генераторите на изображения се затрудняват с правописа, защото рисуват картини, а не текст. Те се учат как изглеждат буквите като форми и шарки от пиксели и никога не пишат дума буква по буква, затова малка грешка може да превърне „BAKERY“ в „BAKRERY“. Много от тях четат и промпта ви на части от думи, а не на отделни букви, което затруднява още повече точния правопис.
По-новите генератори се справят с краткия текст много по-добре от първите, но дългите пасажи, дребните букви, необичайните имена и нелатинските писмености все още водят до грешки. Ако вече имате изображение с развалени думи, често можете да поправите текста в изображения, генерирани от AI, без да започвате отначало. Това ръководство обяснява защо се появяват грешките, как да формулирате промпта за по-добър текст и как да го поправите след това, независимо дали изображението идва от Midjourney, ChatGPT, Gemini, Stable Diffusion или друг генератор.
Как AI генераторите на изображения създават картина
Много популярни генератори на изображения използват метод, наречен дифузионен модел. Моделът започва със случаен шум, подобен на статичните смущения на екран, и на всяка от множество стъпки премахва малко от този шум. Промптът ви води всяка стъпка, така че шумът бавно се превръща в картина, която отговаря на описанието ви. Цялото изображение се доизпипва заедно: небето, лицата и буквите придобиват форма едновременно.
Не всеки генератор работи по този начин. Някои изграждат изображението като последователност от малки части. Но като цяло моделите за генериране на изображения по текст имат една важна обща черта: предвиждат как трябва да изглежда картината. Няма стъпка, в която моделът избира шрифт и изписва „B“, после „A“, после „K“. Буквите се появяват само като форми, които изглеждат правилно, затова могат да излязат почти правилни, но не съвсем.
Защо текстът е толкова труден за генераторите на изображения
Няколко причини действат заедно. Всяка от тях прави малката грешка по-вероятна, а текстът е място, където малките грешки лесно се виждат.
Буквите са малки детайли със строги правила
Едно дърво може да има произволен брой клони и пак да изглежда като дърво. Една дума има точно един правилен правопис. Текстът има и правила, които важат за цялата дума: всяка буква трябва да е в същия стил и с една и съща височина, разстоянията трябва да са равни, а буквите трябва да стоят на една линия. Един излишен щрих, липсваща или удвоена буква правят впечатление на всеки, който чете езика, дори когато останалата част от изображението изглежда реалистична.
Моделът може никога да не види буквите, които сте въвели
Преди генераторът да може да използва промпта ви, компонент, наречен текстов енкодер, го превръща в числа. Много текстови енкодери първо разделят промпта на токени. Често срещаните думи обикновено стават един токен, а по-редките се разбиват на няколко части. Широко използван метод за създаване на тези части е byte-pair encoding. Подходът е ефективен, но моделът получава идентификатор за всяка част, а не буквите в нея. Той трябва да научи от примери, че определена част се рисува като определен ред букви.
Статия на Google Research, Character-Aware Models Improve Visual Text Rendering, изследва това директно. Изследователите сравняват текстови енкодери, които виждат отделни знаци („character-aware“), с енкодери, които виждат само части от думи („character-blind“). Моделите за изображения с енкодери, осведомени за знаците, изобразяват визуалния текст по-точно и са особено силни при редки думи. Статията установява също, че много големи езикови модели, които не виждат знаците, могат да се научат да изписват добре, но тази способност не се пренася добре извън английския и се проявява само в модели, далеч по-големи от текстовите енкодери, които генераторите на изображения обикновено са използвали по онова време.
Обучаващите изображения често показват текста лошо
Генераторите се учат от много големи колекции от изображения, съчетани с описания. В тези изображения текстът често е дребен, размазан, отрязан, видян под ъгъл или частично скрит и се появява в огромно разнообразие от шрифтове и стилове. Описанието, съчетано с изображението, може изобщо да не споменава текста му. Така моделът вижда много примери за това как изглежда текстът изобщо, но по-малко ясни примери за това как точно трябва да се изписва конкретна дума.
Дребният текст има много малко пиксели
Едно заглавие може да заема стотици пиксели, докато дума от ситния шрифт може да получи само няколко пиксела на буква. Много генератори работят и върху компресирана версия на изображението и възстановяват картината в пълен размер накрая, което оставя още по-малко място за дребните детайли. Тънките линии, като чертата на малкото „e“, лесно се губят.
Защо по-новите модели пишат по-добър текст
Генераторите на изображения са станали много по-добри в къси заглавия и етикети. Като цяло по-новите системи използват по-силни езикови модели, за да разбират промпта, а разработчиците са обърнали повече внимание на текста при обучението. Изследването по-горе сочи в същата посока: моделите, които получават по-добра информация за буквите, рисуват текста по-точно.
Подобрението е реално, но неравномерно. Генератор, който изписва правилно заглавие от три думи, може все пак да се затруднява с абзац, меню или етикет на език, който е виждал по-рядко по време на обучението.
Къде AI генераторите на изображения все още се затрудняват
- Дълъг текст. Абзаци, менюта и списъци, където всяка допълнителна дума е още един шанс за грешка
- Дребен текст. Ситен шрифт, етикети и текст, който е далеч в сцената
- Необичайни думи. Имена, измислени думи, нови термини и дълги числа като телефонни номера или кодове
- Нелатински писмености. Арабска, китайска, хинди, японска, корейска, тайландска и други системи за писане, както и букви с диакритични знаци
- Много текстови блокове. Плакати и инфографики с няколко отделни части текст
- Извити или наклонени повърхности. Текст върху бутилка, знаме или табела, гледана отстрани
- Последователност. Запазване на еднакъв текст в цяла серия от изображения
Това са често срещани закономерности, а не твърди правила, и те варират от един генератор и версия до друг.
Как да получите по-добър текст, когато генерирате изображение
- Поставете точните думи в кавички. Например поискайте плакат със заглавие „НОЩЕН ПАЗАР“, а не плакат за нощен пазар.
- Дръжте текста кратък. Няколко думи с голям размер са по-лесни за изписване правилно от цяло изречение. Добавете по-дългия текст в подпис или на уеб страница.
- Кажете къде отива текстът. Опишете разположението и размера, например „голямо заглавие по цялата ширина най-горе“ или „малък етикет на буркана“.
- Поискайте прости букви. Удебелени, чисти главни букви върху обикновена област са по-лесни за рисуване от модела, отколкото декоративен ръкописен шрифт върху претрупан фон.
- Направете няколко версии. Генерирайте няколко варианта, изберете този с най-добър правопис и поправете само останалото.
- Добавете точния текст по-късно, когато има значение. За меню, ценоразпис или всичко със ситен шрифт генерирайте изображението с празно място и поставете текста в инструмент за дизайн. Така текстът е написан, а не нарисуван.
Как да поправите текста след това
Ако картината е наред, но думите са грешни, имате четири основни възможности. Ето ги от най-малко усилие до най-много.
| Метод | Усилие | Какво още може да се промени | Най-подходящ, когато |
|---|---|---|---|
| Генериране на изображението наново | Малко | Всичко, защото получавате нова картина | Цялото изображение е грешно или не ви пречи да загубите тази версия |
| Избор и редактиране в генератора | Малко | Близките области също могат да бъдат прерисувани | Искате бърза поправка в същия инструмент |
| Инструмент за AI замяна на текст | Малко до средно | Областта на текста се прерисува, затова проверете резултата | Картината е наред и само думите са грешни |
| Ръчна поправка в редактор на изображения | Много | Само онова, което променяте | Нужен ви е пълен контрол, например за печат или клиентска работа |
Генерирайте изображението наново
Генерирането наново изисква малко усилие, но резултатът е случаен. Нов опит може да поправи думата и да развали нещо друго, като лице, ръка или оформлението. Използвайте го, когато още не сте вложили много време в това конкретно изображение.
Изберете и редактирайте в самия генератор
Някои генератори ви позволяват да маркирате област и да опишете промяна. В ChatGPT например можете да маркирате текста с инструмент за избор и да напишете какво трябва да гласи. Помощният център на OpenAI отбелязва, че маркираните области не винаги са точни, така че и детайлите близо до текста могат да се променят. За по-подробен поглед вижте може ли ChatGPT да редактира текст в снимка.
Използвайте инструмент за AI замяна на текст
Инструментът за замяна на текст разпознава текста в изображението вместо вас, така че въвеждате само правилния правопис. С EditText.ai например редактирате текст в снимка ред по ред, а всеки ред се прерисува във вида на оригиналните букви и фона. За една грешна буква или дума вижте как да поправите печатна грешка в снимка. За заглавия и декоративни надписи в дизайни за събития вижте как да промените текста на плакат.


Преди и след: изкривена неонова табела в AI изображение, поправена чрез въвеждане на THEATER в EditText.ai.
Резултатите могат да се различават, особено при необичайни букви или детайлни фонове. Тъй като прерисуването също се извършва от модел за изображения, прочетете всяка нова дума буква по буква в пълен размер. Разпознаването на текст също може да прочете погрешно изкривени букви, затова се уверете, че всеки разпознат ред е този, който сте искали да промените.
Поправете го на ръка
Във Photoshop, Photopea или подобен редактор премахвате развалените букви, възстановявате фона и поставяте нов текст с шрифт. Това ви дава най-голям контрол и е подходящо за печат или клиентска работа, но изисква умения и време. Буквите от AI често не са истински шрифт, така че инструмент за търсене на шрифтове може да не намери съвпадение. Прочетете как да разпознаете шрифт от снимка, за да научите как да намерите близка замяна.
Едно просто правило помага при избора: ако цялото изображение е грешно, генерирайте го наново. Ако само думите са грешни, поправете думите.
Други възможности
Можете и изцяло да премахнете текста от снимката и да поставите истински текст върху чистия фон в инструмент за дизайн — добър подход за менюта и ценоразписи. След като текстът е правилен, можете да преведете текст от снимка, за да направите версии на други езици.
Редактирайте само изображения, които притежавате или имате разрешение да променяте, не премахвайте водни знаци или посочване на автора и запазвайте всички етикети за AI изображения, които дадена платформа изисква.
Поправете думите и запазете картината
Ако изображението е наред, но правописът е грешен, не е нужно да започвате отначало. Качете го, за да поправите текста в AI изображения с EditText.ai, въведете правилните думи за всеки ред и проверете резултата, преди да го изтеглите.
Често задавани въпроси
Защо AI бърка текста в изображенията?
AI генераторите на изображения рисуват текста като форми, вместо да го изписват като букви, и много от тях четат промптовете на части от думи, а не на отделни знаци. Текстът е и дребен детайл със строги правила, затова един грешен щрих прави впечатление. Обучаващите изображения често показват текст, който е дребен, размазан или под ъгъл, което дава на моделите по-малко ясни примери, от които да се учат.
Защо AI пише безсмислици вместо истински думи?
Когато моделът не е сигурен как се изписва дадена дума, той пак рисува форми, които приличат на букви, защото така изглежда текстът в обучаващите му изображения. Резултатът може да са знаци, подобни на букви, смесени азбуки или измислени думи. Случва се най-често при дълъг текст, дребни букви и необичайни думи, а по-рядко при къса фраза в кавички.
Кой AI генератор на изображения е най-добър в текста?
Няма постоянен отговор, защото моделите се променят често и всяка нова версия може да се държи различно. Като цяло скорошните генератори се справят по-добре с къс, едър текст от по-старите. Най-полезният тест е собственият ви промпт: генерирайте една и съща къса фраза в инструментите, до които имате достъп, после проверете правописа буква по буква, преди да изберете един.
Мога ли да поправя грешен правопис в AI изображение, без да го генерирам наново?
Да. Можете да изберете областта и да опишете поправката в същия генератор, да напишете текста наново на ръка в редактор като Photoshop или Photopea или да използвате инструмент за замяна на текст, който разпознава думите, за да въведете правилния правопис. Който и метод да използвате, сравнете резултата с оригинала, за да забележите промените близо до текста.
Защо инструмент за търсене на шрифтове не разпознава буквите в моето AI изображение?
AI генераторите обикновено рисуват буквите по научени шарки, а не от инсталиран файл с шрифт. Буквите могат да смесват черти от няколко гарнитури или да променят формата си от буква на буква. Инструмент за разпознаване на шрифтове може все пак да предложи подобни шрифтове, което помага, ако планирате да напишете текста наново, но точно съвпадение често не съществува.