edittext.ai

Чому ШІ не вміє писати текст на зображеннях і як це виправити

Чому генератори зображень на основі ШІ пишуть із помилками? Вони малюють літери як форми, а не текст. Що спричиняє спотворені слова й як їх виправити.

Генератори зображень на основі ШІ погано справляються з правописом, бо вони малюють картинки, а не текст. Вони вчаться тому, як виглядають літери — як форми й візерунки з пікселів, — і ніколи не набирають слово по одній літері, тому дрібна помилка може перетворити «BAKERY» на «BAKRERY». Багато з них також читають ваш запит шматками слів, а не окремими літерами, через що точне написання дається ще важче.

Новіші генератори значно краще справляються з коротким текстом, ніж ранні версії, але довгі уривки, дрібні написи, незвичні імена та нелатинські писемності досі спричиняють помилки. Якщо у вас уже є зображення зі зламаними словами, часто можна виправити текст на зображенні, створеному ШІ, не починаючи спочатку. У цьому посібнику пояснено, чому виникають помилки, як складати запит, щоб текст вийшов кращим, і як виправити його згодом, незалежно від того, чи зображення створили в Midjourney, ChatGPT, Gemini, Stable Diffusion чи іншому генераторі.

Як генератори зображень на основі ШІ створюють картинку

Багато популярних генераторів зображень використовують метод, який називається дифузійною моделлю. Модель починає з випадкового шуму, схожого на завади на екрані, і на кожному з багатьох кроків прибирає трохи цього шуму. Ваш запит спрямовує кожен крок, тож шум поступово перетворюється на картинку, що відповідає вашому опису. Усе зображення уточнюється разом: небо, обличчя й написи набувають форми одночасно.

Не кожен генератор працює так. Деякі натомість будують зображення як послідовність дрібних частин. Але загалом моделі перетворення тексту в зображення мають одну важливу спільну рису: вони передбачають, як має виглядати картинка. Немає кроку, де модель вибирає шрифт і набирає «B», потім «A», потім «K». Літери з’являються лише як форми, що виглядають правильно, тому вони можуть вийти майже правильними, але не зовсім.

Чому текст так важко дається генераторам зображень

Тут діє кілька причин одразу. Кожна з них підвищує ймовірність дрібної помилки, а в тексті дрібні помилки легко помітити.

Літери — це дрібні деталі з суворими правилами

Дерево може мати будь-яку кількість гілок і все одно виглядатиме як дерево. Слово має рівно одне правильне написання. Текст також підпорядковується правилам, що діють для всього слова: кожна літера потребує однакового стилю та висоти, інтервали мають бути рівними, а літери — стояти на одній лінії. Зайвий штрих, пропущена чи подвоєна літера помітні кожному, хто читає цією мовою, навіть коли решта зображення виглядає реалістично.

Модель може ніколи не бачити літер, які ви ввели

Перш ніж генератор зможе використати ваш запит, компонент, який називається кодувальником тексту, перетворює його на числа. Багато кодувальників тексту спершу розбивають запит на токени. Поширені слова часто стають одним токеном, а рідші розбиваються на кілька частин. Широко використаний метод побудови таких частин — byte-pair encoding. Цей підхід ефективний, але модель отримує ідентифікатор кожної частини, а не літери всередині неї. Вона має вчитися на прикладах, що певна частина малюється як певний ряд літер.

У статті Google Research Character-Aware Models Improve Visual Text Rendering це вивчали безпосередньо. Дослідники порівняли кодувальники тексту, які бачать окремі символи («character-aware»), з кодувальниками, що бачать лише частини слів («character-blind»). Моделі зображень із кодувальниками, що враховують символи, точніше відображали візуальний текст, а особливо добре справлялися з рідкісними словами. У статті також виявили, що дуже великі мовні моделі, які не бачать символів, можуть навчитися добре писати, але ця здатність погано переносилася за межі англійської й проявлялася лише в моделях, значно більших за кодувальники тексту, які зазвичай використовували тоді генератори зображень.

Навчальні зображення часто погано показують текст

Генератори вчаться на дуже великих колекціях зображень з описами. На цих зображеннях текст часто дрібний, розмитий, обрізаний, бачений під кутом або частково прихований, до того ж набраний найрізноманітнішими шрифтами й стилями. В описі до зображення про його текст може взагалі не йтися. Тож модель бачить багато прикладів того, як текст виглядає загалом, але менше чітких прикладів того, як саме слід писати конкретне слово.

У дрібного тексту дуже мало пікселів

Заголовок може займати сотні пікселів, а слово дрібним шрифтом — лише кілька пікселів на літеру. Багато генераторів також працюють зі стисненою версією зображення, а в кінці відновлюють картинку повного розміру, що залишає ще менше місця для дрібних деталей. Тонкі лінії, як-от перекладинка в малій літері «e», легко губляться.

Чому новіші моделі пишуть текст краще

Генератори зображень стали значно кращими в коротких заголовках і підписах. Загалом новіші системи використовують потужніші мовні моделі, щоб розуміти запит, а розробники приділяють тексту більше уваги під час навчання. Наведене вище дослідження вказує в тому самому напрямку: моделі, які отримують краще уявлення про літери, малюють текст точніше.

Покращення справжнє, але нерівномірне. Генератор, який правильно пише заголовок із трьох слів, усе ще може не впоратися з абзацом, меню чи підписом мовою, яку він рідше бачив під час навчання.

Де генератори зображень на основі ШІ досі помиляються

  • Довгий текст. Абзаци, меню та списки, де кожне додаткове слово — ще один шанс на помилку
  • Дрібний текст. Дрібний шрифт, підписи й текст, що розташований далеко в кадрі
  • Незвичні слова. Імена, вигадані слова, нові терміни та довгі числа, як-от номери телефонів чи коди
  • Нелатинські писемності. Арабська, китайська, гінді, японська, корейська, тайська та інші системи письма, а також літери з діакритичними знаками
  • Багато текстових блоків. Постери та інфографіка з кількома окремими фрагментами тексту
  • Вигнуті або похилі поверхні. Текст на пляшці, прапорі чи вивісці, яку видно збоку
  • Послідовність. Збереження однакового формулювання в серії зображень

Це радше типові закономірності, ніж жорсткі правила, і вони різняться залежно від генератора та версії.

Як отримати кращий текст під час створення зображення

  1. Візьміть точні слова в лапки. Наприклад, попросіть постер із заголовком «NIGHT MARKET», а не постер про нічний ринок.
  2. Тримайте текст коротким. Кілька слів великого розміру легше зробити правильно, ніж повне речення. Довший текст натомість розмістіть у підписі чи на вебсторінці.
  3. Скажіть, де розташований текст. Опишіть розташування й розмір, наприклад «великий заголовок угорі» чи «маленька етикетка на банці».
  4. Попросіть прості літери. Жирні чіткі великі літери на однотонній ділянці моделі малювати легше, ніж декоративний рукописний шрифт на складному фоні.
  5. Створіть кілька версій. Згенеруйте кілька варіантів, виберіть той, де найкращий правопис, і виправте лише те, що залишилося.
  6. Додавайте точний текст пізніше, коли це важливо. Для меню, прайс-листа чи будь-чого з дрібним шрифтом згенеруйте зображення з порожнім місцем і наберіть текст у дизайнерському інструменті. Так формулювання буде набрано, а не намальовано.

Як виправити текст згодом

Якщо картинка правильна, а слова — ні, у вас є чотири основні варіанти. Ось вони — від найменш трудомісткого до найбільш трудомісткого.

СпосібЗусилляЩо ще може змінитисяНайкраще підходить, коли
Згенерувати зображення зновуНевеликіУсе, бо ви отримуєте нову картинкуУсе зображення неправильне або вам не шкода втратити цю версію
Виділити й відредагувати в генераторіНевеликіСусідні ділянки теж можуть бути перемальованіВам потрібне швидке виправлення в тому самому інструменті
Інструмент заміни тексту за допомогою ШІВід невеликих до середніхДілянка тексту перемальовується, тож перевірте результатКартинка правильна, а неправильні лише слова
Виправити вручну в редакторі зображеньВеликіЛише те, що ви змінюєтеПотрібен повний контроль, наприклад для друку чи клієнтської роботи

Згенерувати зображення знову

Повторна генерація потребує небагато зусиль, але результат випадковий. Нова спроба може виправити слово й зіпсувати щось інше, як-от обличчя, руку чи компонування. Використовуйте її, коли ви ще не витратили багато часу на це конкретне зображення.

Виділити й відредагувати всередині генератора

Деякі генератори дають змогу позначити ділянку й описати зміну. Наприклад, у ChatGPT можна виділити текст інструментом виділення й ввести, що там має бути написано. У довідковому центрі OpenAI зазначено, що виділення не завжди точні, тож деталі поруч із текстом також можуть змінитися. Докладніше — у статті чи може ChatGPT змінити текст на зображенні.

Скористатися інструментом заміни тексту за допомогою ШІ

Інструмент заміни тексту сам розпізнає текст на зображенні, тож вам потрібно лише ввести правильне написання. Наприклад, в EditText.ai ви змінюєте текст на картинці рядок за рядком, а кожен рядок перемальовується так, щоб виглядати як оригінальні написи й фон. Про одну неправильну літеру чи слово читайте, як виправити одруківку на зображенні. Про заголовки й декоративні написи в оформленні заходів читайте, як змінити текст на постері чи флаєрі.

До: створена ШІ ретро-ілюстрація нічної вулиці Нью-Йорка з високою червоною неоновою вивіскою, на якій написана нісенітниця NEYAHRD
Після: та сама ілюстрація, де червона неонова вивіска тепер читається як THEATER, а силует міста, таксі й заголовок NEW YORK без змін

До й після: спотворена неонова вивіска на зображенні від ШІ, виправлена введенням THEATER в EditText.ai.

Результати можуть різнитися, особливо з незвичними написами чи деталізованим фоном. Оскільки перемальовування також виконує модель зображень, читайте кожне нове слово літера за літерою в повному розмірі. До того ж будь-яке розпізнавання тексту може неправильно прочитати спотворені літери, тож переконайтеся, що кожен розпізнаний рядок — саме той, який ви збиралися змінити.

Виправити вручну

У Photoshop, Photopea чи подібному редакторі ви видаляєте зламані літери, відновлюєте фон і набираєте новий текст шрифтом. Це дає найбільший контроль і підходить для друку чи клієнтської роботи, але потребує навичок і часу. Написи від ШІ часто не є справжнім шрифтом, тож інструмент для пошуку шрифтів може не знайти збігу. Прочитайте, як визначити шрифт на картинці, щоб знайти способи підібрати близький замінник.

Просте правило допоможе вибрати: якщо неправильне все зображення, згенеруйте його знову. Якщо неправильні лише слова — виправте слова.

Інші варіанти

Можна також повністю видалити текст з картинки і набрати справжній текст на чистому фоні в дизайнерському інструменті — це хороший підхід для меню та прайс-листів. Коли формулювання правильне, можна перекласти текст на картинці, щоб зробити версії іншими мовами.

Редагуйте лише ті зображення, які вам належать або які ви маєте дозвіл змінювати, не видаляйте водяні знаки чи вказівки авторства та залишайте будь-які позначки зображень від ШІ, яких вимагає платформа.

Виправте слова й залиште картинку

Якщо зображення правильне, а правопис — ні, починати спочатку не обов’язково. Завантажте його в EditText.ai, щоб виправити текст на зображенні, створеному ШІ, введіть правильні слова для кожного рядка й перевірте результат, перш ніж його завантажувати.

Поширені запитання

Чому ШІ псує текст на зображеннях?

Генератори зображень на основі ШІ малюють текст як форми, а не набирають його літерами, і багато з них читають запити шматками слів, а не окремими символами. Текст також є дрібною деталлю зі строгими правилами, тож один неправильний штрих впадає в око. Навчальні зображення часто показують текст дрібним, розмитим або під кутом, і це дає моделям менше чітких прикладів для навчання.

Чому ШІ пише нісенітницю замість справжніх слів?

Коли модель не впевнена, як пишеться слово, вона все одно малює форми, схожі на літери, бо саме так текст виглядає на її навчальних зображеннях. Результатом можуть бути знаки, схожі на літери, змішані абетки або вигадані слова. Найчастіше так буває з довгим текстом, дрібними написами та незвичними словами, а рідше — з короткою фразою в лапках.

Який генератор зображень на основі ШІ найкраще працює з текстом?

Постійної відповіді немає, бо моделі часто змінюються, а кожна нова версія може поводитися інакше. Загалом нещодавні генератори краще справляються з коротким великим текстом, ніж старіші. Найкорисніший тест — ваш власний запит: згенеруйте ту саму коротку фразу в доступних вам інструментах, а потім перевірте правопис літера за літерою, перш ніж щось вибирати.

Чи можна виправити помилки в тексті на зображенні від ШІ без повторної генерації?

Так. Можна виділити ділянку й описати виправлення в тому самому генераторі, набрати текст вручну в редакторі на кшталт Photoshop чи Photopea або скористатися інструментом заміни тексту, який розпізнає слова, щоб ви могли ввести правильне написання. Яким би способом ви не скористалися, порівняйте результат з оригіналом, щоб помітити зміни поруч із текстом.

Чому інструмент для пошуку шрифтів не може визначити написи на моєму зображенні від ШІ?

Генератори ШІ зазвичай малюють написи за візерунками, які вивчили, а не з установленого файлу шрифту. Літери можуть поєднувати риси кількох гарнітур або змінювати форму від літери до літери. Інструмент для визначення шрифтів усе одно може запропонувати схожі шрифти, що допомагає, якщо ви плануєте набрати текст заново, але точного збігу часто не існує.