Генераторы изображений плохо справляются с орфографией, потому что они рисуют картинки, а не текст. Они учатся тому, как выглядят буквы — как формы и узоры из пикселей, — и никогда не набирают слово по одной букве, поэтому небольшая оплошность может превратить «BAKERY» в «BAKRERY». Многие из них к тому же читают ваш запрос кусочками слов, а не отдельными буквами, из-за чего точная орфография даётся ещё труднее.
Новые генераторы справляются с короткими надписями гораздо лучше ранних, но длинные фрагменты, мелкие надписи, необычные имена и нелатинские письменности по-прежнему приводят к ошибкам. Если у вас уже есть картинка с искажёнными словами, часто можно исправить текст на картинке, созданной нейросетью, не начиная заново. В этом руководстве объясняется, почему возникают ошибки, как составлять запрос, чтобы текст получался лучше, и как исправить его потом — неважно, создана картинка в Midjourney, ChatGPT, Gemini, Stable Diffusion или другом генераторе.
Как генераторы изображений создают картинку
Многие популярные генераторы изображений используют метод, который называется диффузионной моделью. Модель начинает со случайного шума, похожего на помехи на экране, и на каждом из многих шагов убирает немного этого шума. Ваш запрос направляет каждый шаг, поэтому шум постепенно превращается в картинку, которая соответствует описанию. Изображение уточняется целиком: небо, лица и надписи принимают форму одновременно.
Не все генераторы работают так. Некоторые строят изображение как последовательность небольших фрагментов. Но в целом у моделей «текст в изображение» есть одна важная общая черта: они предсказывают, как должна выглядеть картинка. Нет шага, на котором модель выбирает шрифт и набирает «B», затем «A», затем «K». Буквы появляются только как формы, которые выглядят правдоподобно, поэтому они могут получиться почти правильными, но не совсем.
Почему текст так труден для генераторов изображений
Здесь действуют сразу несколько причин. Каждая повышает вероятность небольшой ошибки, а в тексте мелкие ошибки хорошо заметны.
Буквы — мелкие детали со строгими правилами
У дерева может быть сколько угодно веток, и оно всё равно останется деревом. У слова ровно одно правильное написание. У текста есть и правила, которые действуют на всё слово целиком: у каждой буквы должны быть одинаковые стиль и высота, интервалы должны быть ровными, а буквы стоять на одной линии. Лишний штрих, пропавшая или удвоенная буква бросаются в глаза любому, кто читает на этом языке, даже когда остальное изображение выглядит как настоящее.
Модель может никогда не увидеть набранные вами буквы
Прежде чем генератор сможет использовать ваш запрос, компонент под названием текстовый кодировщик превращает его в числа. Многие текстовые кодировщики сначала разбивают запрос на токены. Распространённые слова часто становятся одним токеном, а более редкие разбиваются на несколько частей. Один из широко используемых методов построения таких частей — кодирование пар байтов (byte-pair encoding). Подход эффективен, но модель получает идентификатор каждой части, а не буквы внутри неё. Ей приходится учиться на примерах, что та или иная часть рисуется как определённый ряд букв.
В статье Google Research Character-Aware Models Improve Visual Text Rendering это изучалось напрямую. Исследователи сравнили текстовые кодировщики, которые видят отдельные символы («character-aware»), с кодировщиками, которые видят лишь части слов («character-blind»). Модели изображений с кодировщиками, видящими символы, точнее отрисовывали текст, и особенно заметным было преимущество на редких словах. В статье также обнаружено, что очень большие языковые модели, не видящие символов, могут научиться хорошо писать слова, но этот навык плохо переносился за пределы английского и проявлялся только в моделях, намного крупнее тех текстовых кодировщиков, которые генераторы изображений обычно использовали в то время.
В обучающих изображениях текст часто выглядит плохо
Генераторы учатся на очень больших коллекциях изображений с описаниями. На этих изображениях текст часто мелкий, размытый, обрезанный, виден под углом или частично скрыт, и он встречается в огромном разнообразии шрифтов и стилей. В описании к изображению текст вообще может не упоминаться. Поэтому модель видит много примеров того, как выглядит текст вообще, но меньше чётких примеров того, как именно пишется конкретное слово.
У мелкого текста очень мало пикселей
Заголовок может занимать сотни пикселей, а слову мелкого шрифта на каждую букву может достаться лишь несколько. Многие генераторы работают и со сжатой версией изображения, а полноразмерную картинку восстанавливают в конце, из-за чего для мелких деталей остаётся ещё меньше места. Тонкие линии, например перекладина в строчной «e», легко теряются.
Почему новые модели пишут текст лучше
Генераторы изображений стали намного лучше справляться с короткими заголовками и подписями. В целом новые системы используют более сильные языковые модели, чтобы понимать запрос, а разработчики уделили тексту больше внимания при обучении. Приведённое выше исследование указывает в ту же сторону: модели, получающие лучшую информацию о буквах, рисуют текст точнее.
Улучшение реальное, но неравномерное. Генератор, который правильно пишет заголовок из трёх слов, всё ещё может не справиться с абзацем, меню или подписью на языке, который реже встречался при обучении.
Где генераторы изображений всё ещё ошибаются
- Длинный текст. Абзацы, меню и списки, где каждое лишнее слово — ещё один шанс на ошибку
- Мелкий текст. Мелкий шрифт, подписи и текст вдали на сцене
- Необычные слова. Имена, придуманные слова, новые термины и длинные числа вроде номеров телефонов или кодов
- Нелатинские письменности. Арабская, китайская, хинди, японская, корейская, тайская и другие системы письма, а также буквы с диакритическими знаками
- Много блоков текста. Постеры и инфографика с несколькими отдельными фрагментами текста
- Изогнутые или наклонные поверхности. Текст на бутылке, флаге или вывеске, увиденной сбоку
- Единообразие. Одинаковая формулировка на всех картинках серии
Это типичные закономерности, а не жёсткие правила, и они различаются от генератора к генератору и от версии к версии.
Как получить лучший текст при создании картинки
- Берите точные слова в кавычки. Например, просите постер с заголовком «NIGHT MARKET», а не постер про ночной рынок.
- Делайте текст коротким. Несколько слов крупным шрифтом получить правильно проще, чем целое предложение. Более длинный текст лучше вынести в подпись или на веб-страницу.
- Укажите, где должен быть текст. Опишите положение и размер, например «крупный заголовок вверху» или «маленькая этикетка на банке».
- Просите простые буквы. Жирные чёткие заглавные буквы на ровном месте модели рисовать проще, чем декоративный рукописный шрифт на пёстром фоне.
- Сделайте несколько вариантов. Создайте несколько версий, выберите ту, где орфография лучше всего, и исправьте только то, что осталось.
- Точный текст добавляйте позже, если это важно. Для меню, прайс-листа или чего-то с мелким шрифтом создайте изображение с пустым местом и наберите текст в дизайн-редакторе. Тогда формулировка будет набрана, а не нарисована.
Как исправить текст потом
Если картинка получилась, а слова неверные, есть четыре основных варианта. Вот они — от самого простого до самого трудоёмкого.
| Способ | Усилия | Что ещё может измениться | Лучше всего, когда |
|---|---|---|---|
| Создать изображение заново | Небольшие | Всё, потому что получится новая картинка | Неверно всё изображение или вам не жалко потерять эту версию |
| Выделить и отредактировать в генераторе | Небольшие | Соседние области тоже могут быть перерисованы | Нужна быстрая правка в том же инструменте |
| Инструмент замены текста с помощью ИИ | От небольших до средних | Перерисовывается область текста, поэтому проверьте результат | Картинка хорошая, а неверны только слова |
| Исправить вручную в графическом редакторе | Большие | Только то, что вы меняете | Нужен полный контроль, например для печати или работы для клиента |
Создайте изображение заново
Повторная генерация требует мало усилий, но результат случаен. Новая попытка может исправить слово и испортить что-то другое, например лицо, руку или композицию. Используйте её, если вы ещё не потратили много времени именно на это изображение.
Выделите и отредактируйте внутри генератора
Некоторые генераторы позволяют отметить область и описать изменение. Например, в ChatGPT можно выделить текст инструментом выделения и ввести, что на нём должно быть написано. В справочном центре OpenAI отмечено, что выделение не всегда точно, поэтому детали рядом с текстом тоже могут измениться. Подробнее — в статье может ли ChatGPT изменить текст на картинке.
Воспользуйтесь инструментом замены текста с помощью ИИ
Инструмент замены текста сам распознаёт текст на изображении, так что вам остаётся только ввести правильное написание. Например, в EditText.ai вы изменяете текст на картинке построчно, и каждая строка перерисовывается в стиле исходной надписи и фона. Для одной неверной буквы или слова смотрите, как исправить опечатку на картинке. Для заголовков и акцидентных надписей на афишах смотрите, как изменить текст на постере или флаере.


До и после: искажённая неоновая вывеска на ИИ-картинке, исправленная вводом слова THEATER в EditText.ai.
Результаты могут отличаться, особенно при необычных надписях и детальных фонах. Поскольку перерисовку тоже выполняет модель изображений, читайте каждое новое слово по буквам в полном размере. Любое распознавание текста может также неверно прочитать искажённые буквы, поэтому убедитесь, что каждая найденная строка — та, которую вы хотели изменить.
Исправьте вручную
В Photoshop, Photopea или похожем редакторе вы удаляете искажённые буквы, восстанавливаете фон и набираете новый текст шрифтом. Это даёт больше всего контроля и подходит для печати и работы для клиентов, но требует навыков и времени. Надпись, созданная ИИ, часто не является настоящим шрифтом, поэтому определитель шрифтов может не найти совпадение. О том, как найти близкую замену, читайте в статье как определить шрифт по картинке.
Выбрать поможет простое правило: если неверно всё изображение, создайте его заново. Если неверны только слова, исправляйте слова.
Другие варианты
Можно также полностью удалить текст с картинки и набрать настоящий текст на чистом фоне в дизайн-редакторе — хороший подход для меню и прайс-листов. Когда формулировка верна, можно перевести текст на картинке, чтобы сделать версии на других языках.
Редактируйте только те изображения, которые принадлежат вам или которые вам разрешено менять, не удаляйте водяные знаки и указание авторства и сохраняйте пометки об ИИ-изображениях, которых требует платформа.
Исправьте слова и сохраните картинку
Если изображение правильное, а орфография нет, начинать заново не нужно. Загрузите его в EditText.ai, чтобы исправить текст на картинке, созданной нейросетью, введите правильные слова для каждой строки и проверьте результат, прежде чем скачивать.
Частые вопросы
Почему ИИ портит текст на картинках?
Генераторы изображений рисуют текст как формы, а не набирают его буквами, и многие читают запросы кусочками слов, а не отдельными символами. Текст к тому же — мелкая деталь со строгими правилами, поэтому один неверный штрих бросается в глаза. В обучающих изображениях текст часто мелкий, размытый или виден под углом, и у моделей меньше чётких примеров для обучения.
Почему ИИ пишет абракадабру вместо настоящих слов?
Когда модель не уверена, как пишется слово, она всё равно рисует формы, похожие на буквы, потому что именно так выглядит текст в её обучающих изображениях. В результате могут получиться значки, похожие на буквы, смесь алфавитов или выдуманные слова. Чаще всего это случается с длинным текстом, мелкими надписями и необычными словами и реже — с короткой фразой в кавычках.
Какой генератор изображений лучше всего пишет текст?
Постоянного ответа нет, потому что модели часто меняются, а каждая новая версия может вести себя иначе. В целом недавние генераторы лучше справляются с коротким крупным текстом, чем прежние. Самая полезная проверка — ваш собственный запрос: создайте одну и ту же короткую фразу в доступных вам инструментах, а затем проверьте написание по буквам, прежде чем выбирать.
Можно ли исправить текст с ошибками на ИИ-картинке, не создавая её заново?
Да. Можно выделить область и описать исправление в том же генераторе, набрать текст вручную в редакторе вроде Photoshop или Photopea или воспользоваться инструментом замены текста, который распознаёт слова, чтобы вы ввели правильное написание. Каким бы способом вы ни пользовались, сравните результат с оригиналом, чтобы заметить изменения рядом с текстом.
Почему определитель шрифтов не распознаёт надпись на моей ИИ-картинке?
Генераторы ИИ обычно рисуют буквы по усвоенным закономерностям, а не по установленному файлу шрифта. В буквах могут смешиваться черты нескольких гарнитур, а их форма может меняться от буквы к букве. Определитель шрифтов всё же может предложить похожие шрифты — это помогает, если вы собираетесь набрать текст заново, но точного совпадения часто не существует.