edittext.ai

Por que a IA erra texto em imagens (e como corrigir)

Por que a IA erra texto em imagens? Ela desenha letras como formas, e não como texto. Veja as causas das palavras embaralhadas e como consertá-las.

Os geradores de imagem com IA têm dificuldade com a grafia porque desenham imagens, e não texto. Eles aprendem como as letras aparecem, como formas e padrões de pixels, e nunca digitam uma palavra letra por letra, então um pequeno deslize pode transformar “BAKERY” em “BAKRERY”. Muitos deles também leem o seu prompt em pedaços de palavras, e não em letras individuais, o que dificulta ainda mais acertar a grafia.

Os geradores mais novos lidam com texto curto muito melhor do que os primeiros, mas trechos longos, letras pequenas, nomes incomuns e sistemas de escrita não latinos ainda causam erros. Se você já tem uma imagem com palavras quebradas, muitas vezes dá para corrigir o texto em imagem gerada por IA sem começar do zero. Este guia explica por que os erros acontecem, como escrever prompts que gerem texto melhor e como consertá-lo depois, seja a imagem do Midjourney, do ChatGPT, do Gemini, do Stable Diffusion ou de outro gerador.

Como os geradores de imagem com IA criam uma imagem

Muitos geradores de imagem populares usam um método chamado modelo de difusão. O modelo começa com ruído aleatório, parecido com o chuvisco de uma tela, e remove um pouco desse ruído em cada uma de várias etapas. O seu prompt orienta cada etapa, então o ruído vai se transformando aos poucos em uma imagem que corresponde à sua descrição. A imagem inteira é refinada junta: o céu, os rostos e as letras ganham forma ao mesmo tempo.

Nem todo gerador funciona assim. Alguns montam a imagem como uma sequência de pequenos pedaços. Mas, em geral, os modelos de texto para imagem têm uma característica importante em comum: eles preveem como a imagem deve ficar. Não existe uma etapa em que o modelo escolhe uma fonte e digita “B”, depois “A”, depois “K”. As letras aparecem apenas como formas que parecem certas, e é por isso que podem sair quase certas, mas não totalmente.

Por que o texto é tão difícil para os geradores de imagem

Várias causas atuam juntas. Cada uma torna um pequeno erro mais provável, e o texto é um lugar em que os pequenos erros são fáceis de ver.

Letras são pequenos detalhes com regras rígidas

Uma árvore pode ter qualquer número de galhos e continuar parecendo uma árvore. Uma palavra tem exatamente uma grafia correta. O texto também tem regras que valem para a palavra inteira: todas as letras precisam ter o mesmo estilo e a mesma altura, o espaçamento precisa ser uniforme e as letras precisam ficar na mesma linha. Um traço a mais, uma letra faltando ou uma letra repetida é óbvio para qualquer pessoa que leia o idioma, mesmo quando o resto da imagem parece real.

O modelo pode nunca ver as letras que você digitou

Antes que um gerador possa usar o seu prompt, um componente chamado codificador de texto o transforma em números. Muitos codificadores de texto começam dividindo o prompt em tokens. Palavras comuns muitas vezes viram um único token, enquanto palavras mais raras são quebradas em vários pedaços. Um método muito usado para montar esses pedaços é a codificação por pares de bytes (byte-pair encoding). A abordagem é eficiente, mas o modelo recebe um ID para cada pedaço, e não as letras que há dentro dele. Ele precisa aprender, a partir de exemplos, que um certo pedaço é desenhado como uma certa fileira de letras.

Um artigo do Google Research, Character-Aware Models Improve Visual Text Rendering, estudou isso diretamente. Os pesquisadores compararam codificadores de texto que enxergam caracteres individuais (“character-aware”, ou cientes de caracteres) com codificadores que só enxergam pedaços de palavras (“character-blind”, ou cegos a caracteres). Os modelos de imagem com codificadores cientes de caracteres reproduziram o texto visual com mais precisão e foram especialmente bons com palavras raras. O artigo também constatou que modelos de linguagem muito grandes e cegos a caracteres conseguem aprender a escrever bem, mas que essa habilidade não se estendeu bem para além do inglês e só apareceu em modelos muito maiores do que os codificadores de texto que os geradores de imagem costumavam usar na época.

As imagens de treinamento costumam mostrar o texto de forma ruim

Os geradores aprendem com coleções enormes de imagens acompanhadas de descrições. Nessas imagens, o texto costuma ser pequeno, borrado, cortado, visto em ângulo ou parcialmente escondido, e aparece em uma variedade enorme de fontes e estilos. A descrição que acompanha uma imagem pode nem mencionar o texto dela. Assim, o modelo vê muitos exemplos de como o texto se parece em geral, mas menos exemplos claros de como exatamente uma palavra específica deve ser escrita.

Texto pequeno tem pouquíssimos pixels

Um título pode ocupar centenas de pixels, enquanto uma palavra em letras miúdas pode ter apenas alguns pixels por letra. Muitos geradores também trabalham com uma versão comprimida da imagem e reconstroem a imagem em tamanho real no final, o que deixa ainda menos espaço para detalhes pequenos. Linhas finas, como a barra de um “e” minúsculo, são fáceis de perder.

Por que os modelos mais novos escrevem melhor

Os geradores de imagem melhoraram muito em títulos e rótulos curtos. Em geral, os sistemas mais novos usam modelos de linguagem mais fortes para entender o prompt, e os desenvolvedores deram mais atenção ao texto durante o treinamento. A pesquisa citada acima aponta na mesma direção: os modelos que recebem informações melhores sobre as letras desenham o texto com mais precisão.

A melhora é real, mas desigual. Um gerador que escreve corretamente um título de três palavras ainda pode ter dificuldade com um parágrafo, um cardápio ou um rótulo em um idioma que ele viu menos vezes durante o treinamento.

Onde os geradores de imagem com IA ainda têm dificuldade

  • Texto longo. Parágrafos, cardápios e listas, em que cada palavra a mais é outra chance de erro
  • Texto pequeno. Letras miúdas, rótulos e texto distante em uma cena
  • Palavras incomuns. Nomes, palavras inventadas, termos novos e números longos, como números de telefone ou códigos
  • Sistemas de escrita não latinos. Árabe, chinês, híndi, japonês, coreano, tailandês e outros sistemas de escrita, além de letras acentuadas
  • Muitos blocos de texto. Cartazes e infográficos com vários textos separados
  • Superfícies curvas ou inclinadas. Texto em uma garrafa, em uma bandeira ou em uma placa vista de lado
  • Consistência. Manter o mesmo texto, sem variações, em uma série de imagens

São padrões comuns, e não regras fixas, que variam de um gerador e de uma versão para outra.

Como obter um texto melhor ao gerar uma imagem

  1. Coloque as palavras exatas entre aspas. Por exemplo, peça um cartaz com o título “NIGHT MARKET”, em vez de um cartaz sobre uma feira noturna.
  2. Mantenha o texto curto. Algumas palavras em tamanho grande são mais fáceis de acertar do que uma frase inteira. Coloque textos mais longos em uma legenda ou em uma página da web.
  3. Diga onde o texto vai. Descreva a posição e o tamanho, como “título grande no alto” ou “rótulo pequeno no pote”.
  4. Peça letras simples. Letras maiúsculas em negrito e limpas sobre uma área lisa são mais fáceis para o modelo desenhar do que letras cursivas decorativas sobre um fundo carregado.
  5. Faça várias versões. Gere algumas opções, escolha a que tem a melhor grafia e corrija só o que sobrar.
  6. Acrescente o texto exato depois, quando for importante. Para um cardápio, uma lista de preços ou qualquer coisa com letras miúdas, gere a imagem com espaço vazio e componha o texto em uma ferramenta de design. Assim o texto é digitado, e não desenhado.

Como corrigir o texto depois

Se a imagem está certa, mas as palavras estão erradas, você tem quatro opções principais. Aqui estão elas, da que dá menos trabalho à que dá mais.

MétodoEsforçoO que mais pode mudarMelhor quando
Gerar a imagem de novoBaixoTudo, porque você recebe uma imagem novaA imagem inteira está errada ou você não se importa de perder esta versão
Selecionar e editar no geradorBaixoAs áreas próximas também podem ser redesenhadasVocê quer uma correção rápida na mesma ferramenta
Ferramenta de substituição de texto com IABaixo a médioA área do texto é redesenhada, então confira o resultadoA imagem está certa e só as palavras estão erradas
Corrigir à mão em um editor de imagensAltoApenas o que você mudarVocê precisa de controle total, por exemplo em trabalhos de impressão ou para clientes

Gerar a imagem de novo

Gerar de novo dá pouco trabalho, mas o resultado é aleatório. Uma nova tentativa pode corrigir a palavra e estragar outra coisa, como um rosto, uma mão ou o layout. Use esse método quando você ainda não gastou muito tempo com esta imagem específica.

Selecionar e editar dentro do gerador

Alguns geradores permitem marcar uma área e descrever uma mudança. No ChatGPT, por exemplo, você pode destacar o texto com uma ferramenta de seleção e digitar o que ele deve dizer. A Central de Ajuda da OpenAI observa que as áreas destacadas nem sempre são precisas, então os detalhes perto do texto também podem mudar. Para saber mais, veja se o ChatGPT consegue editar texto em imagem.

Use uma ferramenta de substituição de texto com IA

Uma ferramenta de substituição de texto detecta o texto da imagem para você, então você só digita a grafia correta. Com o EditText.ai, por exemplo, você edita o texto da imagem linha por linha, e cada linha é redesenhada com o visual das letras e do fundo originais. Para uma única letra ou palavra errada, veja como corrigir um erro de digitação em uma imagem. Para títulos e letras de destaque em artes de eventos, veja como mudar o texto de um cartaz.

Antes: ilustração retrô gerada por IA de uma rua de Nova York à noite, com um alto letreiro de neon vermelho que diz NEYAHRD, um texto sem sentido
Depois: a mesma ilustração com o letreiro de neon vermelho agora dizendo THEATER, enquanto o skyline, os táxis e o título NEW YORK continuam iguais

Antes e depois: um letreiro de neon embaralhado em uma imagem de IA, corrigido ao digitar THEATER no EditText.ai.

Os resultados podem variar, principalmente com letras incomuns ou fundos detalhados. Como o redesenho também é feito por um modelo de imagem, leia cada palavra nova letra por letra em tamanho real. Qualquer detecção de texto também pode ler errado letras embaralhadas, então confira se cada linha detectada é mesmo a que você queria mudar.

Corrigir à mão

No Photoshop, no Photopea ou em um editor parecido, você remove as letras quebradas, reconstrói o fundo e aplica o texto novo em uma fonte. Isso dá o máximo de controle e serve para trabalhos de impressão ou para clientes, mas exige habilidade e tempo. As letras feitas por IA muitas vezes não são uma fonte de verdade, então um identificador de fontes pode não encontrar correspondência. Leia como descobrir a fonte de uma imagem para ver formas de achar um substituto parecido.

Uma regra simples ajuda a escolher: se a imagem inteira está errada, gere de novo. Se só as palavras estão erradas, corrija as palavras.

Outras opções

Você também pode remover texto de imagem por completo e aplicar texto de verdade sobre o fundo limpo em uma ferramenta de design, uma boa abordagem para cardápios e listas de preços. Depois que o texto estiver certo, você pode traduzir texto de imagem para criar versões em outros idiomas.

Edite apenas imagens que você possui ou que tem permissão para alterar, não remova marcas-d'água nem créditos de autoria e mantenha os rótulos de imagem gerada por IA que uma plataforma exigir.

Corrija as palavras e mantenha a imagem

Se a imagem está certa, mas a grafia está errada, você não precisa recomeçar. Envie-a para corrigir texto em imagem gerada por IA com o EditText.ai, digite as palavras corretas de cada linha e confira o resultado antes de baixá-la.

Perguntas frequentes

Por que a IA erra o texto das imagens?

Os geradores de imagem com IA desenham o texto como formas, em vez de digitá-lo como letras, e muitos leem os prompts em pedaços de palavras, e não em caracteres isolados. O texto também é um detalhe pequeno com regras rígidas, então um traço errado chama atenção. As imagens de treinamento muitas vezes mostram texto pequeno, borrado ou em ângulo, o que dá aos modelos menos exemplos claros para aprender.

Por que a IA escreve palavras sem sentido em vez de palavras reais?

Quando um modelo não tem certeza de como uma palavra se escreve, ele ainda assim desenha formas que parecem letras, porque é assim que o texto aparece nas imagens de treinamento dele. O resultado pode ser marcas parecidas com letras, alfabetos misturados ou palavras inventadas. Isso acontece mais com texto longo, letras pequenas e palavras incomuns, e menos com uma frase curta entre aspas.

Qual gerador de imagem com IA é o melhor em texto?

Não há uma resposta permanente, porque os modelos mudam com frequência e cada versão nova pode se comportar de um jeito diferente. Em geral, os geradores recentes lidam melhor com texto curto e grande do que os mais antigos. O teste mais útil é o seu próprio prompt: gere a mesma frase curta nas ferramentas a que você tem acesso e confira a grafia letra por letra antes de escolher uma.

Dá para corrigir texto com erro em uma imagem de IA sem gerá-la de novo?

Sim. Você pode selecionar a área e descrever a correção no próprio gerador, redigitar o texto à mão em um editor como o Photoshop ou o Photopea ou usar uma ferramenta de substituição de texto que detecta as palavras para você digitar a grafia correta. Seja qual for o método, compare o resultado com o original para perceber mudanças perto do texto.

Por que um identificador de fontes não reconhece as letras da minha imagem de IA?

Os geradores de IA geralmente desenham as letras a partir de padrões que aprenderam, e não de um arquivo de fonte instalado. As letras podem misturar características de várias fontes ou mudar de formato de uma letra para outra. Um identificador de fontes ainda pode sugerir fontes parecidas, o que ajuda se você pretende redigitar o texto, mas muitas vezes não existe uma correspondência exata.