edittext.ai

AI 生成图片为什么总是写错字?文字乱码的原因与修复方法

AI 生成图片为什么会写错字?因为它们是把字母当作形状来画,而不是当作文字来写。了解文字乱码的成因,以及修复图片文字的实用办法。

AI 图片生成工具之所以拼写困难,是因为它们画的是图片,而不是文字。它们学到的是字母作为形状和像素图案的样子,从来不会一个字母一个字母地把单词打出来,所以一个小失误就可能把“BAKERY”变成“BAKRERY”。许多工具还会把您的提示词拆成词片段来读取,而不是逐个字母,这让精确拼写更加困难。

新一代的生成工具处理短文字的能力,比早期好得多,但较长的段落、很小的字、不常见的名称和非拉丁文字仍然会出错。如果您手里已经有一张文字出错的图片,往往不必从头再来,直接就能修复 AI 生成图片中的文字乱码。本指南解释错误为什么会出现、怎样写提示词才能得到更好的文字,以及事后怎样修复,无论图片来自 Midjourney、ChatGPT、Gemini、Stable Diffusion 还是其他生成工具。

AI 图片生成工具是怎么生成图片的

许多流行的图片生成工具使用一种叫作扩散模型的方法。模型从随机噪声开始,就像屏幕上的雪花点,然后在许多步骤中,每一步去掉一点噪声。您的提示词引导着每一步,于是噪声慢慢变成一幅与您的描述相符的图片。整张图片是一起被逐步细化的:天空、人脸和字形都在同一时间成形。

并不是所有生成工具都这样工作。有些工具是把图片作为一系列小块依次构建出来的。但总的来说,文生图模型有一个重要的共同点:它们预测图片应该是什么样子。整个过程中没有哪一步是模型选一款字体,然后依次打出“B”、“A”、“K”。字母只是以“看起来对”的形状出现,所以它们可能画得几乎正确,却又差那么一点。

为什么文字对图片生成工具这么难

有几个原因共同起作用。每一个原因都会让小错误更容易出现,而文字恰恰是小错误很容易被看出来的地方。

字母是规则严格的微小细节

一棵树不管有多少根树枝,看起来仍然是树。而一个单词只有唯一正确的拼写。文字还有贯穿整个单词的规则:每个字母的样式和高度都要一致,间距要均匀,字母要排在同一条线上。多一笔、少一个字母或者重复一个字母,对任何读得懂这种语言的人来说都一目了然,哪怕图片的其余部分看起来很逼真。

模型可能从未“看到”您输入的字母

生成工具在使用您的提示词之前,会先由一个叫作文本编码器的组件把它转换成数字。许多文本编码器会先把提示词拆分成词元(token)。常见的词往往只是一个词元,而较少见的词则会被拆成几个片段。构建这些片段的一种常用方法是字节对编码。这种方法效率很高,但模型接收到的是每个片段的编号,而不是片段里的字母。它必须从示例中学会:某个片段要画成某一排字母。

Google Research 的一篇论文Character-Aware Models Improve Visual Text Rendering(《字符感知模型改进视觉文字渲染》)直接研究了这个问题。研究人员比较了能看到单个字符的文本编码器(“字符感知”)和只能看到词片段的编码器(“字符盲”)。配备字符感知编码器的图片模型,渲染出的视觉文字更准确,在生僻词上尤其出色。论文还发现,非常大的字符盲语言模型可以学会拼写得很好,但这种能力在英语之外的迁移效果不佳,而且只出现在比当时图片生成工具通常使用的文本编码器大得多的模型上。

训练图片里的文字往往很糟糕

生成工具是从海量的“图片加描述”中学习的。在这些图片里,文字常常很小、很模糊、被截断、带着角度,或者被部分遮挡,而且字体和风格五花八门。与图片配对的描述也可能根本没有提到图片里的文字。所以,模型见过很多“文字大致是什么样子”的例子,却很少见到清晰说明“某个具体单词到底该怎么拼”的例子。

小号文字只有很少的像素

标题可能横跨几百个像素,而小字里的一个单词,每个字母可能只分到几个像素。许多生成工具还是在图片的压缩版本上工作,最后才重建出完整尺寸的图片,这让细小的细节更没有容身之处。细线,比如小写“e”里的那一横,很容易丢掉。

为什么新模型写出的文字更好

图片生成工具在短标题和标签上已经进步很多。总体而言,新系统使用更强的语言模型来理解提示词,开发者在训练中也更重视文字。上文提到的研究指向同一个方向:获得更好的字母信息的模型,画出的文字更准确。

这种进步是真实的,但并不均衡。一个能把三个词的标题写对的生成工具,面对一整段文字、一份菜单,或者训练中较少见到的语言写成的标签,仍然可能吃力。

AI 图片生成工具仍然吃力的地方

  • 长文字:段落、菜单和列表,每多一个词,就多一次出错的机会
  • 小号文字:小字、标签,以及场景里远处的文字
  • 不常见的词:人名、自造词、新术语,以及电话号码或代码这类长数字
  • 非拉丁文字:阿拉伯语、中文、印地语、日语、韩语、泰语等书写系统,以及带重音符号的字母
  • 多个文字块:带有若干块独立文字的海报和信息图
  • 弯曲或倾斜的表面:瓶子、旗帜上的文字,或从侧面看到的招牌
  • 一致性:在一系列图片中保持同样的措辞完全相同

这些是常见的规律,而不是固定的规则,不同的生成工具和版本之间也各不相同。

生成图片时怎样得到更好的文字

  1. 把确切的文字放在引号里:例如,要求生成一张标题为“NIGHT MARKET”的海报,而不是一张关于夜市的海报。
  2. 让文字简短:大号的几个词,比一整句话更容易写对。较长的文字请放到说明文字里或网页上。
  3. 说明文字放在哪里:描述位置和大小,比如“横跨顶部的大标题”或“罐子上的小标签”。
  4. 要求简洁的字形:素色区域上粗壮、干净的大写字母,比复杂背景上的装饰性手写体更容易让模型画好。
  5. 多生成几个版本:生成几个备选,挑出拼写最好的一个,只修复剩下的问题。
  6. 重要的文字留到后面再加:对于菜单、价目表或任何带小字的内容,先生成留有空白的图片,再用设计工具排上文字。这样文字是打出来的,而不是画出来的。

事后怎样修复文字

如果图片本身没问题,只是文字有误,主要有四种选择。下面按所需的功夫从少到多排列。

方法所需功夫还有什么可能变化最适合的情况
重新生成图片低一切都可能变,因为会得到一幅新图整张图都不对,或者不介意丢掉这个版本
在生成工具里选区编辑低附近的区域也可能被重新绘制想在同一个工具里快速修一下
AI 文字替换工具低到中等文字区域会被重绘,所以请检查结果图片没问题,只有文字有误
在图片编辑器里手动修复高只有您改动的部分需要完全掌控,例如用于印刷或客户项目

重新生成图片

重新生成花不了多少功夫,但结果是随机的。新的尝试也许修好了那个词,却又弄坏了别的东西,比如人脸、手或版式。当您还没在这张图上花多少时间时,可以用这个办法。

在生成工具里选区编辑

有些生成工具允许您标出一个区域并描述想做的修改。比如在 ChatGPT 中,您可以用选择工具标出文字,再输入它应该写什么。OpenAI 帮助中心指出,标出的区域并不总是精确,所以文字附近的细节也可能变化。想进一步了解,请参阅ChatGPT 能修改图片里的文字吗。

使用 AI 文字替换工具

文字替换工具会替您识别图片里的文字,您只需输入正确的拼写。例如用 EditText.ai,您可以逐行图片改字,每一行都会按原有字形和背景的样子重绘。如果只错了一个字母或一个词,请看如何修改图片里的错别字。对于活动设计上的标题和展示性字形,请看如何海报改字。

编辑前:AI 生成的复古风格纽约夜景街道插画,一块高高的红色霓虹招牌上写着毫无意义的乱码 NEYAHRD
编辑后:同一幅插画,红色霓虹招牌改为 THEATER,天际线、出租车和 NEW YORK 标题保持不变

编辑前后对比:AI 图片里乱码的霓虹招牌,在 EditText.ai 中输入 THEATER 后得到改正。

效果会有差异,尤其是字形特殊或背景复杂的图片。由于重绘同样是由图片模型完成的,请按原始尺寸逐个字母地读一遍每个新词。任何文字识别也可能把乱码字母读错,所以请确认每一行识别出的文字,都是您想要修改的那一行。

手动修复

在 Photoshop、Photopea 或类似的编辑器中,您可以去掉出错的字母,重建背景,再用某款字体排上新文字。这样您掌控得最多,适合印刷或客户项目,但需要技术,也很费时间。AI 画出的字形往往不是真正的字体,所以字体识别工具可能找不到匹配项。想找一款相近的替代字体,请阅读怎么识别图片中的字体。

有一条简单的规则可以帮您选择:如果整张图都不对,就重新生成;如果只是文字有误,就修复文字。

其他选择

您还可以用图片去字工具把文字彻底去掉,再到设计工具里,在干净的背景上排上真正的文字,这种做法很适合菜单和价目表。文字内容确认无误后,可以用图片翻译制作其他语言的版本。

只编辑属于您自己、或已获授权修改的图片,不要去除水印或署名,并保留平台要求的 AI 图片标识。

改好文字,保留图片

如果图片没问题,只是拼写有误,就不必从头再来。用 EditText.ai 把图片上传到修复 AI 生成图片中的文字乱码,为每一行输入正确的文字,并在下载之前检查结果。

常见问题

为什么 AI 会把图片里的文字搞错?

AI 图片生成工具是把文字当作形状来画的,而不是把它当作字母打出来,而且许多工具按词片段而不是单个字符来读取提示词。文字还是规则严格的小细节,所以错一笔就会很显眼。训练图片里的文字往往很小、很模糊或带着角度,模型可学习的清晰示例也就更少。

为什么 AI 会写出乱码,而不是真正的单词?

当模型不确定一个词怎么拼时,它仍然会画出看起来像字母的形状,因为训练图片里的文字就是这个样子。结果可能是类似字母的符号、混杂的字母表或自造的词。这种情况在长文字、小号字和不常见的词上最常出现,而对放在引号里的短语则较少出现。

哪个 AI 图片生成工具最擅长处理文字?

没有一成不变的答案,因为模型更新频繁,每个新版本的表现都可能不同。总体来说,较新的生成工具处理短而大的文字,比旧的更好。最有用的测试是您自己的提示词:在您能用到的工具里生成同一个短语,然后逐个字母检查拼写,再做选择。

能不重新生成,就修复 AI 图片里拼错的文字吗?

可以。您可以在同一个生成工具里选中区域并描述修改,也可以在 Photoshop 或 Photopea 这类编辑器里手动重新输入文字,或者使用能识别文字、让您输入正确拼写的文字替换工具。无论用哪种方法,都请把结果与原图对比,以便发现文字附近出现的变化。

为什么字体识别工具认不出我 AI 图片里的字形?

AI 生成工具通常是根据学到的规律来画字形,而不是调用某个已安装的字体文件。字母可能混合了几种字体的特征,或者在一个字母和下一个字母之间变换形状。字体识别工具仍可能给出相似的字体,如果您打算重新输入文字,这会有帮助,但完全一致的字体往往并不存在。