edittext.ai

Warum KI-Bildgeneratoren Text falsch schreiben – und was hilft

Warum kann KI keinen Text in Bildern schreiben? Sie zeichnet Buchstaben als Formen statt als Text. Ursachen für Buchstabensalat und wie du ihn korrigierst.

KI-Bildgeneratoren tun sich mit der Rechtschreibung schwer, weil sie Bilder zeichnen, keinen Text. Sie lernen, wie Buchstaben als Formen und Pixelmuster aussehen, und tippen ein Wort nie Buchstabe für Buchstabe, sodass ein kleiner Ausrutscher aus „BAKERY“ ein „BAKRERY“ machen kann. Viele von ihnen lesen deinen Prompt außerdem in Wortteilen statt in einzelnen Buchstaben, was die exakte Schreibweise noch schwerer macht.

Neuere Generatoren kommen mit kurzem Text deutlich besser zurecht als frühe, aber lange Passagen, kleine Schrift, ungewöhnliche Namen und nichtlateinische Schriften verursachen weiterhin Fehler. Wenn du schon ein Bild mit kaputten Wörtern hast, kannst du oft Text in KI-generierten Bildern korrigieren, ohne von vorn zu beginnen. Diese Anleitung erklärt, warum die Fehler entstehen, wie du Prompts für besseren Text formulierst und wie du ihn danach reparierst – egal, ob das Bild von Midjourney, ChatGPT, Gemini, Stable Diffusion oder einem anderen Generator stammt.

Wie KI-Bildgeneratoren ein Bild erzeugen

Viele beliebte Bildgeneratoren nutzen ein Verfahren namens Diffusionsmodell. Das Modell beginnt mit zufälligem Rauschen, ähnlich dem Flimmern auf einem Bildschirm, und entfernt in jedem von vielen Schritten ein wenig davon. Dein Prompt steuert jeden Schritt, sodass sich das Rauschen langsam in ein Bild verwandelt, das zu deiner Beschreibung passt. Das ganze Bild wird gemeinsam verfeinert: Himmel, Gesichter und Schriftzug nehmen gleichzeitig Gestalt an.

Nicht jeder Generator arbeitet so. Manche bauen das Bild stattdessen als Folge kleiner Teile auf. Aber im Allgemeinen haben Text-zu-Bild-Generatoren eine wichtige Eigenschaft gemeinsam: Sie sagen voraus, wie das Bild aussehen soll. Es gibt keinen Schritt, in dem das Modell eine Schriftart auswählt und „B“, dann „A“, dann „K“ tippt. Buchstaben erscheinen nur als Formen, die richtig aussehen, weshalb sie fast richtig, aber eben nicht ganz richtig herauskommen können.

Warum Text für Bildgeneratoren so schwierig ist

Mehrere Ursachen wirken zusammen. Jede macht einen kleinen Fehler wahrscheinlicher, und bei Text fallen kleine Fehler leicht auf.

Buchstaben sind winzige Details mit strengen Regeln

Ein Baum kann beliebig viele Äste haben und sieht trotzdem aus wie ein Baum. Ein Wort hat genau eine richtige Schreibweise. Text hat außerdem Regeln, die für das ganze Wort gelten: Jeder Buchstabe braucht denselben Stil und dieselbe Höhe, die Abstände müssen gleichmäßig sein, und die Buchstaben müssen auf derselben Linie stehen. Ein zusätzlicher Strich, ein fehlender oder ein doppelter Buchstabe fällt jedem auf, der die Sprache liest, auch wenn der Rest des Bildes echt aussieht.

Das Modell sieht die Buchstaben, die du getippt hast, womöglich nie

Bevor ein Generator deinen Prompt nutzen kann, wandelt eine Komponente namens Text-Encoder ihn in Zahlen um. Viele Text-Encoder zerlegen den Prompt zuerst in Tokens. Häufige Wörter werden oft zu einem einzigen Token, seltenere Wörter dagegen in mehrere Teile zerlegt. Eine weit verbreitete Methode, diese Teile zu bilden, ist das Byte Pair Encoding. Der Ansatz ist effizient, aber das Modell erhält für jedes Teil eine ID, nicht die Buchstaben darin. Es muss aus Beispielen lernen, dass ein bestimmtes Teil als eine bestimmte Buchstabenreihe gezeichnet wird.

Ein Paper von Google Research, Character-Aware Models Improve Visual Text Rendering, hat genau das untersucht. Die Forschenden verglichen Text-Encoder, die einzelne Zeichen sehen („character-aware“), mit Encodern, die nur Wortteile sehen („character-blind“). Bildmodelle mit zeichenbewussten Encodern stellten Text im Bild genauer dar und waren bei seltenen Wörtern besonders stark. Das Paper stellte außerdem fest, dass sehr große zeichenblinde Sprachmodelle gut buchstabieren lernen können, diese Fähigkeit sich aber nicht gut auf andere Sprachen als Englisch übertrug und nur in Modellen auftrat, die weit größer waren als die Text-Encoder, die Bildgeneratoren damals üblicherweise nutzten.

Trainingsbilder zeigen Text oft schlecht

Generatoren lernen aus sehr großen Sammlungen von Bildern mit zugehörigen Beschreibungen. In diesen Bildern ist Text oft klein, unscharf, abgeschnitten, schräg gesehen oder teilweise verdeckt, und er erscheint in einer riesigen Vielfalt an Schriftarten und Stilen. Die zu einem Bild gehörende Beschreibung erwähnt seinen Text womöglich gar nicht. Das Modell sieht also viele Beispiele dafür, wie Text im Allgemeinen aussieht, aber weniger klare Beispiele dafür, wie ein bestimmtes Wort genau geschrieben wird.

Kleiner Text hat sehr wenige Pixel

Eine Überschrift kann sich über Hunderte Pixel erstrecken, während ein Wort im Kleingedruckten nur wenige Pixel pro Buchstabe bekommt. Viele Generatoren arbeiten außerdem mit einer komprimierten Version des Bildes und bauen das Bild in voller Größe erst am Ende wieder auf, was noch weniger Platz für kleine Details lässt. Feine Linien, etwa der Querstrich im kleinen „e“, gehen leicht verloren.

Warum neuere Modelle besser schreiben

Bildgeneratoren sind bei kurzen Überschriften und Beschriftungen deutlich besser geworden. Im Allgemeinen nutzen neuere Systeme stärkere Sprachmodelle, um den Prompt zu verstehen, und beim Training wurde dem Text mehr Aufmerksamkeit geschenkt. Die oben genannte Forschung weist in dieselbe Richtung: Modelle, die bessere Informationen über Buchstaben erhalten, zeichnen Text genauer.

Die Verbesserung ist real, aber ungleichmäßig. Ein Generator, der einen Titel aus drei Wörtern korrekt schreibt, kann bei einem Absatz, einer Speisekarte oder einer Beschriftung in einer Sprache, die er beim Training seltener gesehen hat, trotzdem Schwierigkeiten haben.

Wo KI-Bildgeneratoren weiterhin Schwierigkeiten haben

  • Langer Text. Absätze, Speisekarten und Listen, bei denen jedes zusätzliche Wort eine weitere Fehlerquelle ist
  • Kleiner Text. Kleingedrucktes, Beschriftungen und Text weit hinten in einer Szene
  • Ungewöhnliche Wörter. Namen, erfundene Wörter, neue Begriffe und lange Zahlen wie Telefonnummern oder Codes
  • Nichtlateinische Schriften. Arabisch, Chinesisch, Hindi, Japanisch, Koreanisch, Thai und andere Schriftsysteme sowie Buchstaben mit Akzenten
  • Viele Textblöcke. Poster und Infografiken mit mehreren getrennten Textstücken
  • Gekrümmte oder schräge Flächen. Text auf einer Flasche, einer Fahne oder einem von der Seite gesehenen Schild
  • Einheitlichkeit. Denselben Wortlaut über eine Reihe von Bildern hinweg identisch halten

Das sind übliche Muster, keine festen Regeln, und sie unterscheiden sich von Generator zu Generator und von Version zu Version.

So bekommst du besseren Text, wenn du ein Bild erzeugst

  1. Setze die genauen Wörter in Anführungszeichen. Bitte zum Beispiel um ein Poster mit dem Titel „NIGHT MARKET“ statt um ein Poster über einen Nachtmarkt.
  2. Halte den Text kurz. Ein paar Wörter in großer Schrift gelingen leichter als ein ganzer Satz. Setze längeren Text stattdessen in eine Bildunterschrift oder auf eine Webseite.
  3. Sage, wohin der Text kommt. Beschreibe Platzierung und Größe, etwa „großer Titel quer über der Oberseite“ oder „kleines Etikett auf dem Glas“.
  4. Bitte um einfache Schrift. Kräftige, klare Großbuchstaben auf einer ruhigen Fläche kann ein Modell leichter zeichnen als dekorative Schreibschrift über einem unruhigen Hintergrund.
  5. Erzeuge mehrere Versionen. Erzeuge ein paar Varianten, wähle die mit der besten Schreibweise und korrigiere nur, was übrig bleibt.
  6. Füge exakten Text später hinzu, wenn es darauf ankommt. Erzeuge bei einer Speisekarte, einer Preisliste oder allem mit Kleingedrucktem das Bild mit leerem Platz und setze den Text in einem Design-Tool. So wird der Wortlaut getippt statt gezeichnet.

So korrigierst du den Text nachträglich

Wenn das Bild stimmt, die Wörter aber falsch sind, hast du vier Hauptoptionen. Hier stehen sie vom geringsten bis zum größten Aufwand.

MethodeAufwandWas sich sonst ändern kannAm besten, wenn
Das Bild neu erzeugenGeringAlles, denn du bekommst ein neues BildDas ganze Bild falsch ist oder dir der Verlust dieser Version nichts ausmacht
Im Generator auswählen und bearbeitenGeringNahe Bereiche können ebenfalls neu gezeichnet werdenDu eine schnelle Korrektur im selben Tool willst
KI-Tool zur TextersetzungGering bis mittelDer Textbereich wird neu gezeichnet, prüfe also das ErgebnisDas Bild stimmt und nur die Wörter falsch sind
Von Hand in einem Bildeditor korrigierenHochNur das, was du änderstDu volle Kontrolle brauchst, zum Beispiel für Druck oder Kundenarbeiten

Das Bild neu erzeugen

Das erneute Erzeugen kostet wenig Aufwand, aber das Ergebnis ist zufällig. Ein neuer Versuch kann das Wort korrigieren und etwas anderes kaputt machen, etwa ein Gesicht, eine Hand oder das Layout. Nutze es, wenn du noch nicht viel Zeit in genau dieses Bild gesteckt hast.

Im Generator auswählen und bearbeiten

Manche Generatoren lassen dich einen Bereich markieren und eine Änderung beschreiben. In ChatGPT kannst du zum Beispiel den Text mit einem Auswahlwerkzeug markieren und eintippen, was er sagen soll. Das Hilfecenter von OpenAI weist darauf hin, dass Markierungen nicht immer präzise sind, sodass sich auch Details in der Nähe des Textes ändern können. Näheres findest du unter Kann ChatGPT Text im Bild ändern?.

Ein KI-Tool zur Textersetzung nutzen

Ein Tool zur Textersetzung erkennt den Text im Bild für dich, sodass du nur die richtige Schreibweise eingeben musst. Bei EditText.ai zum Beispiel kannst du Text im Bild bearbeiten, Zeile für Zeile, und jede Zeile wird im Aussehen des ursprünglichen Schriftzugs und Hintergrunds neu gezeichnet. Bei einem einzelnen falschen Buchstaben oder Wort lies, wie du einen Tippfehler im Bild korrigieren kannst. Für Überschriften und auffällige Schriftzüge auf Veranstaltungsdesigns lies, wie du den Text auf einem Poster oder Flyer ändern kannst.

Vorher: KI-generierte Retro-Illustration einer New Yorker Straße bei Nacht mit einem hohen roten Neonschild, auf dem der Buchstabensalat NEYAHRD steht
Nachher: dieselbe Illustration, auf deren rotem Neonschild jetzt THEATER steht; die Skyline, die Taxis und die Überschrift NEW YORK sind unverändert

Vorher und nachher: ein verstümmeltes Neonschild in einem KI-Bild, korrigiert durch Eingabe von THEATER in EditText.ai.

Die Ergebnisse können variieren, besonders bei ungewöhnlichen Schriftzügen oder detailreichen Hintergründen. Weil auch das Neuzeichnen von einem Bildmodell übernommen wird, lies jedes neue Wort in voller Größe Buchstabe für Buchstabe. Jede Texterkennung kann verstümmelte Buchstaben außerdem falsch lesen; stelle daher sicher, dass jede erkannte Zeile diejenige ist, die du ändern wolltest.

Von Hand korrigieren

In Photoshop, Photopea oder einem ähnlichen Editor entfernst du die fehlerhaften Buchstaben, baust den Hintergrund wieder auf und setzt neuen Text in einer Schriftart. Das gibt dir die meiste Kontrolle und eignet sich für Druck- oder Kundenarbeiten, braucht aber Können und Zeit. KI-Schriftzüge sind oft keine echte Schriftart, sodass eine Schrifterkennung womöglich keinen Treffer findet. Lies Schriftart aus Bild erkennen – und wann du es dir sparen kannst, um zu erfahren, wie du einen ähnlichen Ersatz findest.

Eine einfache Regel hilft bei der Wahl: Ist das ganze Bild falsch, erzeuge es neu. Sind nur die Wörter falsch, korrigiere die Wörter.

Weitere Möglichkeiten

Du kannst auch Text aus einem Bild entfernen und auf dem sauberen Hintergrund in einem Design-Tool echten Text setzen – ein guter Ansatz für Speisekarten und Preislisten. Sobald der Wortlaut stimmt, kannst du Text im Bild übersetzen, um Versionen für andere Sprachen zu erstellen.

Bearbeite nur Bilder, die dir gehören oder die du ändern darfst, entferne keine Wasserzeichen oder Bildnachweise und behalte alle Kennzeichnungen für KI-Bilder bei, die eine Plattform verlangt.

Korrigiere die Wörter und behalte das Bild

Wenn das Bild stimmt, die Schreibweise aber nicht, musst du nicht von vorn beginnen. Lade es bei EditText.ai hoch, um Text in KI-Bildern zu korrigieren, gib für jede Zeile die richtigen Wörter ein und prüfe das Ergebnis, bevor du es herunterlädst.

Häufig gestellte Fragen

Warum macht KI bei Text in Bildern Fehler?

KI-Bildgeneratoren zeichnen Text als Formen, statt ihn als Buchstaben zu tippen, und viele lesen Prompts in Wortteilen statt in einzelnen Zeichen. Text ist außerdem ein kleines Detail mit strengen Regeln, sodass ein falscher Strich auffällt. Trainingsbilder zeigen Text oft klein, unscharf oder schräg, wodurch die Modelle weniger klare Beispiele zum Lernen haben.

Warum schreibt KI Buchstabensalat statt echter Wörter?

Wenn ein Modell nicht sicher ist, wie ein Wort geschrieben wird, zeichnet es trotzdem Formen, die wie Buchstaben aussehen, denn so sieht Text in seinen Trainingsbildern aus. Das Ergebnis können buchstabenähnliche Zeichen, vermischte Alphabete oder erfundene Wörter sein. Am häufigsten passiert das bei langem Text, kleiner Schrift und ungewöhnlichen Wörtern, seltener bei einer kurzen Wendung in Anführungszeichen.

Welcher KI-Bildgenerator ist bei Text am besten?

Eine dauerhafte Antwort gibt es nicht, denn Modelle ändern sich oft und jede neue Version kann sich anders verhalten. Im Allgemeinen kommen neuere Generatoren mit kurzem, großem Text besser zurecht als ältere. Der nützlichste Test ist dein eigener Prompt: Erzeuge dieselbe kurze Wendung in den Tools, auf die du Zugriff hast, und prüfe die Schreibweise Buchstabe für Buchstabe, bevor du dich für eines entscheidest.

Kann ich falsch geschriebenen Text in einem KI-Bild korrigieren, ohne es neu zu erzeugen?

Ja. Du kannst den Bereich auswählen und die Korrektur im selben Generator beschreiben, den Text in einem Editor wie Photoshop oder Photopea von Hand neu tippen oder ein Tool zur Textersetzung nutzen, das die Wörter erkennt, sodass du die richtige Schreibweise eingeben kannst. Egal, welche Methode du nutzt: Vergleiche das Ergebnis mit dem Original, um Änderungen in der Nähe des Textes zu bemerken.

Warum kann eine Schrifterkennung den Schriftzug in meinem KI-Bild nicht bestimmen?

KI-Generatoren zeichnen Schriftzüge meist nach gelernten Mustern und nicht aus einer installierten Schriftdatei. Die Buchstaben können Merkmale mehrerer Schriftarten mischen oder von Buchstabe zu Buchstabe ihre Form ändern. Eine Schrifterkennung kann trotzdem ähnliche Schriftarten vorschlagen, was hilft, wenn du den Text neu tippen willst, aber einen exakten Treffer gibt es oft nicht.