edittext.ai

Dlaczego generatory obrazów AI nie umieją pisać (i jak to naprawić)

Dlaczego generatory obrazów AI nie umieją pisać? Rysują litery jako kształty, a nie tekst. Poznaj przyczyny przekręconych słów i sposoby ich naprawy.

Generatory obrazów AI mają kłopoty z pisownią, bo rysują obrazy, a nie tekst. Uczą się, jak wyglądają litery jako kształty i wzory pikseli, i nigdy nie wpisują słowa litera po literze, więc drobna pomyłka może zamienić „BAKERY” w „BAKRERY”. Wiele z nich czyta też Twój prompt w kawałkach wyrazów, a nie w pojedynczych literach, co jeszcze utrudnia dokładną pisownię.

Nowsze generatory radzą sobie z krótkim tekstem znacznie lepiej niż wczesne, ale długie fragmenty, drobne liternictwo, nietypowe nazwy i pisma nielacińskie nadal powodują błędy. Jeśli masz już obraz z zepsutymi słowami, często możesz poprawić tekst na obrazach wygenerowanych przez AI bez zaczynania od nowa. Ten poradnik wyjaśnia, skąd biorą się błędy, jak pisać prompty, by uzyskać lepszy tekst, i jak go później naprawić, niezależnie od tego, czy obraz pochodzi z Midjourney, ChatGPT, Gemini, Stable Diffusion czy innego generatora.

Jak generatory obrazów AI tworzą obraz

Wiele popularnych generatorów obrazów używa metody zwanej modelem dyfuzyjnym. Model zaczyna od losowego szumu, podobnego do zakłóceń na ekranie, i w każdym z wielu kroków usuwa jego niewielką część. Twój prompt kieruje każdym krokiem, więc szum powoli zamienia się w obraz zgodny z opisem. Cały obraz jest dopracowywany jednocześnie: niebo, twarze i liternictwo nabierają kształtu w tym samym czasie.

Nie każdy generator działa w ten sposób. Niektóre budują obraz jako ciąg małych fragmentów. Ale ogólnie modele generujące obrazy na podstawie tekstu mają jedną ważną cechę wspólną: przewidują, jak powinien wyglądać obraz. Nie ma kroku, w którym model wybiera czcionkę i wpisuje „B”, potem „A”, potem „K”. Litery pojawiają się wyłącznie jako kształty, które wyglądają dobrze, dlatego mogą wyjść prawie dobrze, ale nie całkiem.

Dlaczego tekst jest tak trudny dla generatorów obrazów

Działa tu kilka przyczyn naraz. Każda z nich zwiększa prawdopodobieństwo drobnego błędu, a tekst to miejsce, w którym drobne błędy łatwo zauważyć.

Litery to drobne szczegóły o ścisłych zasadach

Drzewo może mieć dowolną liczbę gałęzi i nadal wygląda jak drzewo. Słowo ma dokładnie jedną poprawną pisownię. Tekst podlega też zasadom obowiązującym w całym słowie: każda litera musi mieć ten sam styl i wysokość, odstępy muszą być równe, a litery muszą leżeć na tej samej linii. Jedna dodatkowa kreska, brakująca litera albo podwojona litera są oczywiste dla każdego, kto czyta dany język, nawet gdy reszta obrazu wygląda realistycznie.

Model może w ogóle nie widzieć wpisanych liter

Zanim generator może użyć Twojego promptu, komponent zwany koderem tekstu zamienia go na liczby. Wiele koderów tekstu najpierw dzieli prompt na tokeny. Popularne słowa często stają się jednym tokenem, a rzadsze są rozbijane na kilka fragmentów. Powszechnie stosowaną metodą tworzenia takich fragmentów jest kodowanie par bajtów (byte-pair encoding). Takie podejście jest wydajne, ale model dostaje identyfikator każdego fragmentu, a nie litery, które się w nim mieszczą. Musi uczyć się na przykładach, że dany fragment rysuje się jako określony ciąg liter.

Artykuł naukowy Google Research, Character-Aware Models Improve Visual Text Rendering, zbadał to bezpośrednio. Badacze porównali kodery tekstu, które widzą pojedyncze znaki („świadome znaków”), z koderami widzącymi tylko fragmenty słów („ślepe na znaki”). Modele obrazu z koderami świadomymi znaków odtwarzały tekst na obrazie dokładniej i były szczególnie mocne przy rzadkich słowach. Artykuł wykazał też, że bardzo duże modele językowe ślepe na znaki mogą nauczyć się dobrej pisowni, ale ta zdolność nie przenosiła się dobrze poza angielski i pojawiała się tylko w modelach znacznie większych niż kodery tekstu, których generatory obrazów zwykle używały w tamtym czasie.

Obrazy treningowe często słabo pokazują tekst

Generatory uczą się na bardzo dużych zbiorach obrazów sparowanych z opisami. Na tych obrazach tekst jest często mały, rozmyty, ucięty, widziany pod kątem lub częściowo zasłonięty i występuje w ogromnej różnorodności czcionek i stylów. Opis dołączony do obrazu może w ogóle nie wspominać o jego tekście. Model widzi więc wiele przykładów tego, jak ogólnie wygląda tekst, ale mniej wyraźnych przykładów tego, jak dokładnie powinno się pisać konkretne słowo.

Drobny tekst ma bardzo mało pikseli

Nagłówek może zajmować setki pikseli, podczas gdy słowo z drobnego druku może mieć tylko kilka pikseli na literę. Wiele generatorów pracuje też na skompresowanej wersji obrazu i dopiero na końcu odtwarza obraz w pełnym rozmiarze, co zostawia jeszcze mniej miejsca na drobne szczegóły. Cienkie linie, takie jak poprzeczka w małej literze „e”, łatwo zgubić.

Dlaczego nowsze modele piszą lepszy tekst

Generatory obrazów stały się znacznie lepsze w krótkich nagłówkach i etykietach. Ogólnie nowsze systemy używają silniejszych modeli językowych do rozumienia promptu, a twórcy poświęcają tekstowi więcej uwagi podczas treningu. Wspomniane badania wskazują ten sam kierunek: modele, które otrzymują lepsze informacje o literach, rysują tekst dokładniej.

Poprawa jest realna, ale nierówna. Generator, który poprawnie napisze tytuł z trzech słów, nadal może mieć kłopoty z akapitem, menu lub etykietą w języku, który rzadziej widział podczas treningu.

Z czym generatory obrazów AI nadal sobie nie radzą

  • Długi tekst. Akapity, menu i listy, gdzie każde dodatkowe słowo to kolejna szansa na błąd
  • Drobny tekst. Drobny druk, etykiety i tekst daleko w głębi sceny
  • Nietypowe słowa. Nazwy, wymyślone słowa, nowe terminy i długie liczby, takie jak numery telefonów czy kody
  • Pisma nielacińskie. Arabskie, chińskie, hindi, japońskie, koreańskie, tajskie i inne systemy pisma, a także litery ze znakami diakrytycznymi
  • Wiele bloków tekstu. Plakaty i infografiki z kilkoma oddzielnymi fragmentami tekstu
  • Zakrzywione lub ustawione pod kątem powierzchnie. Tekst na butelce, fladze lub znaku widzianym z boku
  • Spójność. Utrzymanie identycznego brzmienia w serii obrazów

To częste wzorce, a nie sztywne reguły, i różnią się między generatorami oraz ich wersjami.

Jak uzyskać lepszy tekst podczas generowania obrazu

  1. Ujmij dokładne słowa w cudzysłów. Na przykład poproś o plakat z tytułem „NIGHT MARKET”, a nie o plakat o nocnym targu.
  2. Pisz krótko. Kilka słów dużą czcionką łatwiej uzyskać poprawnie niż całe zdanie. Dłuższy tekst umieść raczej w podpisie lub na stronie internetowej.
  3. Powiedz, gdzie ma być tekst. Opisz położenie i rozmiar, na przykład „duży tytuł u góry” albo „mała etykieta na słoiku”.
  4. Poproś o proste liternictwo. Pogrubione, czyste wersaliki na jednolitym polu modelowi łatwiej narysować niż ozdobne pismo kaligraficzne na zagęszczonym tle.
  5. Wygeneruj kilka wersji. Wygeneruj kilka opcji, wybierz tę z najlepszą pisownią i popraw tylko to, co zostanie.
  6. Gdy to ważne, dodaj dokładny tekst później. W przypadku menu, cennika lub czegokolwiek z drobnym drukiem wygeneruj obraz z pustym miejscem i ułóż tekst w programie graficznym. Wtedy brzmienie jest wpisane, a nie narysowane.

Jak później naprawić tekst

Jeśli obraz jest dobry, ale słowa są błędne, masz cztery główne opcje. Oto one, uszeregowane od najmniej do najbardziej pracochłonnej.

MetodaWysiłekCo jeszcze może się zmienićNajlepsza, gdy
Wygenerowanie obrazu od nowaNiskiWszystko, bo dostajesz nowy obrazCały obraz jest zły albo nie szkoda Ci tej wersji
Zaznaczenie i edycja w generatorzeNiskiPobliskie obszary mogą zostać przerysowaneChcesz szybkiej poprawki w tym samym narzędziu
Narzędzie do zamiany tekstu z AINiski do średniegoObszar tekstu jest przerysowywany, więc sprawdź wynikObraz jest dobry i tylko słowa są błędne
Ręczna poprawka w edytorze obrazówWysokiTylko to, co zmieniszPotrzebujesz pełnej kontroli, na przykład przy pracach do druku lub dla klientów

Wygeneruj obraz od nowa

Ponowne generowanie wymaga niewiele wysiłku, ale wynik jest losowy. Nowa próba może naprawić słowo i zepsuć coś innego, na przykład twarz, dłoń lub układ. Sięgnij po to, gdy w ten konkretny obraz nie włożono jeszcze dużo czasu.

Zaznacz i edytuj w generatorze

Niektóre generatory pozwalają zaznaczyć obszar i opisać zmianę. W ChatGPT możesz na przykład zaznaczyć tekst narzędziem zaznaczania i wpisać, co ma być napisane. Centrum pomocy OpenAI zaznacza, że zaznaczenia nie zawsze są precyzyjne, więc szczegóły w pobliżu tekstu również mogą się zmienić. Aby przyjrzeć się temu dokładniej, zobacz czy ChatGPT może edytować tekst na zdjęciu.

Użyj narzędzia do zamiany tekstu z AI

Narzędzie do zamiany tekstu wykrywa tekst na obrazie za Ciebie, więc wpisujesz tylko poprawną pisownię. W EditText.ai możesz na przykład edytować tekst na zdjęciu wiersz po wierszu, a każdy wiersz jest przerysowywany w wyglądzie oryginalnego liternictwa i tła. Przy pojedynczej błędnej literze lub słowie zobacz, jak poprawić literówkę na obrazie. W przypadku nagłówków i ozdobnego liternictwa na projektach wydarzeń zobacz, jak zmienić tekst na plakacie.

Przed: wygenerowana przez AI ilustracja w stylu retro przedstawiająca nocną ulicę w Nowym Jorku, z wysokim czerwonym neonem z bezsensownym napisem NEYAHRD
Po: ta sama ilustracja z czerwonym neonem, na którym teraz widnieje THEATER, a panorama miasta, taksówki i nagłówek NEW YORK pozostały bez zmian

Przed i po: przekręcony neon na obrazie AI, poprawiony przez wpisanie THEATER w EditText.ai.

Wyniki mogą się różnić, zwłaszcza przy nietypowym liternictwie lub szczegółowych tłach. Ponieważ przerysowanie również wykonuje model obrazu, przeczytaj każde nowe słowo litera po literze w pełnym rozmiarze. Każde wykrywanie tekstu może też błędnie odczytać przekręcone litery, więc upewnij się, że każdy wykryty wiersz jest tym, który miał zostać zmieniony.

Popraw ręcznie

W Photoshopie, Photopea lub podobnym edytorze usuwasz zepsute litery, odtwarzasz tło i składasz nowy tekst wybraną czcionką. Daje to największą kontrolę i nadaje się do prac do druku lub dla klientów, ale wymaga umiejętności i czasu. Liternictwo z AI często nie jest prawdziwą czcionką, więc wyszukiwarka czcionek może nie znaleźć dopasowania. Przeczytaj, jak rozpoznać czcionkę ze zdjęcia, aby poznać sposoby na znalezienie bliskiego zamiennika.

Prosta zasada pomaga wybrać: jeśli cały obraz jest zły, wygeneruj go od nowa. Jeśli błędne są tylko słowa, popraw słowa.

Inne opcje

Możesz też całkowicie usunąć tekst ze zdjęcia i ułożyć prawdziwy tekst na czystym tle w programie graficznym, co jest dobrym podejściem do menu i cenników. Gdy brzmienie jest już poprawne, możesz przetłumaczyć tekst na zdjęciu, aby przygotować wersje w innych językach.

Edytuj tylko obrazy, które należą do Ciebie lub które masz pozwolenie zmieniać, nie usuwaj znaków wodnych ani informacji o twórcach i zachowuj wszelkie oznaczenia obrazów AI, których wymaga dana platforma.

Popraw słowa i zachowaj obraz

Jeśli obraz jest dobry, ale pisownia błędna, nie musisz zaczynać od nowa. Prześlij go do EditText.ai, aby poprawić tekst na obrazach AI, wpisz poprawne słowa dla każdego wiersza i sprawdź wynik przed pobraniem.

Najczęściej zadawane pytania

Dlaczego AI psuje tekst na obrazach?

Generatory obrazów AI rysują tekst jako kształty zamiast wpisywać go jako litery, a wiele z nich czyta prompty w kawałkach wyrazów, a nie w pojedynczych znakach. Tekst to też drobny szczegół o ścisłych zasadach, więc jedna błędna kreska rzuca się w oczy. Obrazy treningowe często pokazują tekst, który jest mały, rozmyty lub widziany pod kątem, co daje modelom mniej wyraźnych przykładów do nauki.

Dlaczego AI pisze bełkot zamiast prawdziwych słów?

Gdy model nie jest pewien, jak pisze się dane słowo, i tak rysuje kształty przypominające litery, bo tak wygląda tekst na jego obrazach treningowych. Wynikiem mogą być znaki podobne do liter, pomieszane alfabety lub wymyślone słowa. Dzieje się tak najczęściej przy długim tekście, drobnym liternictwie i nietypowych słowach, a rzadziej przy krótkiej frazie w cudzysłowie.

Który generator obrazów AI najlepiej radzi sobie z tekstem?

Nie ma trwałej odpowiedzi, bo modele często się zmieniają, a każda nowa wersja może zachowywać się inaczej. Ogólnie nowsze generatory lepiej radzą sobie z krótkim, dużym tekstem niż starsze. Najbardziej przydatnym testem jest Twój własny prompt: wygeneruj tę samą krótką frazę w dostępnych narzędziach, a potem sprawdź pisownię litera po literze, zanim jedno wybierzesz.

Czy mogę poprawić błędnie napisany tekst na obrazie AI bez ponownego generowania?

Tak. Możesz zaznaczyć obszar i opisać poprawkę w tym samym generatorze, wpisać tekst ręcznie w edytorze takim jak Photoshop lub Photopea albo użyć narzędzia do zamiany tekstu, które wykrywa słowa, by można było wpisać poprawną pisownię. Niezależnie od wybranej metody porównaj wynik z oryginałem, aby wychwycić zmiany w pobliżu tekstu.

Dlaczego wyszukiwarka czcionek nie rozpoznaje liternictwa na moim obrazie AI?

Generatory AI zwykle rysują liternictwo na podstawie wzorców, których się nauczyły, a nie z zainstalowanego pliku czcionki. Litery mogą łączyć cechy kilku krojów pisma albo zmieniać kształt z jednej litery na drugą. Narzędzie do rozpoznawania czcionek może mimo to podpowiedzieć podobne czcionki, co pomaga, jeśli planujesz wpisać tekst ponownie, ale dokładne dopasowanie często nie istnieje.