Yapay zekâ görsel oluşturucuları kelimeleri doğru yazmakta zorlanır, çünkü metin değil, resim çizerler. Harflerin piksel şekilleri ve desenleri olarak nasıl göründüğünü öğrenirler ve bir kelimeyi hiçbir zaman harf harf yazmazlar; bu yüzden küçük bir hata “FIRIN” kelimesini “FIRRIN” yapabilir. Birçoğu istemi de tek tek harfler yerine kelime parçaları hâlinde okur; bu da doğru yazımı daha da zorlaştırır.
Yeni oluşturucular kısa metni ilk nesillere göre çok daha iyi işler, ama uzun metinler, küçük harfler, alışılmadık isimler ve Latin dışı yazı sistemleri hâlâ hatalara yol açar. Bozuk kelimeli bir görseliniz zaten varsa çoğu zaman baştan başlamadan yapay zekâ görsellerindeki yazıyı düzeltebilirsiniz. Bu rehber, hataların neden ortaya çıktığını, daha iyi metin için istemin nasıl yazılacağını ve sonradan nasıl onarılacağını açıklıyor; görsel Midjourney'den, ChatGPT'den, Gemini'den, Stable Diffusion'dan ya da başka bir oluşturucudan gelmiş olsun.
Yapay zekâ görsel oluşturucuları bir resmi nasıl yapar?
Birçok popüler görsel oluşturucu difüzyon modeli denen bir yöntem kullanır. Model, ekrandaki karıncalanmaya benzer rastgele bir gürültüyle başlar ve birçok adımın her birinde bu gürültünün bir kısmını giderir. İsteminiz her adıma yön verir; böylece gürültü yavaş yavaş açıklamanızla eşleşen bir resme dönüşür. Görselin tamamı birlikte rafine edilir: gökyüzü, yüzler ve harfler aynı anda şekillenir.
Her oluşturucu bu şekilde çalışmaz. Bazıları görseli bunun yerine küçük parçaların bir dizisi olarak kurar. Ama genel olarak metinden görsel oluşturma modelleri önemli bir özelliği paylaşır: resmin nasıl görünmesi gerektiğini tahmin ederler. Modelin bir font seçip “F”, sonra “I”, sonra “R” yazdığı bir adım yoktur. Harfler yalnızca doğru görünen şekiller olarak belirir; bu yüzden neredeyse doğru ama tam değil çıkabilirler.
Metin görsel oluşturucular için neden bu kadar zor?
Birkaç neden birlikte iş görür. Her biri küçük bir hatayı daha olası kılar ve metin, küçük hataların kolayca görüldüğü bir yerdir.
Harfler katı kuralları olan küçük ayrıntılardır
Bir ağacın kaç dalı olursa olsun yine ağaca benzer. Bir kelimenin ise tam olarak tek bir doğru yazımı vardır. Metnin ayrıca kelimenin tamamına uygulanan kuralları da vardır: her harfin aynı stilde ve yükseklikte olması, aralığın eşit olması ve harflerin aynı çizgide durması gerekir. Fazladan bir çizgi, eksik bir harf ya da ikilenmiş bir harf, görselin geri kalanı gerçek görünse bile dili okuyan herkes için bellidir.
Model yazdığınız harfleri hiç görmeyebilir
Bir oluşturucu isteminizi kullanabilmeden önce metin kodlayıcı denen bir bileşen onu sayılara dönüştürür. Birçok metin kodlayıcı istemi önce token'lara böler. Yaygın kelimeler çoğu zaman tek bir token olur, daha nadir kelimeler ise birkaç parçaya ayrılır. Bu parçaları oluşturmak için yaygın kullanılan bir yöntem bayt çifti kodlamasıdır (byte-pair encoding). Yaklaşım verimlidir, ama model her parça için içindeki harfleri değil, bir kimlik numarası alır. Belirli bir parçanın belirli bir harf dizisi olarak çizildiğini örneklerden öğrenmesi gerekir.
Bir Google Research makalesi, Character-Aware Models Improve Visual Text Rendering, bunu doğrudan inceledi. Araştırmacılar, tek tek karakterleri gören metin kodlayıcıları (“karaktere duyarlı”) yalnızca kelime parçalarını gören kodlayıcılarla (“karaktere kör”) karşılaştırdı. Karaktere duyarlı kodlayıcılı görsel modeller görsel metni daha doğru çizdi ve özellikle nadir kelimelerde güçlüydü. Makale ayrıca çok büyük karaktere kör dil modellerinin iyi yazım öğrenebildiğini, ama bu yeteneğin İngilizcenin ötesine pek geçmediğini ve yalnızca görsel oluşturucuların o dönemde tipik olarak kullandığı metin kodlayıcılardan çok daha büyük modellerde ortaya çıktığını buldu.
Eğitim görselleri metni çoğu zaman kötü gösterir
Oluşturucular, açıklamalarla eşleştirilmiş çok büyük görsel koleksiyonlarından öğrenir. Bu görsellerde metin çoğu zaman küçük, bulanık, kesik, açılı ya da kısmen gizlidir ve çok geniş bir yelpazede fontlar ve stillerle karşımıza çıkar. Bir görselle eşleştirilen açıklama o görseldeki metinden hiç söz etmeyebilir. Böylece model, metnin genel olarak neye benzediğine dair çok sayıda örnek görür, ama belirli bir kelimenin tam olarak nasıl yazılması gerektiğine dair daha az net örnek.
Küçük metnin çok az pikseli vardır
Bir başlık yüzlerce piksele yayılabilirken ince yazıdaki bir kelime harf başına yalnızca birkaç piksel alabilir. Birçok oluşturucu ayrıca görselin sıkıştırılmış bir sürümü üzerinde çalışır ve tam boyutlu resmi en sonda yeniden kurar; bu da küçük ayrıntılara daha da az yer bırakır. Küçük “e” harfindeki çizgi gibi ince çizgiler kolayca kaybolur.
Yeni modeller metni neden daha iyi yazar?
Görsel oluşturucular kısa başlıklarda ve etiketlerde çok daha iyi hâle geldi. Genel olarak yeni sistemler istemi anlamak için daha güçlü dil modelleri kullanıyor ve geliştiriciler eğitim sırasında metne daha fazla önem verdi. Yukarıdaki araştırma da aynı yönü gösteriyor: harfler hakkında daha iyi bilgi alan modeller metni daha doğru çiziyor.
İyileşme gerçek ama düzensizdir. Üç kelimelik bir başlığı doğru yazan bir oluşturucu, bir paragrafta, bir menüde ya da eğitim sırasında daha az gördüğü bir dildeki etiketle yine de zorlanabilir.
Yapay zekâ görsel oluşturucuları hâlâ nerede zorlanır?
- Uzun metin. Her ek kelimenin bir hata şansı daha olduğu paragraflar, menüler ve listeler
- Küçük metin. İnce yazılar, etiketler ve bir sahnede uzakta duran metin
- Alışılmadık kelimeler. İsimler, uydurma kelimeler, yeni terimler ve telefon numaraları ya da kodlar gibi uzun sayılar
- Latin dışı yazı sistemleri. Arapça, Çince, Hintçe, Japonca, Korece, Tayca ve diğer yazı sistemleri ile aksanlı harfler
- Çok sayıda metin bloğu. Birkaç ayrı metin parçası içeren afişler ve infografikler
- Kavisli ya da açılı yüzeyler. Bir şişe, bir bayrak ya da yandan görünen bir tabela üzerindeki metin
- Tutarlılık. Bir görsel serisi boyunca aynı ifadeyi birebir aynı tutmak
Bunlar sabit kurallar değil, yaygın örüntülerdir ve bir oluşturucudan ve sürümden diğerine değişir.
Görsel oluştururken daha iyi metin nasıl elde edilir?
- Tam kelimeleri tırnak içine alın. Örneğin gece pazarı hakkında bir afiş istemek yerine “GECE PAZARI” başlıklı bir afiş isteyin.
- Metni kısa tutun. Büyük boyutlu birkaç kelimeyi doğru elde etmek, tam bir cümleden daha kolaydır. Daha uzun metni bunun yerine bir altyazıya ya da bir web sayfasına koyun.
- Metnin nereye gideceğini söyleyin. Yerleşimi ve boyutu tarif edin; örneğin “üst kısımda büyük bir başlık” ya da “kavanozun üzerinde küçük etiket”.
- Sade harfler isteyin. Sade bir alandaki kalın, temiz büyük harfleri çizmek, bir model için karmaşık bir arka plandaki dekoratif el yazısı harfleri çizmekten daha kolaydır.
- Birkaç sürüm üretin. Birkaç seçenek oluşturun, en iyi yazıma sahip olanı seçin ve yalnızca kalanı düzeltin.
- Önemli olduğunda tam metni sonradan ekleyin. Bir menü, bir fiyat listesi ya da ince yazılı herhangi bir şey için görseli boş alanla oluşturun ve metni bir tasarım aracında dizin. Böylece ifade çizilmez, yazılır.
Metin sonradan nasıl düzeltilir?
Resim doğru ama kelimeler yanlışsa dört ana seçeneğiniz var. Aşağıda onları en az emekten en çok emeğe doğru sıraladık.
| Yöntem | Emek | Başka ne değişebilir | En uygun olduğu durum |
|---|---|---|---|
| Görseli yeniden oluşturma | Düşük | Her şey, çünkü yeni bir resim elde edersiniz | Görselin tamamı yanlışsa ya da bu sürümü kaybetmeniz sorun değilse |
| Oluşturucuda seçip düzenleme | Düşük | Yakındaki alanlar da yeniden çizilebilir | Aynı araçta hızlı bir düzeltme istiyorsanız |
| Yapay zekâyla metin değiştirme aracı | Düşük ile orta arası | Metin alanı yeniden çizilir, bu yüzden sonucu kontrol edin | Resim doğru ve yalnızca kelimeler yanlışsa |
| Bir görsel düzenleyicide elle düzeltme | Yüksek | Yalnızca değiştirdiğiniz şey | Tam kontrole ihtiyacınız varsa; örneğin baskı ya da müşteri işi için |
Görseli yeniden oluşturun
Yeniden oluşturmak az emek ister, ama sonuç rastgeledir. Yeni bir deneme kelimeyi düzeltip yüz, el ya da yerleşim gibi başka bir şeyi bozabilir. Bu görsel üzerinde henüz çok zaman harcamadıysanız bu yolu seçin.
Oluşturucunun içinde seçip düzenleyin
Bazı oluşturucular bir alanı işaretleyip bir değişikliği anlatmanıza izin verir. Örneğin ChatGPT'de metni bir seçim aracıyla vurgulayıp ne yazması gerektiğini yazabilirsiniz. OpenAI yardım merkezi, vurguların her zaman kesin olmadığını, bu yüzden yazının yakınındaki ayrıntıların da değişebileceğini belirtiyor. Daha yakından bakmak için ChatGPT resimdeki yazıyı değiştirebilir mi yazısına bakın.
Yapay zekâyla metin değiştirme aracı kullanın
Bir metin değiştirme aracı görseldeki metni sizin için algılar; böylece yalnızca doğru yazımı yazarsınız. Örneğin EditText.ai ile resimdeki yazıyı satır satır değiştirirsiniz ve her satır özgün harflerin ve arka planın görünümünde yeniden çizilir. Tek bir yanlış harf ya da kelime için resimdeki yazım hatasını nasıl düzelteceğinize bakın. Etkinlik tasarımlarındaki başlıklar ve gösterişli yazılar için afişteki yazıyı nasıl değiştireceğinize bakın.


Önce ve sonra: bir yapay zekâ görselindeki bozuk neon tabela, EditText.ai'de THEATER yazılarak düzeltildi.
Sonuçlar, özellikle alışılmadık harflerde veya ayrıntılı arka planlarda değişebilir. Yeniden çizimi de bir görsel model yaptığı için her yeni kelimeyi tam boyutta harf harf okuyun. Metin algılama da bozuk harfleri yanlış okuyabilir; bu yüzden algılanan her satırın değiştirmek istediğiniz satır olduğundan emin olun.
Elle düzeltin
Photoshop'ta, Photopea'da ya da benzer bir düzenleyicide bozuk harfleri silersiniz, arka planı yeniden oluşturursunuz ve yeni metni bir fontla dizersiniz. Bu size en fazla kontrolü verir ve baskı ya da müşteri işine uygundur, ama beceri ve zaman ister. Yapay zekâ harfleri çoğu zaman gerçek bir font değildir; bu yüzden bir font bulucu eşleşme bulamayabilir. Yakın bir alternatif bulmanın yolları için resimden font bulma rehberini okuyun.
Basit bir kural seçmenize yardımcı olur: görselin tamamı yanlışsa yeniden oluşturun. Yalnızca kelimeler yanlışsa kelimeleri düzeltin.
Diğer seçenekler
Resimden yazıyı tamamen silip temiz arka planın üzerine bir tasarım aracında gerçek yazı dizebilirsiniz; bu, menüler ve fiyat listeleri için iyi bir yaklaşımdır. İfade doğru olduktan sonra diğer diller için sürümler yapmak üzere resimdeki yazıyı çevirebilirsiniz.
Yalnızca size ait olan ya da değiştirme izniniz bulunan görselleri düzenleyin, filigranları ve kaynak belirtmelerini silmeyin ve bir platformun gerektirdiği yapay zekâ görseli etiketlerini koruyun.
Kelimeleri düzeltin, resmi koruyun
Görsel doğru ama yazım yanlışsa baştan başlamanız gerekmez. EditText.ai ile yapay zekâ görsellerindeki yazıyı düzeltmek için yükleyin, her satır için doğru kelimeleri yazın ve indirmeden önce sonucu kontrol edin.
Sık sorulan sorular
Yapay zekâ görsellerdeki yazıyı neden bozuyor?
Yapay zekâ görsel oluşturucuları metni harf olarak yazmak yerine şekil olarak çizer ve birçoğu istemleri tek tek karakterler yerine kelime parçaları hâlinde okur. Metin ayrıca katı kuralları olan küçük bir ayrıntıdır; bu yüzden tek bir yanlış çizgi göze çarpar. Eğitim görselleri çoğu zaman küçük, bulanık ya da açılı metin gösterir; bu da modellere öğrenebilecekleri daha az net örnek verir.
Yapay zekâ neden gerçek kelimeler yerine anlamsız harfler yazıyor?
Bir model bir kelimenin nasıl yazıldığından emin olmadığında yine de harfe benzeyen şekiller çizer; çünkü eğitim görsellerinde metin böyle görünür. Sonuç harfe benzeyen işaretler, karışık alfabeler ya da uydurma kelimeler olabilir. En çok uzun metinde, küçük harflerde ve alışılmadık kelimelerde olur; tırnak içindeki kısa bir ifadede daha az görülür.
Metinde en iyi yapay zekâ görsel oluşturucusu hangisi?
Kalıcı bir yanıt yoktur, çünkü modeller sık değişir ve her yeni sürüm farklı davranabilir. Genel olarak son dönem oluşturucular kısa ve büyük metni eskilerden daha iyi işler. En yararlı test kendi isteminizdir: erişebildiğiniz araçlarda aynı kısa ifadeyi oluşturun, sonra birini seçmeden önce yazımı harf harf kontrol edin.
Yapay zekâ görselindeki yanlış yazılmış metni yeniden oluşturmadan düzeltebilir miyim?
Evet. Aynı oluşturucuda alanı seçip düzeltmeyi anlatabilir, metni Photoshop ya da Photopea gibi bir düzenleyicide elle yeniden yazabilir ya da kelimeleri algılayan ve doğru yazımı yazmanıza izin veren bir metin değiştirme aracı kullanabilirsiniz. Hangi yöntemi kullanırsanız kullanın yazının yakınındaki değişiklikleri yakalamak için sonucu orijinalle karşılaştırın.
Font bulucu yapay zekâ görselimdeki harfleri neden tanıyamıyor?
Yapay zekâ oluşturucuları harfleri genellikle yüklü bir font dosyasından değil, öğrendikleri örüntülerden çizer. Harfler birkaç yazı tipinin özelliklerini karıştırabilir ya da bir harften diğerine şekil değiştirebilir. Bir font tanıma aracı yine de benzer fontlar önerebilir; metni yeniden yazmayı planlıyorsanız bu işe yarar, ama birebir eşleşme çoğu zaman yoktur.