edittext.ai

Kenapa generator gambar AI salah eja (dan cara memperbaikinya)

Kenapa gambar AI salah eja? Generator menggambar huruf sebagai bentuk, bukan teks. Pelajari penyebab kata kacau dan cara praktis memperbaikinya.

Generator gambar AI kesulitan mengeja karena yang mereka buat adalah gambar, bukan teks. Mereka belajar seperti apa rupa huruf sebagai bentuk dan pola piksel, dan tidak pernah mengetik sebuah kata huruf demi huruf, sehingga satu kesalahan kecil bisa mengubah “BAKERY” menjadi “BAKRERY”. Banyak generator juga membaca prompt Anda dalam potongan kata, bukan huruf demi huruf, sehingga ejaan yang tepat jadi semakin sulit.

Generator yang lebih baru menangani teks pendek jauh lebih baik daripada generator awal, tetapi paragraf panjang, tulisan kecil, nama yang tidak lazim, dan aksara non-Latin masih menimbulkan kesalahan. Jika Anda sudah punya gambar dengan kata yang rusak, Anda sering kali bisa memperbaiki tulisan di gambar buatan AI tanpa mulai dari awal. Panduan ini menjelaskan kenapa kesalahan itu terjadi, cara menulis prompt untuk teks yang lebih baik, dan cara memperbaikinya setelahnya, baik gambarnya berasal dari Midjourney, ChatGPT, Gemini, Stable Diffusion, maupun generator lain.

Cara generator gambar AI membuat gambar

Banyak generator gambar populer memakai metode yang disebut model difusi (diffusion model). Model memulai dari noise acak, mirip bintik-bintik statis di layar televisi, lalu menghilangkan sedikit noise itu di setiap langkah dari banyak langkah. Prompt Anda memandu setiap langkah, sehingga noise itu perlahan berubah menjadi gambar yang sesuai dengan deskripsi Anda. Seluruh gambar diperhalus bersama-sama: langit, wajah, dan huruf semuanya terbentuk pada saat yang sama.

Tidak semua generator bekerja dengan cara ini. Sebagian membangun gambar sebagai rangkaian potongan kecil. Tetapi pada umumnya, model teks-ke-gambar punya satu sifat penting yang sama: mereka memprediksi seperti apa tampilan gambar akhirnya. Tidak ada langkah di mana model memilih font lalu mengetik “B”, lalu “A”, lalu “K”. Huruf hanya muncul sebagai bentuk yang kelihatannya benar, dan itulah sebabnya hasilnya bisa hampir benar tetapi tidak tepat.

Kenapa teks begitu sulit bagi generator gambar

Ada beberapa penyebab yang saling berkaitan. Masing-masing membuat kesalahan kecil lebih mungkin terjadi, dan teks adalah tempat kesalahan kecil mudah terlihat.

Huruf adalah detail kecil dengan aturan ketat

Pohon bisa memiliki cabang sebanyak apa pun dan tetap terlihat seperti pohon. Sebuah kata hanya punya satu ejaan yang benar. Teks juga punya aturan yang berlaku di seluruh kata: setiap huruf harus memiliki gaya dan tinggi yang sama, jaraknya harus rata, dan huruf-hurufnya harus berada di garis yang sama. Satu goresan berlebih, huruf yang hilang, atau huruf ganda langsung tampak bagi siapa pun yang bisa membaca bahasa itu, bahkan saat bagian lain dari gambar terlihat nyata.

Model mungkin tidak pernah melihat huruf yang Anda ketik

Sebelum generator bisa memakai prompt Anda, komponen bernama text encoder mengubahnya menjadi angka. Banyak text encoder lebih dulu memecah prompt menjadi token. Kata yang umum sering menjadi satu token, sedangkan kata yang lebih jarang dipecah menjadi beberapa potongan. Metode yang banyak dipakai untuk membentuk potongan ini adalah byte-pair encoding. Pendekatan ini efisien, tetapi model menerima ID untuk setiap potongan, bukan huruf-huruf di dalamnya. Model harus belajar dari contoh bahwa potongan tertentu digambar sebagai deretan huruf tertentu.

Makalah Google Research, Character-Aware Models Improve Visual Text Rendering, meneliti hal ini secara langsung. Para peneliti membandingkan text encoder yang melihat karakter satu per satu (“character-aware”) dengan encoder yang hanya melihat potongan kata (“character-blind”). Model gambar dengan encoder character-aware merender teks visual dengan lebih akurat, dan sangat unggul pada kata-kata yang jarang muncul. Makalah itu juga menemukan bahwa model bahasa character-blind yang sangat besar bisa belajar mengeja dengan baik, tetapi kemampuan itu kurang terbawa ke luar bahasa Inggris dan hanya muncul pada model yang jauh lebih besar daripada text encoder yang biasa dipakai generator gambar pada masa itu.

Gambar pelatihan sering menampilkan teks secara kurang jelas

Generator belajar dari koleksi gambar berskala sangat besar yang dilengkapi deskripsi. Pada gambar-gambar itu, teks sering kecil, buram, terpotong, terlihat dari sudut miring, atau tertutup sebagian, dan muncul dalam beragam font dan gaya. Deskripsi yang menyertai sebuah gambar mungkin tidak menyebut teksnya sama sekali. Jadi model melihat banyak contoh tentang rupa teks secara umum, tetapi lebih sedikit contoh yang jelas tentang bagaimana sebuah kata tertentu seharusnya dieja.

Teks kecil hanya punya sedikit piksel

Sebuah judul bisa membentang ratusan piksel, sedangkan satu kata dalam tulisan halus mungkin hanya mendapat beberapa piksel per huruf. Banyak generator juga bekerja pada versi gambar yang terkompresi dan membangun ulang gambar ukuran penuh di akhir, sehingga ruang untuk detail kecil semakin sempit. Garis halus, seperti palang pada huruf kecil “e”, mudah hilang.

Kenapa model yang lebih baru menulis teks lebih baik

Generator gambar kini jauh lebih pandai menulis judul dan label yang pendek. Secara umum, sistem yang lebih baru memakai model bahasa yang lebih kuat untuk memahami prompt, dan pengembangnya memberi perhatian lebih besar pada teks selama pelatihan. Penelitian di atas menunjuk ke arah yang sama: model yang mendapat informasi lebih baik tentang huruf menggambar teks dengan lebih akurat.

Peningkatannya nyata tetapi tidak merata. Generator yang menulis judul tiga kata dengan benar masih bisa kesulitan dengan paragraf, menu, atau label dalam bahasa yang lebih jarang dilihatnya selama pelatihan.

Di mana generator gambar AI masih kesulitan

  • Teks panjang. Paragraf, menu, dan daftar, yang setiap tambahan katanya menambah satu peluang kesalahan
  • Teks kecil. Tulisan halus, label, dan teks yang jauh di dalam sebuah adegan
  • Kata yang tidak lazim. Nama, kata rekaan, istilah baru, dan angka panjang seperti nomor telepon atau kode
  • Aksara non-Latin. Arab, Tionghoa, Hindi, Jepang, Korea, Thai, dan sistem tulisan lainnya, serta huruf beraksen
  • Banyak blok teks. Poster dan infografis dengan beberapa potongan teks yang terpisah
  • Permukaan melengkung atau bersudut. Teks pada botol, bendera, atau papan tanda yang dilihat dari samping
  • Konsistensi. Menjaga kata-kata yang sama tetap identik di sederet gambar

Ini pola umum, bukan aturan baku, dan bisa berbeda dari satu generator dan versi ke generator dan versi berikutnya.

Cara mendapatkan teks yang lebih baik saat membuat gambar

  1. Tulis kata-kata yang tepat dalam tanda kutip. Misalnya, minta poster dengan judul “NIGHT MARKET”, bukan poster tentang pasar malam.
  2. Jaga teks tetap pendek. Beberapa kata dalam ukuran besar lebih mudah dibuat benar daripada satu kalimat penuh. Taruh teks yang lebih panjang di caption atau di halaman web.
  3. Sebutkan di mana teks ditempatkan. Jelaskan penempatan dan ukurannya, misalnya “judul besar di bagian atas” atau “label kecil di toples”.
  4. Minta huruf yang sederhana. Huruf kapital tebal dan bersih di area polos lebih mudah digambar model daripada huruf sambung dekoratif di atas latar yang ramai.
  5. Buat beberapa versi. Hasilkan beberapa opsi, pilih yang ejaannya paling baik, dan perbaiki hanya yang tersisa.
  6. Tambahkan teks yang tepat belakangan jika ketepatannya penting. Untuk menu, daftar harga, atau apa pun yang memuat tulisan halus, buat gambar dengan ruang kosong dan susun teksnya di alat desain. Dengan begitu kata-katanya diketik, bukan digambar.

Cara memperbaiki teks setelahnya

Jika gambarnya sudah benar tetapi kata-katanya salah, Anda punya empat pilihan utama. Berikut urutannya, dari yang paling ringan hingga yang paling berat usahanya.

MetodeUsahaApa lagi yang bisa berubahPaling cocok jika
Membuat ulang gambarRendahSemuanya, karena Anda mendapat gambar baruSeluruh gambar salah, atau Anda tidak keberatan kehilangan versi ini
Memilih dan mengedit di dalam generatorRendahArea di dekatnya bisa ikut digambar ulangAnda menginginkan perbaikan cepat di alat yang sama
Alat penggantian teks dengan AIRendah hingga sedangArea teks digambar ulang, jadi periksa hasilnyaGambarnya sudah benar dan hanya kata-katanya yang salah
Memperbaikinya secara manual di editor gambarTinggiHanya yang Anda ubahAnda membutuhkan kendali penuh, misalnya untuk pekerjaan cetak atau klien

Membuat ulang gambar

Membuat ulang gambar tidak butuh banyak usaha, tetapi hasilnya acak. Percobaan baru mungkin memperbaiki kata itu tetapi merusak hal lain, seperti wajah, tangan, atau tata letak. Pakai cara ini jika Anda belum banyak menghabiskan waktu untuk gambar yang satu ini.

Memilih dan mengedit di dalam generator

Beberapa generator memungkinkan Anda menandai suatu area dan menjelaskan perubahannya. Di ChatGPT, misalnya, Anda bisa menyorot teks dengan alat seleksi dan mengetik apa yang seharusnya tertulis. Pusat bantuan OpenAI mencatat bahwa sorotan tidak selalu presisi, sehingga detail di dekat teks juga bisa berubah. Untuk pembahasan yang lebih dalam, lihat apakah ChatGPT bisa mengedit tulisan di gambar.

Gunakan alat penggantian teks dengan AI

Alat penggantian teks mendeteksi teks di gambar untuk Anda, sehingga Anda hanya perlu mengetik ejaan yang benar. Dengan EditText.ai, misalnya, Anda mengedit tulisan di gambar baris demi baris, dan setiap baris digambar ulang dengan tampilan huruf dan latar aslinya. Untuk satu huruf atau kata yang salah, lihat cara memperbaiki salah ketik di gambar. Untuk judul dan huruf display pada desain acara, lihat cara mengganti tulisan di poster.

Sebelum: ilustrasi retro buatan AI tentang jalan di New York pada malam hari, dengan papan neon merah yang tinggi bertuliskan teks acak NEYAHRD
Sesudah: ilustrasi yang sama dengan papan neon merah kini bertuliskan THEATER, sementara cakrawala kota, taksi, dan judul NEW YORK tidak berubah

Sebelum dan sesudah: papan neon yang kacau pada gambar AI, diperbaiki dengan mengetik THEATER di EditText.ai.

Hasilnya bisa bervariasi, terutama pada huruf yang tidak biasa atau latar yang sangat detail. Karena penggambaran ulangnya juga dilakukan oleh model gambar, baca setiap kata baru huruf demi huruf dalam ukuran penuh. Deteksi teks apa pun juga bisa salah membaca huruf yang kacau, jadi pastikan setiap baris yang terdeteksi memang baris yang ingin Anda ubah.

Perbaiki secara manual

Di Photoshop, Photopea, atau editor serupa, Anda menghapus huruf yang rusak, membangun ulang latar, dan menata teks baru dalam sebuah font. Cara ini memberi kendali terbesar dan cocok untuk pekerjaan cetak atau klien, tetapi butuh keahlian dan waktu. Huruf buatan AI sering kali bukan font sungguhan, jadi pencari font mungkin tidak menemukan padanannya. Baca cara mengetahui font dari gambar untuk cara menemukan penggantinya yang mendekati.

Aturan sederhana membantu Anda memilih: jika seluruh gambar salah, buat ulang. Jika hanya kata-katanya yang salah, perbaiki kata-katanya.

Pilihan lain

Anda juga bisa menghapus tulisan di gambar sepenuhnya dan menata huruf sungguhan di atas latar yang bersih dalam alat desain, pendekatan yang bagus untuk menu dan daftar harga. Setelah kata-katanya benar, Anda bisa menerjemahkan tulisan di gambar untuk membuat versi dalam bahasa lain.

Edit hanya gambar yang Anda miliki atau yang boleh Anda ubah, jangan menghapus tanda air atau kredit pembuat, dan pertahankan label gambar AI yang diwajibkan oleh suatu platform.

Perbaiki kata-katanya dan pertahankan gambarnya

Jika gambarnya sudah benar tetapi ejaannya salah, Anda tidak perlu mulai dari awal. Unggah gambar itu untuk memperbaiki tulisan di gambar AI dengan EditText.ai, ketik kata-kata yang benar untuk setiap baris, dan periksa hasilnya sebelum Anda mengunduhnya.

Pertanyaan umum

Kenapa AI mengacaukan teks di gambar?

Generator gambar AI menggambar teks sebagai bentuk, bukan mengetiknya sebagai huruf, dan banyak yang membaca prompt dalam potongan kata, bukan karakter tunggal. Teks juga merupakan detail kecil dengan aturan ketat, jadi satu goresan yang salah langsung menonjol. Gambar pelatihan sering menampilkan teks yang kecil, buram, atau miring, yang memberi model lebih sedikit contoh jelas untuk dipelajari.

Kenapa AI menulis teks acak, bukan kata yang sebenarnya?

Ketika model tidak yakin bagaimana sebuah kata dieja, model tetap menggambar bentuk yang menyerupai huruf, karena begitulah tampilan teks pada gambar pelatihannya. Hasilnya bisa berupa tanda menyerupai huruf, alfabet yang bercampur, atau kata rekaan. Hal ini paling sering terjadi pada teks panjang, tulisan kecil, dan kata yang tidak lazim, dan lebih jarang pada frasa pendek dalam tanda kutip.

Generator gambar AI mana yang terbaik dalam menulis teks?

Tidak ada jawaban yang permanen, karena model sering berubah dan setiap versi baru bisa berperilaku berbeda. Secara umum, generator terbaru menangani teks yang pendek dan besar lebih baik daripada yang lama. Uji yang paling berguna adalah memakai prompt Anda sendiri: buat frasa pendek yang sama di alat-alat yang bisa Anda akses, lalu periksa ejaannya huruf demi huruf sebelum Anda memilih satu.

Bisakah saya memperbaiki teks yang salah eja di gambar AI tanpa membuatnya ulang?

Bisa. Anda dapat memilih areanya dan menjelaskan perbaikannya di generator yang sama, mengetik ulang teksnya secara manual di editor seperti Photoshop atau Photopea, atau memakai alat penggantian teks yang mendeteksi kata-katanya sehingga Anda bisa mengetik ejaan yang benar. Apa pun metodenya, bandingkan hasilnya dengan gambar aslinya untuk menemukan perubahan di dekat teks.

Kenapa pencari font tidak bisa mengenali huruf di gambar AI saya?

Generator AI biasanya menggambar huruf dari pola yang mereka pelajari, bukan dari file font yang terpasang. Huruf-hurufnya bisa mencampur ciri beberapa jenis huruf, atau berubah bentuk dari satu huruf ke huruf berikutnya. Pengenal font mungkin masih menyarankan font yang mirip, yang membantu jika Anda berencana mengetik ulang teksnya, tetapi padanan yang persis sering kali tidak ada.