edittext.ai

ทำไม AI สร้างภาพสะกดคำไม่ถูก และวิธีแก้ข้อความเพี้ยน

ทำไม AI สร้างภาพสะกดคำไม่ถูก เพราะวาดตัวอักษรเป็นรูปทรง ไม่ใช่ข้อความ ดูสาเหตุที่ทำให้ตัวหนังสือเพี้ยน และวิธีแก้ข้อความในภาพให้ถูกต้อง

เครื่องมือสร้างภาพ AI สะกดคำได้ยากเพราะมันวาดภาพ ไม่ได้พิมพ์ข้อความ มันเรียนรู้ว่าตัวอักษรหน้าตาเป็นอย่างไรในรูปของรูปทรงและรูปแบบของพิกเซล และไม่เคยพิมพ์คำทีละตัวอักษร ความพลาดเล็กน้อยจึงทำให้ “BAKERY” กลายเป็น “BAKRERY” ได้ เครื่องมือเหล่านี้จำนวนมากยังอ่านพรอมต์ของคุณเป็นชิ้นส่วนของคำแทนที่จะเป็นตัวอักษรทีละตัว ทำให้การสะกดให้ถูกเป๊ะยากขึ้นไปอีก

เครื่องมือสร้างภาพรุ่นใหม่จัดการข้อความสั้นได้ดีกว่ารุ่นแรก ๆ มาก แต่ข้อความยาว ตัวอักษรเล็ก ชื่อที่ไม่ค่อยพบ และชุดอักษรที่ไม่ใช่ละตินก็ยังทำให้เกิดข้อผิดพลาดอยู่ หากคุณมีภาพที่ข้อความเพี้ยนอยู่แล้ว คุณมักจะ แก้ข้อความในภาพที่สร้างด้วย AI ได้โดยไม่ต้องเริ่มใหม่ คู่มือนี้อธิบายว่าทำไมจึงเกิดข้อผิดพลาด จะเขียนพรอมต์อย่างไรให้ได้ข้อความที่ดีขึ้น และจะซ่อมในภายหลังอย่างไร ไม่ว่าภาพจะมาจาก Midjourney, ChatGPT, Gemini, Stable Diffusion หรือเครื่องมือสร้างภาพอื่น

เครื่องมือสร้างภาพ AI สร้างภาพอย่างไร

เครื่องมือสร้างภาพยอดนิยมจำนวนมากใช้วิธีที่เรียกว่า แบบจำลองแบบแพร่ (diffusion model) โมเดลเริ่มจากสัญญาณรบกวนแบบสุ่ม คล้ายภาพซ่าบนหน้าจอ แล้วลบสัญญาณรบกวนนั้นออกทีละนิดในแต่ละขั้นตอนจากหลายขั้นตอน พรอมต์ของคุณชี้นำทุกขั้นตอน สัญญาณรบกวนจึงค่อย ๆ กลายเป็นภาพที่ตรงกับคำอธิบายของคุณ ทั้งภาพถูกปรับแต่งไปพร้อมกัน ท้องฟ้า ใบหน้า และตัวอักษรค่อย ๆ ก่อรูปขึ้นในเวลาเดียวกัน

ไม่ใช่ทุกเครื่องมือที่ทำงานแบบนี้ บางเครื่องมือสร้างภาพเป็นลำดับของชิ้นส่วนเล็ก ๆ แทน แต่โดยทั่วไป โมเดลแปลงข้อความเป็นภาพ มีลักษณะสำคัญร่วมกันอย่างหนึ่ง คือคาดการณ์ว่าภาพควรหน้าตาเป็นอย่างไร ไม่มีขั้นตอนที่โมเดลเลือกฟอนต์แล้วพิมพ์ “B” ตามด้วย “A” ตามด้วย “K” ตัวอักษรปรากฏเป็นเพียงรูปทรงที่ดูถูกต้อง นั่นจึงเป็นเหตุผลที่ตัวอักษรอาจออกมาเกือบถูกแต่ไม่ถูกเสียทีเดียว

ทำไมข้อความจึงยากสำหรับเครื่องมือสร้างภาพ

มีสาเหตุหลายอย่างทำงานร่วมกัน แต่ละอย่างทำให้เกิดข้อผิดพลาดเล็กน้อยได้ง่ายขึ้น และข้อความเป็นจุดที่ข้อผิดพลาดเล็กน้อยมองเห็นได้ง่าย

ตัวอักษรเป็นรายละเอียดเล็ก ๆ ที่มีกฎเข้มงวด

ต้นไม้จะมีกิ่งกี่กิ่งก็ยังดูเป็นต้นไม้ แต่คำหนึ่งคำมีการสะกดที่ถูกต้องเพียงแบบเดียวเท่านั้น ข้อความยังมีกฎที่ใช้ทั้งคำ ตัวอักษรทุกตัวต้องมีสไตล์และความสูงเท่ากัน ระยะห่างต้องสม่ำเสมอ และตัวอักษรต้องอยู่บนเส้นบรรทัดเดียวกัน เส้นที่เกินมาหนึ่งเส้น ตัวอักษรที่หายไป หรือตัวอักษรที่ซ้ำ ใครก็ตามที่อ่านภาษานั้นได้ย่อมเห็นชัด แม้ส่วนที่เหลือของภาพจะดูสมจริง

โมเดลอาจไม่เคยเห็นตัวอักษรที่คุณพิมพ์

ก่อนที่เครื่องมือสร้างภาพจะใช้พรอมต์ของคุณได้ ส่วนประกอบที่เรียกว่าตัวเข้ารหัสข้อความ (text encoder) จะแปลงพรอมต์เป็นตัวเลข ตัวเข้ารหัสข้อความจำนวนมากแบ่งพรอมต์เป็นโทเค็นก่อน คำที่พบบ่อยมักกลายเป็นโทเค็นเดียว ส่วนคำที่พบน้อยกว่าจะถูกแบ่งเป็นหลายชิ้น วิธีที่ใช้กันอย่างแพร่หลายในการสร้างชิ้นส่วนเหล่านี้คือ byte-pair encoding วิธีนี้มีประสิทธิภาพ แต่โมเดลได้รับ ID ของแต่ละชิ้น ไม่ใช่ตัวอักษรที่อยู่ข้างใน มันต้องเรียนรู้จากตัวอย่างว่าชิ้นส่วนหนึ่งถูกวาดเป็นแถวตัวอักษรแบบไหน

งานวิจัยของ Google Research เรื่อง Character-Aware Models Improve Visual Text Rendering ศึกษาเรื่องนี้โดยตรง นักวิจัยเปรียบเทียบตัวเข้ารหัสข้อความที่มองเห็นตัวอักษรทีละตัว (“character-aware”) กับตัวเข้ารหัสที่เห็นเพียงชิ้นส่วนของคำ (“character-blind”) โมเดลภาพที่ใช้ตัวเข้ารหัสแบบ character-aware แสดงข้อความในภาพได้แม่นยำกว่า และโดดเด่นเป็นพิเศษกับคำที่พบน้อย งานวิจัยยังพบว่าโมเดลภาษาแบบ character-blind ขนาดใหญ่มากเรียนรู้การสะกดได้ดี แต่ความสามารถนี้ไม่ได้ขยายผลไปนอกภาษาอังกฤษได้ดีนัก และปรากฏเฉพาะในโมเดลที่ใหญ่กว่าตัวเข้ารหัสข้อความที่เครื่องมือสร้างภาพมักใช้ในเวลานั้นมาก

ภาพที่ใช้ฝึกมักแสดงข้อความได้ไม่ดี

เครื่องมือสร้างภาพเรียนรู้จากคอลเลกชันภาพขนาดใหญ่มากที่จับคู่กับคำอธิบาย ในภาพเหล่านั้น ข้อความมักเล็ก เบลอ ถูกตัด เห็นในมุมเอียง หรือถูกบังบางส่วน และมีฟอนต์กับสไตล์หลากหลายมาก คำอธิบายที่จับคู่กับภาพอาจไม่ได้กล่าวถึงข้อความในภาพเลย โมเดลจึงเห็นตัวอย่างมากมายว่าข้อความโดยทั่วไปหน้าตาเป็นอย่างไร แต่เห็นตัวอย่างที่ชัดเจนน้อยกว่าว่าคำเฉพาะคำหนึ่งควรสะกดอย่างไรกันแน่

ข้อความเล็กมีพิกเซลน้อยมาก

พาดหัวอาจกินพื้นที่หลายร้อยพิกเซล ขณะที่คำในตัวอักษรเล็กอาจได้เพียงไม่กี่พิกเซลต่อตัวอักษร เครื่องมือสร้างภาพจำนวนมากยังทำงานกับภาพเวอร์ชันที่ถูกบีบอัดแล้วสร้างภาพขนาดเต็มขึ้นใหม่ตอนท้าย ซึ่งเหลือที่ว่างให้รายละเอียดเล็ก ๆ น้อยลงไปอีก เส้นละเอียด เช่น เส้นขวางใน “e” ตัวพิมพ์เล็ก หายไปได้ง่าย

ทำไมโมเดลรุ่นใหม่เขียนข้อความได้ดีขึ้น

เครื่องมือสร้างภาพเก่งขึ้นมากกับพาดหัวสั้น ๆ และป้ายกำกับ โดยทั่วไประบบรุ่นใหม่ใช้โมเดลภาษาที่แข็งแกร่งกว่าเพื่อทำความเข้าใจพรอมต์ และนักพัฒนาให้ความสนใจกับข้อความมากขึ้นระหว่างการฝึก งานวิจัยข้างต้นชี้ไปในทิศทางเดียวกัน คือโมเดลที่ได้รับข้อมูลเกี่ยวกับตัวอักษรที่ดีกว่าวาดข้อความได้แม่นยำกว่า

การพัฒนาขึ้นเป็นเรื่องจริงแต่ไม่สม่ำเสมอ เครื่องมือสร้างภาพที่เขียนชื่อเรื่องสามคำได้ถูกต้องก็ยังอาจมีปัญหากับย่อหน้า เมนู หรือป้ายในภาษาที่เห็นน้อยกว่าระหว่างการฝึก

จุดที่เครื่องมือสร้างภาพ AI ยังมีปัญหา

  • ข้อความยาว ย่อหน้า เมนู และรายการ ซึ่งทุกคำที่เพิ่มคือโอกาสผิดพลาดอีกครั้ง
  • ข้อความเล็ก ตัวอักษรเล็ก ป้ายกำกับ และข้อความที่อยู่ไกลในฉาก
  • คำที่ไม่ค่อยพบ ชื่อ คำที่ประดิษฐ์ขึ้น ศัพท์ใหม่ และตัวเลขยาว เช่น เบอร์โทรศัพท์หรือรหัส
  • ชุดอักษรที่ไม่ใช่ละติน อาหรับ จีน ฮินดี ญี่ปุ่น เกาหลี ไทย และระบบการเขียนอื่น ๆ รวมถึงตัวอักษรที่มีเครื่องหมายกำกับเสียง
  • ข้อความหลายก้อน โปสเตอร์และอินโฟกราฟิกที่มีข้อความหลายส่วนแยกกัน
  • พื้นผิวโค้งหรือเอียง ข้อความบนขวด ธง หรือป้ายที่มองจากด้านข้าง
  • ความสม่ำเสมอ การคงถ้อยคำเดียวกันให้เหมือนกันทุกภาพในชุดภาพ

สิ่งเหล่านี้เป็นรูปแบบที่พบบ่อยมากกว่ากฎตายตัว และต่างกันไปตามแต่ละเครื่องมือและแต่ละเวอร์ชัน

วิธีให้ได้ข้อความที่ดีขึ้นตอนสร้างภาพ

  1. ใส่ถ้อยคำที่ต้องการไว้ในเครื่องหมายคำพูด เช่น ขอโปสเตอร์ที่มีชื่อเรื่อง “NIGHT MARKET” แทนที่จะขอโปสเตอร์เกี่ยวกับตลาดนัดกลางคืน
  2. เขียนข้อความให้สั้น คำไม่กี่คำในขนาดใหญ่ทำให้ถูกได้ง่ายกว่าประโยคเต็ม ข้อความที่ยาวกว่านั้นให้ไปใส่ในคำบรรยายหรือบนหน้าเว็บแทน
  3. บอกว่าข้อความอยู่ตรงไหน อธิบายตำแหน่งและขนาด เช่น “ชื่อเรื่องขนาดใหญ่พาดด้านบน” หรือ “ป้ายเล็กบนขวดโหล”
  4. ขอตัวอักษรแบบเรียบง่าย ตัวพิมพ์ใหญ่ตัวหนาที่สะอาดบนพื้นที่เรียบวาดได้ง่ายกว่าตัวอักษรสคริปต์ตกแต่งบนพื้นหลังที่วุ่นวาย
  5. สร้างหลายเวอร์ชัน สร้างไม่กี่ตัวเลือก เลือกอันที่สะกดดีที่สุด แล้วแก้เฉพาะส่วนที่เหลือ
  6. เพิ่มข้อความที่ตรงเป๊ะภายหลังเมื่อสำคัญ สำหรับเมนู ราคา หรืออะไรก็ตามที่มีตัวอักษรเล็ก ให้สร้างภาพโดยเว้นที่ว่างไว้ แล้วจัดข้อความในเครื่องมือออกแบบ วิธีนี้ถ้อยคำถูกพิมพ์ ไม่ใช่ถูกวาด

วิธีแก้ข้อความภายหลัง

หากภาพถูกต้องแต่ข้อความผิด คุณมีตัวเลือกหลักสี่ทาง เรียงจากใช้ความพยายามน้อยที่สุดไปมากที่สุด

วิธีความพยายามที่ต้องใช้สิ่งอื่นที่อาจเปลี่ยนเหมาะที่สุดเมื่อ
สร้างภาพใหม่ต่ำทุกอย่าง เพราะคุณได้ภาพใหม่ทั้งภาพผิด หรือคุณไม่เสียดายที่จะเสียเวอร์ชันนี้ไป
เลือกแล้วแก้ในเครื่องมือสร้างภาพต่ำบริเวณใกล้เคียงอาจถูกวาดใหม่ด้วยคุณต้องการแก้ด่วนในเครื่องมือเดิม
เครื่องมือแทนที่ข้อความด้วย AIต่ำถึงปานกลางบริเวณข้อความถูกวาดใหม่ จึงควรตรวจผลลัพธ์ภาพถูกต้องแล้วและผิดเฉพาะตัวคำ
แก้ด้วยมือในโปรแกรมแก้ไขภาพสูงเฉพาะสิ่งที่คุณเปลี่ยนคุณต้องการควบคุมเต็มที่ เช่น สำหรับงานพิมพ์หรืองานลูกค้า

สร้างภาพใหม่

การสร้างใหม่ใช้ความพยายามน้อย แต่ผลลัพธ์เป็นแบบสุ่ม การลองใหม่อาจแก้คำนั้นได้แต่ทำให้อย่างอื่นพัง เช่น ใบหน้า มือ หรือเลย์เอาต์ ใช้วิธีนี้เมื่อคุณยังไม่ได้ใช้เวลากับภาพนี้มากนัก

เลือกและแก้ไขในเครื่องมือสร้างภาพ

เครื่องมือสร้างภาพบางตัวให้คุณทำเครื่องหมายบริเวณหนึ่งแล้วอธิบายสิ่งที่ต้องการเปลี่ยน เช่นใน ChatGPT คุณไฮไลต์ข้อความด้วยเครื่องมือเลือกแล้วพิมพ์ว่าข้อความนั้นควรเขียนว่าอะไรได้ ศูนย์ช่วยเหลือของ OpenAI ระบุว่าการไฮไลต์ไม่ได้แม่นยำเสมอไป รายละเอียดใกล้ข้อความจึงอาจเปลี่ยนด้วย หากต้องการดูละเอียดกว่านี้ ดู ChatGPT แก้ไขข้อความในรูปภาพได้ไหม

ใช้เครื่องมือแทนที่ข้อความด้วย AI

เครื่องมือแทนที่ข้อความตรวจจับข้อความในภาพให้คุณ คุณจึงพิมพ์แค่การสะกดที่ถูกต้อง ตัวอย่างเช่นใน EditText.ai คุณ แก้ไขข้อความในรูปภาพ ทีละบรรทัด และแต่ละบรรทัดจะถูกวาดใหม่ในหน้าตาของตัวอักษรเดิมและพื้นหลัง หากผิดเพียงตัวอักษรหรือคำเดียว ดูวิธี แก้คำผิดในรูปภาพ ส่วนพาดหัวและตัวอักษรตกแต่งบนงานออกแบบอีเวนต์ ดูวิธี เปลี่ยนข้อความบนโปสเตอร์

ก่อนแก้: ภาพประกอบสไตล์ย้อนยุคที่ AI สร้างของถนนในนิวยอร์กยามค่ำคืน มีป้ายนีออนสีแดงสูงที่เขียนข้อความมั่ว “NEYAHRD”
หลังแก้: ภาพประกอบเดียวกันที่ป้ายนีออนสีแดงเขียนว่า “THEATER” แล้ว ส่วนเส้นขอบฟ้า แท็กซี่ และพาดหัว “NEW YORK” ไม่เปลี่ยน

ก่อนและหลัง: ป้ายนีออนที่เพี้ยนในภาพ AI แก้ไขด้วยการพิมพ์ THEATER ใน EditText.ai

ผลลัพธ์ต่างกันได้ โดยเฉพาะกับตัวอักษรแปลกตาหรือพื้นหลังที่มีรายละเอียดมาก และเนื่องจากการวาดใหม่ก็ทำโดยโมเดลภาพเช่นกัน จึงควรอ่านทุกคำใหม่ทีละตัวอักษรที่ขนาดเต็ม การตรวจจับข้อความทุกแบบยังอาจอ่านตัวอักษรที่เพี้ยนผิดได้ ดังนั้นให้ตรวจว่าแต่ละบรรทัดที่ตรวจพบคือบรรทัดที่คุณตั้งใจจะเปลี่ยน

แก้ด้วยมือ

ใน Photoshop, Photopea หรือโปรแกรมแก้ไขที่คล้ายกัน คุณลบตัวอักษรที่เพี้ยน สร้างพื้นหลังขึ้นใหม่ และจัดข้อความใหม่ด้วยฟอนต์ วิธีนี้ให้คุณควบคุมได้มากที่สุดและเหมาะกับงานพิมพ์หรืองานลูกค้า แต่ต้องใช้ทักษะและเวลา ตัวอักษรที่ AI สร้างมักไม่ใช่ฟอนต์จริง เครื่องมือหาฟอนต์จึงอาจหาตัวที่ตรงกันไม่เจอ อ่าน วิธีหาฟอนต์จากรูปภาพ เพื่อดูวิธีหาตัวแทนที่ใกล้เคียง

กฎง่าย ๆ ช่วยให้เลือกได้ ถ้าทั้งภาพผิด ให้สร้างใหม่ ถ้าผิดเฉพาะตัวคำ ให้แก้ที่ตัวคำ

ตัวเลือกอื่น

คุณยัง ลบข้อความในรูปภาพ ออกทั้งหมดแล้วจัดตัวอักษรจริงบนพื้นหลังที่สะอาดในเครื่องมือออกแบบได้ ซึ่งเป็นแนวทางที่ดีสำหรับเมนูและรายการราคา เมื่อถ้อยคำถูกต้องแล้ว คุณ แปลข้อความในรูปภาพ เพื่อทำเวอร์ชันสำหรับภาษาอื่นได้

แก้ไขเฉพาะภาพที่คุณเป็นเจ้าของหรือได้รับอนุญาตให้เปลี่ยน อย่าลบลายน้ำหรือเครดิตผู้สร้าง และคงป้ายระบุว่าเป็นภาพ AI ที่แพลตฟอร์มกำหนดไว้

แก้ข้อความและคงภาพไว้

หากภาพถูกต้องแต่การสะกดผิด คุณไม่ต้องเริ่มใหม่ อัปโหลดภาพเพื่อ แก้ข้อความในภาพที่สร้างด้วย AI ด้วย EditText.ai พิมพ์ถ้อยคำที่ถูกต้องของแต่ละบรรทัด แล้วตรวจผลลัพธ์ก่อนดาวน์โหลด

คำถามที่พบบ่อย

ทำไม AI ทำข้อความในรูปเพี้ยน?

เครื่องมือสร้างภาพ AI วาดข้อความเป็นรูปทรงแทนที่จะพิมพ์เป็นตัวอักษร และหลายเครื่องมืออ่านพรอมต์เป็นชิ้นส่วนของคำแทนที่จะเป็นตัวอักษรทีละตัว ข้อความยังเป็นรายละเอียดเล็กที่มีกฎเข้มงวด เส้นที่ผิดเพียงเส้นเดียวจึงโดดเด่น ภาพที่ใช้ฝึกมักแสดงข้อความที่เล็ก เบลอ หรืออยู่ในมุมเอียง ทำให้โมเดลมีตัวอย่างที่ชัดเจนให้เรียนรู้น้อยลง

ทำไม AI เขียนข้อความมั่วแทนที่จะเป็นคำจริง?

เมื่อโมเดลไม่แน่ใจว่าคำหนึ่งสะกดอย่างไร มันก็ยังวาดรูปทรงที่ดูเหมือนตัวอักษรอยู่ดี เพราะนั่นคือหน้าตาของข้อความในภาพที่ใช้ฝึก ผลลัพธ์อาจเป็นเครื่องหมายที่คล้ายตัวอักษร อักษรหลายชุดปนกัน หรือคำที่ประดิษฐ์ขึ้น เกิดบ่อยที่สุดกับข้อความยาว ตัวอักษรเล็ก และคำที่ไม่ค่อยพบ และเกิดน้อยลงกับวลีสั้น ๆ ในเครื่องหมายคำพูด

เครื่องมือสร้างภาพ AI ตัวไหนเขียนข้อความได้ดีที่สุด?

ไม่มีคำตอบถาวร เพราะโมเดลเปลี่ยนบ่อยและแต่ละเวอร์ชันใหม่อาจทำงานต่างออกไป โดยทั่วไปเครื่องมือรุ่นล่าสุดจัดการข้อความสั้นขนาดใหญ่ได้ดีกว่ารุ่นเก่า การทดสอบที่มีประโยชน์ที่สุดคือพรอมต์ของคุณเอง สร้างวลีสั้นวลีเดียวกันในเครื่องมือที่คุณเข้าถึงได้ แล้วตรวจการสะกดทีละตัวอักษรก่อนเลือก

แก้ข้อความที่สะกดผิดในภาพ AI โดยไม่สร้างใหม่ได้ไหม?

ได้ คุณทำได้โดยเลือกบริเวณนั้นแล้วอธิบายการแก้ในเครื่องมือสร้างภาพเดิม พิมพ์ข้อความใหม่ด้วยมือในโปรแกรมแก้ไขอย่าง Photoshop หรือ Photopea หรือใช้เครื่องมือแทนที่ข้อความที่ตรวจจับคำให้ แล้วคุณพิมพ์การสะกดที่ถูกต้องเข้าไป ไม่ว่าจะใช้วิธีไหน ให้เปรียบเทียบผลลัพธ์กับต้นฉบับเพื่อดูสิ่งที่เปลี่ยนใกล้ข้อความ

ทำไมเครื่องมือหาฟอนต์ระบุตัวอักษรในภาพ AI ของฉันไม่ได้?

เครื่องมือสร้างภาพ AI มักวาดตัวอักษรจากรูปแบบที่เรียนรู้มา ไม่ใช่จากไฟล์ฟอนต์ที่ติดตั้งไว้ ตัวอักษรอาจผสมลักษณะของแบบอักษรหลายแบบ หรือเปลี่ยนรูปทรงจากตัวหนึ่งไปอีกตัวหนึ่ง เครื่องมือระบุฟอนต์อาจยังแนะนำฟอนต์ที่คล้ายกันได้ ซึ่งช่วยหากคุณวางแผนจะพิมพ์ข้อความใหม่ แต่ฟอนต์ที่ตรงเป๊ะมักไม่มีอยู่