วิธีให้ Gemini อ่านข้อความจากรูปภาพ

Google Gemini สามารถอ่านข้อความจากรูปภาพ Screenshot ภาพเอกสาร ป้าย เมนู ตาราง และข้อความที่ถ่ายจากกล้อง แล้วนำข้อความเหล่านั้นมาสรุป แปลภาษา จัดรูปแบบใหม่ หรืออธิบายต่อได้ทันที เหมาะสำหรับกรณีที่ไม่ต้องการพิมพ์ข้อความจากภาพด้วยตัวเอง

วิธีใช้งานที่ได้ผลดีที่สุดคืออัปโหลดภาพที่คมชัด แล้วระบุให้ Gemini อ่านข้อความตามที่มองเห็นก่อน โดยไม่เดาคำที่ไม่ชัด จากนั้นจึงค่อยสั่งงานต่อ เช่น แปล สรุป จัดเป็นตาราง หรือวิเคราะห์ความหมาย

❶ 🔤 Gemini อ่านข้อความจากรูปได้ไหม

ได้ Gemini Apps รองรับการใช้รูปภาพเป็นข้อมูลประกอบ Prompt และสามารถตอบคำถามเกี่ยวกับสิ่งที่อยู่ในภาพได้

จึงสามารถนำมาใช้กับงานอ่านข้อความจากภาพ เช่น

  • 📸 รูปถ่ายเอกสาร
  • 📱 Screenshot มือถือ
  • 💻 Screenshot โปรแกรม
  • ⚠️ Error Message
  • 🪧 ป้าย
  • 📋 ตาราง
  • 🧾 ใบเสร็จ
  • 📑 เอกสารสแกน
  • 🖥️ หน้าจอเว็บไซต์
  • 📦 Label สินค้า
  • 📊 กราฟที่มีข้อความ
  • 🌐 ข้อความภาษาต่างประเทศ

Gemini สามารถอ่านข้อความแล้วนำ Context รอบ ๆ ภาพมาช่วยอธิบายความหมายเพิ่มเติมได้ด้วย

❷ ⬆️ วิธีอัปโหลดรูปให้ Gemini อ่านข้อความ

ขั้นตอนทำได้ง่ายทั้งคอมพิวเตอร์และมือถือ

ขั้นที่ 1 เปิด Gemini

เข้าสู่ Gemini ด้วยบัญชี Google

หากเป็นงานใหม่ ควรเริ่มแชตใหม่เพื่อให้ Context ไม่ปะปนกับบทสนทนาเก่า

ขั้นที่ 2 เพิ่มรูปภาพ

เลือกเมนูเพิ่มไฟล์หรือเพิ่มรูปภาพบริเวณช่อง Prompt

จากนั้นเลือกภาพจากอุปกรณ์

บนมือถือที่รองรับ สามารถเปิดกล้อง ถ่ายภาพ แล้วถาม Gemini เกี่ยวกับภาพนั้นได้โดยตรง

ขั้นที่ 3 ตรวจภาพก่อนส่ง

ควรดูว่า

  • ตัวหนังสือชัดหรือไม่
  • ภาพเอียงหรือไม่
  • มีแสงสะท้อนหรือไม่
  • ข้อความถูกตัดหรือไม่
  • ตัวหนังสือเล็กเกินไปหรือไม่

ขั้นที่ 4 เขียน Prompt

Prompt ง่ายที่สุดคือ

“อ่านข้อความทั้งหมดที่มองเห็นในภาพนี้ แล้วถอดออกมาเป็นข้อความ”

แต่ถ้าต้องการความแม่นยำมากขึ้น ควรกำหนดรายละเอียดเพิ่มเติม

❸ 🧠 Prompt ให้ Gemini อ่านข้อความจากรูปแบบละเอียด

ใช้ Prompt นี้ได้ทันที

“อ่านข้อความทั้งหมดที่มองเห็นในรูปภาพนี้ตามลำดับเดิม

กฎ:

  1. ห้ามสรุป
  2. ห้ามแก้คำ
  3. ห้ามเติมคำที่ไม่มีอยู่ในภาพ
  4. รักษาตัวเลข วันที่ สัญลักษณ์ และเครื่องหมายต่าง ๆ
  5. หากข้อความใดอ่านไม่ชัด ให้ใส่ [อ่านไม่ชัด]
  6. รักษาการขึ้นบรรทัดและหัวข้อให้ใกล้เคียงต้นฉบับ
  7. หลังอ่านข้อความเสร็จ ให้ระบุส่วนที่คุณไม่มั่นใจแยกต่างหาก”

Prompt นี้เหมาะกับการดึงข้อความออกจากภาพก่อนนำไปใช้งานต่อ

❹ 📸 วิธีถ่ายรูปเอกสารให้ Gemini อ่านง่าย

คุณภาพของภาพมีผลต่อความถูกต้องมากกว่าความยาวของ Prompt

✅ ถ่ายตรงกับเอกสาร

ควรให้กล้องขนานกับหน้ากระดาษ

หากถ่ายจากด้านข้าง ตัวหนังสือด้านหนึ่งอาจเล็กกว่าหรือบิดเบี้ยว

✅ ใช้แสงเพียงพอ

หลีกเลี่ยง

  • เงามือ
  • แสงสะท้อน
  • จุดมืด
  • แสงแฟลชแรงเกินไป

✅ อย่าถ่ายไกลเกินไป

ตัวหนังสือควรมีขนาดใหญ่พอที่จะอ่านได้

ถ้าเอกสารมีตัวหนังสือขนาดเล็ก ควรถ่ายแยกทีละส่วน

✅ ให้ภาพคมชัด

ตรวจ Focus ก่อนส่ง

✅ Crop พื้นที่ไม่จำเป็น

หากต้องการอ่านข้อความเฉพาะกระดาษ ไม่จำเป็นต้องรวมโต๊ะ มือ หรือสิ่งของอื่น ๆ เข้าไปในภาพมากเกินไป

❺ 📱 วิธีอ่านข้อความจาก Screenshot ด้วย Gemini

Screenshot มักให้ผลดีกว่าการถ่ายหน้าจอด้วยกล้อง เพราะข้อความมีความคมชัดกว่า

สามารถใช้กับ

  • Error
  • Chat
  • Notification
  • Website
  • Application
  • Setting
  • Email
  • Dashboard
  • Menu
  • Code Error

ตัวอย่าง Prompt

“อ่านข้อความทั้งหมดจาก Screenshot นี้ตามตำแหน่งจากบนลงล่าง โดยยังไม่ต้องอธิบาย”

หลังจากได้ข้อความแล้วค่อยสั่ง

“จากข้อความที่อ่านได้ อธิบายว่าหน้าจอนี้กำลังแจ้งอะไร”

วิธีนี้แยกขั้นตอน อ่านข้อความ และ ตีความข้อความ ออกจากกัน ทำให้ตรวจสอบคำตอบได้ง่ายขึ้น

❻ ⚠️ วิธีอ่าน Error Message จากรูป

หากหน้าจอขึ้น Error ไม่จำเป็นต้องพิมพ์ Error Code เอง

ถ่าย Screenshot แล้วใช้ Prompt

“อ่านข้อความ Error ในภาพนี้แบบคำต่อคำก่อน โดยรักษา Error Code และตัวเลขทั้งหมด หลังจากนั้นจึงอธิบายความหมายของ Error และเสนอวิธีแก้”

ควรให้ผลลัพธ์แบ่งเป็น

ข้อความที่อ่านได้

แสดง Error ต้นฉบับ

ความหมาย

อธิบายว่า Error เกี่ยวกับอะไร

สาเหตุ

เรียงสาเหตุที่เป็นไปได้

วิธีแก้

เริ่มจากวิธีที่ง่ายและมีความเสี่ยงต่ำก่อน

วิธีนี้เหมาะมากกับงานแก้ปัญหาคอมพิวเตอร์ มือถือ Router และ Software

❼ 🌐 วิธีอ่านข้อความภาษาอังกฤษแล้วแปลเป็นไทย

สามารถทำสองขั้นตอนใน Prompt เดียวได้

ตัวอย่าง

“อ่านข้อความภาษาอังกฤษทั้งหมดจากภาพนี้ก่อน จากนั้นแปลเป็นภาษาไทย โดยแสดงต้นฉบับและคำแปลคู่กันทีละบรรทัด”

รูปแบบผลลัพธ์จะช่วยให้ตรวจได้ว่าข้อความต้นฉบับถูกอ่านถูกหรือไม่ก่อนเชื่อคำแปล

💡 หากมีศัพท์เทคนิค

เพิ่มว่า

“ชื่อ Menu, Function, Product, Error Code และศัพท์เทคนิคให้คงภาษาอังกฤษไว้ และใส่คำแปลไทยในวงเล็บเมื่อจำเป็น”

เหมาะกับ Screenshot โปรแกรมและคู่มือ

❽ 🇹🇭 Gemini อ่านข้อความภาษาไทยจากรูปได้ไหม

สามารถใช้รูปที่มีข้อความภาษาไทยกับ Gemini ได้

แต่ความแม่นยำยังขึ้นอยู่กับ

  • Font
  • ขนาดตัวหนังสือ
  • ความละเอียด
  • ภาพเบลอ
  • สีพื้นหลัง
  • ลายมือ
  • การเอียงของภาพ
  • ข้อความที่ถูกบัง

หากตัวอักษรไทยบางตัวคล้ายกัน หรือภาพมีความละเอียดต่ำ ควรตรวจข้อความต้นฉบับอีกครั้ง

Prompt ที่แนะนำ

“อ่านข้อความภาษาไทยจากภาพนี้ตามที่เห็นจริง หากพยัญชนะ สระ วรรณยุกต์ หรือตัวเลขส่วนใดอ่านไม่ชัด ห้ามเดา ให้ระบุ [อ่านไม่ชัด]”

❾ 📋 วิธีอ่านข้อความจากตารางในรูป

กรณีมีตาราง ไม่ควรสั่งเพียง

“อ่านข้อความ”

ควรบอกให้รักษาความสัมพันธ์ระหว่าง Row และ Column

ใช้ Prompt

“อ่านตารางจากภาพนี้ แล้วสร้างตารางใหม่โดยรักษา Header, Row, Column, ตัวเลข และหน่วยให้ตรงกับต้นฉบับ หาก Cell ใดอ่านไม่ชัดให้ใส่ [อ่านไม่ชัด] และห้ามประมาณค่าตัวเลข”

หลังจากนั้นสั่ง

“กลับไปตรวจภาพอีกครั้ง แล้วระบุ Cell ที่คุณมีความมั่นใจต่ำ”

⚠️ ตัวเลขในตารางต้องตรวจซ้ำ

โดยเฉพาะข้อมูลประเภท

  • ราคา
  • จำนวนเงิน
  • เปอร์เซ็นต์
  • คะแนน
  • สถิติ
  • ขนาด
  • รหัส
  • เลขบัญชี

ตัวเลขผิดเพียงหนึ่งหลักอาจเปลี่ยนความหมายของข้อมูลทั้งหมด

❿ 🧾 วิธีอ่านข้อความจากใบเสร็จ

สามารถใช้ Gemini ช่วยอ่านข้อความที่มองเห็นจากใบเสร็จได้

ตัวอย่าง Prompt

“อ่านข้อความจากใบเสร็จนี้ แล้วแยกเป็นตารางที่มี:

  • วันที่
  • รายการ
  • จำนวน
  • ราคาต่อหน่วย
  • ราคารวม
  • ส่วนลด
  • ภาษี
  • ยอดสุทธิ

หากข้อมูลส่วนใดอ่านไม่ชัด ให้ระบุว่าอ่านไม่ชัด ห้ามเดาตัวเลข”

🔐 ระวังข้อมูลส่วนตัว

ใบเสร็จบางประเภทอาจมี

  • ชื่อ
  • เลขสมาชิก
  • หมายเลขบัตรบางส่วน
  • ที่อยู่
  • Transaction ID

ควรปกปิดข้อมูลที่ไม่จำเป็นก่อนอัปโหลด

🧾 วิธีอ่านเอกสารหลายย่อหน้าจากภาพ

หากภาพมีข้อความยาว อย่าขอให้ Gemini สรุปทันที

ใช้ Workflow ดังนี้

❶ ถอดข้อความ

“อ่านข้อความทั้งหมดตามต้นฉบับ”

❷ ตรวจคำที่ไม่ชัด

“แสดงรายการคำที่คุณไม่มั่นใจ”

❸ แก้เฉพาะส่วนที่ยืนยันได้

หากผู้ใช้สามารถดูต้นฉบับ ให้ช่วยบอกคำที่ถูกต้อง

❹ จึงค่อยสรุป

“จากข้อความที่ยืนยันแล้ว สรุปใจความสำคัญ”

วิธีนี้ช่วยลดปัญหาการสรุปจากข้อความที่อ่านผิดตั้งแต่ต้น

✍️ Gemini อ่านลายมือได้ไหม

สามารถลองใช้ Gemini กับภาพลายมือได้ แต่ความแม่นยำจะแตกต่างจากข้อความพิมพ์อย่างมาก

ลายมือที่

  • ตัวใหญ่
  • เขียนชัด
  • มีช่องว่างดี
  • ใช้ปากกาสีเข้ม
  • พื้นหลังกระดาษสะอาด

มีโอกาสอ่านได้ง่ายกว่า

ลายมือที่

  • เขียนติดกัน
  • หวัดมาก
  • ตัวเล็ก
  • มีรอยแก้
  • กระดาษยับ
  • แสงไม่ดี

Prompt

“ถอดข้อความลายมือจากภาพนี้ตามที่มองเห็น หากคำใดไม่สามารถยืนยันได้ ให้ใส่ [ไม่แน่ใจ] แทนการเดา”

สำหรับข้อมูลสำคัญไม่ควรใช้ผลลัพธ์จาก AI เป็นฉบับสุดท้ายโดยไม่ตรวจต้นฉบับ

📑 วิธีอ่านข้อความจากภาพหลายรูปตามลำดับ

หากเอกสารมีหลายหน้า สามารถถ่ายเป็นหลายภาพแล้วส่งให้ Gemini วิเคราะห์ร่วมกันได้

ปัจจุบัน Gemini Apps รองรับไฟล์ที่รองรับได้สูงสุดประมาณ 10 ไฟล์ต่อ Prompt โดยขึ้นอยู่กับความพร้อมใช้งาน

ตัวอย่าง Prompt

“ภาพเหล่านี้เป็นเอกสารต่อเนื่องกัน ให้อ่านข้อความตามลำดับไฟล์ 1–5 และแบ่งผลลัพธ์เป็นหน้า 1, หน้า 2, หน้า 3, หน้า 4 และหน้า 5 ห้ามรวมข้อความจากแต่ละหน้าเข้าด้วยกัน”

เมื่อถอดข้อความครบแล้วค่อยสั่ง

“รวมข้อความทั้งหมดตามลำดับและจัดย่อหน้าให้อ่านง่าย โดยห้ามเปลี่ยนเนื้อหา”

🔎 วิธีอ่านข้อความเฉพาะบางตำแหน่ง

ไม่จำเป็นต้องให้ Gemini อ่านทั้งภาพทุกครั้ง

สามารถระบุตำแหน่ง เช่น

“อ่านข้อความเฉพาะกรอบสีแดงตรงกลางภาพ”

หรือ

“อ่านข้อความบริเวณมุมขวาบนเท่านั้น”

หรือ

“อ่านเฉพาะ Column ราคา”

การจำกัดพื้นที่ช่วยลดความสับสน โดยเฉพาะ Screenshot ที่มีข้อมูลจำนวนมาก

📷 ถ้าข้อความเล็กมากควรทำอย่างไร

วิธีที่ดีที่สุดคือไม่พยายามใช้ภาพเดิมต่อไปเรื่อย ๆ

ให้

❶ Crop

ตัดเฉพาะข้อความที่ต้องการ

❷ Zoom

ขยายข้อความก่อน Capture ใหม่

❸ ส่งภาพต้นฉบับ

หลีกเลี่ยงภาพที่ผ่านการบีบอัดหลายครั้ง

❹ แบ่งเป็นหลายรูป

แทนการส่ง Screenshot ยาวทั้งหน้า

❺ ใช้ไฟล์ต้นฉบับ

ถ้ามี PDF, Word หรือ Spreadsheet จริง การอัปโหลดไฟล์ต้นฉบับมักเหมาะกว่าการส่ง Screenshot

แนวทางของ comsiam คือเลือก Source ที่มีข้อมูลชัดที่สุดก่อนเสมอ ถ้ามีไฟล์ต้นฉบับก็ไม่จำเป็นต้องบังคับให้ AI อ่านข้อมูลทั้งหมดจากภาพ

🆚 Gemini อ่านข้อความจากรูปต่างจาก OCR อย่างไร

OCR หรือ Optical Character Recognition เป็นเทคโนโลยีที่ออกแบบมาเพื่อแปลงข้อความในภาพให้กลายเป็นข้อความดิจิทัล

Gemini สามารถทำงานคล้าย OCR ในแง่ที่ผู้ใช้สามารถส่งภาพแล้วขอให้อ่านข้อความได้ แต่ Gemini มีความสามารถด้านภาษาเพิ่มเติม เช่น

  • อธิบายความหมาย
  • สรุป
  • แปล
  • จัดหมวดหมู่
  • วิเคราะห์บริบท
  • ตอบคำถามต่อจากข้อความ

ตัวอย่างเช่น หลังอ่านข้อความจากใบประกาศ สามารถถามต่อได้ทันทีว่า

“ประกาศนี้มี Deadline วันไหน”

หรือ

“สรุปว่าผู้สมัครต้องเตรียมอะไรบ้าง”

📌 แต่ไม่ควรถือว่า Gemini เป็น OCR เฉพาะทางทุกกรณี

หากงานต้องถอดเอกสารหลายหมื่นหน้าและต้องการความแม่นยำระดับระบบ Production อาจต้องใช้เครื่องมือ OCR หรือ Document Processing ที่ออกแบบมาเฉพาะทาง

📱 ใช้กล้องมือถือให้ Gemini อ่านข้อความได้ไหม

บน Gemini Mobile App ในสภาพแวดล้อมที่รองรับ ผู้ใช้สามารถเปิดกล้อง ถ่ายภาพ แล้วถามคำถามเกี่ยวกับภาพนั้นได้

วิธีใช้งานเหมาะกับสถานการณ์ เช่น

  • อ่านป้าย
  • อ่านเมนู
  • แปลข้อความ
  • อ่าน Error จากอุปกรณ์
  • อ่าน Label
  • อ่านคู่มือ
  • อ่านเอกสารตรงหน้า

Prompt ตัวอย่าง

“อ่านข้อความบนป้ายนี้แล้วแปลเป็นภาษาไทย”

ช่วยให้ไม่ต้องถ่ายภาพเก็บไว้แล้วนำไปพิมพ์ใหม่ด้วยตัวเอง

📱 Gemini อ่านข้อความบนหน้าจอ Android ได้ไหม

Gemini บน Android มีความสามารถเกี่ยวกับ Screen Context ในสภาพแวดล้อมที่รองรับ

ผู้ใช้สามารถเรียก Gemini เหนือแอปที่กำลังเปิดอยู่ แล้วถามเกี่ยวกับสิ่งที่อยู่บนหน้าจอได้

ตัวอย่าง

“ข้อความบนหน้านี้หมายความว่าอะไร”

หรือ

“สรุปสิ่งที่อยู่บนหน้าจอนี้”

ความพร้อมใช้งานของฟีเจอร์อาจแตกต่างตามภาษา อุปกรณ์ บัญชี และประเทศ

🗂️ วิธีเปลี่ยนข้อความจากรูปให้เป็นข้อมูลมีโครงสร้าง

หลังถอดข้อความแล้ว สามารถให้ Gemini จัดใหม่ได้

ตัวอย่าง Prompt

“จากข้อความที่อ่านได้ในภาพ จัดข้อมูลเป็นตารางที่มีคอลัมน์:

ชื่อ | วันที่ | รายการ | จำนวน | หมายเหตุ”

หรือ

“เปลี่ยนข้อความทั้งหมดเป็น Bullet Point โดยห้ามเพิ่มข้อมูลใหม่”

หรือ

“จัดข้อมูลเป็น JSON โดยใช้เฉพาะค่าที่มองเห็นในภาพ หากค่าใดไม่มีให้ใช้ null”

วิธีนี้เหมาะกับการนำข้อมูลไปใช้ต่อใน Spreadsheet หรือระบบอื่น

🌐 วิธีแปลข้อความจากรูปทันที

สามารถรวมงานอ่านข้อความและแปลไว้ใน Prompt เดียว

ตัวอย่าง

“อ่านข้อความทั้งหมดจากภาพนี้ แล้วแสดงผลเป็นสองคอลัมน์:

ต้นฉบับ | ภาษาไทย

ห้ามตัดข้อความ และหากบรรทัดใดอ่านไม่ชัดให้ระบุตรง ๆ”

เหมาะสำหรับ

  • เมนูต่างประเทศ
  • ป้าย
  • คู่มือ
  • Screenshot
  • เอกสาร
  • Product Label

🔍 วิธีตรวจว่าข้อความที่ Gemini อ่านถูกหรือไม่

หลัง Gemini ถอดข้อความแล้ว อย่ารีบคัดลอกไปใช้หากข้อมูลสำคัญ

ให้สั่ง

“กลับไปตรวจภาพต้นฉบับอีกครั้ง แล้วทำรายการข้อความ ตัวเลข หรือสัญลักษณ์ที่คุณมีความมั่นใจต่ำ”

จากนั้นตรวจเฉพาะจุดเหล่านั้นกับภาพ

อีก Prompt ที่มีประโยชน์คือ

“เปรียบเทียบข้อความที่คุณถอดกับภาพทีละบรรทัด และแก้เฉพาะส่วนที่ยืนยันได้จากภาพ”

⚠️ สาเหตุที่ Gemini อ่านข้อความจากรูปผิด

ปัญหาส่วนใหญ่เกิดจากคุณภาพหรือ Layout ของภาพ

📷 ภาพเบลอ

ตัวอักษรติดกันจนแยกไม่ออก

🌑 ภาพมืด

Contrast ต่ำ

💡 แสงสะท้อน

ข้อความบางส่วนหายไป

📐 ภาพเอียง

ตัวหนังสือบิดเบี้ยว

🔡 Font เล็ก

รายละเอียด Pixel ไม่เพียงพอ

🎨 พื้นหลังซับซ้อน

ข้อความและ Background แยกออกจากกันยาก

✍️ ลายมือ

รูปทรงตัวอักษรไม่สม่ำเสมอ

📊 ตารางซับซ้อน

AI อาจจับ Row และ Column ผิด

🌐 หลายภาษา

ภาพเดียวที่มีหลายภาษาและ Font หลายแบบอาจซับซ้อนขึ้น

🛠️ Gemini อ่านข้อความผิด แก้อย่างไร

ลองแก้ตามลำดับ

❶ Crop รูป

เหลือเฉพาะข้อความสำคัญ

❷ เพิ่มความคมชัด

ใช้ภาพต้นฉบับหรือถ่ายใหม่

❸ ส่ง Close-up

โดยเฉพาะข้อความตัวเล็ก

❹ บอกภาษา

เช่น

“ข้อความนี้เป็นภาษาไทย”

❺ บอกตำแหน่ง

“อ่านเฉพาะกล่องด้านล่าง”

❻ แบ่งงาน

อย่าให้อ่านภาพขนาดใหญ่ทั้งหมดพร้อมกัน

❼ อัปโหลดใหม่

หาก Gemini แจ้งว่าไม่สามารถวิเคราะห์ไฟล์ได้อย่างถูกต้อง Google แนะนำให้ลองเพิ่มไฟล์ใหม่อีกครั้ง

🚫 อย่าให้ Gemini เดาตัวหนังสือที่มองไม่เห็น

นี่เป็นกฎที่สำคัญที่สุดสำหรับการอ่านข้อความจากภาพ

ใช้ Prompt

“หากตัวอักษรหรือเลขใดมองไม่เห็นชัด อย่าคาดเดา ให้ใช้ [?] แทน”

ตัวอย่าง

ภาพต้นฉบับ

Invoice No. 128?54

หากตัวเลขหนึ่งหลักไม่ชัด การให้ AI เดาว่าเป็น 3 อาจทำให้ข้อมูลผิดทันที

การระบุว่า

Invoice No. 128?54

มีประโยชน์กว่า เพราะผู้ใช้รู้ว่าต้องกลับไปตรวจจุดไหน

🔐 ระวังข้อมูลส่วนตัวใน Screenshot และรูปถ่าย

ภาพอาจมีข้อมูลที่ผู้ใช้ไม่ได้ตั้งใจให้ AI อ่าน เช่น

  • Email
  • เบอร์โทร
  • ชื่อบัญชี
  • QR Code
  • Barcode
  • เลขบัญชี
  • เลขบัตร
  • Password
  • API Key
  • Token
  • ที่อยู่
  • Notification ส่วนตัว

ก่อนอัปโหลดควร

  • Crop
  • Blur
  • ปิดบัง
  • ลบพื้นที่ที่ไม่เกี่ยวข้อง

หากต้องการให้ Gemini อ่าน Error เพียงหนึ่งบรรทัด ไม่จำเป็นต้องส่ง Screenshot ทั้งหน้าที่มีข้อมูลส่วนตัวจำนวนมาก

นี่เป็นอีกหลักที่ comsiam แนะนำให้ใช้กับงานวิเคราะห์ภาพทุกประเภท

💡 10 Prompt ให้ Gemini อ่านข้อความจากรูป

❶ อ่านทุกข้อความ

“อ่านข้อความทั้งหมดตามที่มองเห็น และรักษาลำดับเดิม”

❷ ห้ามเดา

“หากข้อความใดอ่านไม่ชัดให้ใส่ [อ่านไม่ชัด] ห้ามเดาคำ”

❸ อ่าน Screenshot

“อ่านข้อความจาก Screenshot จากบนลงล่าง โดยยังไม่ต้องอธิบาย”

❹ อ่าน Error

“ถอด Error Message และ Error Code แบบคำต่อคำก่อนอธิบาย”

❺ อ่านตาราง

“ถอดข้อมูลจากตารางโดยรักษา Row, Column และตัวเลข”

❻ อ่านแล้วแปล

“อ่านข้อความต้นฉบับแล้วแปลเป็นภาษาไทยทีละบรรทัด”

❼ อ่านใบเสร็จ

“ดึงวันที่ รายการ จำนวน ราคา และยอดรวมจากใบเสร็จ”

❽ อ่านเฉพาะจุด

“อ่านข้อความเฉพาะบริเวณมุมขวาบนของภาพ”

❾ สร้างตาราง

“นำข้อความที่อ่านได้มาจัดเป็นตารางโดยห้ามเพิ่มข้อมูล”

❿ ตรวจความถูกต้อง

“กลับไปตรวจภาพอีกครั้งและระบุข้อความที่คุณไม่มั่นใจ”

❓ คำถามที่พบบ่อย

Gemini อ่านข้อความจากรูปได้ไหม

ได้ Gemini Apps รองรับการใช้รูปภาพเป็นส่วนหนึ่งของ Prompt และสามารถตอบคำถามเกี่ยวกับสิ่งที่อยู่ในภาพ รวมถึงข้อความที่มองเห็นได้

Gemini อ่านภาษาไทยจากรูปได้ไหม

สามารถใช้รูปที่มีภาษาไทยได้ แต่ความถูกต้องขึ้นอยู่กับคุณภาพภาพ ขนาดตัวอักษร Font และความชัดเจนของข้อความ

Gemini อ่าน Screenshot ได้ไหม

ได้ สามารถเพิ่ม Screenshot แล้วถามเกี่ยวกับข้อความ Error เมนู หรือข้อมูลอื่นที่มองเห็นอยู่บนหน้าจอได้

Gemini อ่านลายมือได้ไหม

สามารถลองได้ แต่ความแม่นยำขึ้นอยู่กับความชัดเจนและรูปแบบลายมือมากกว่าข้อความพิมพ์ จึงควรตรวจผลลัพธ์กับต้นฉบับ

Gemini อ่านข้อความจากหลายรูปพร้อมกันได้ไหม

ได้ ปัจจุบัน Gemini Apps รองรับการเพิ่มไฟล์ที่รองรับได้สูงสุดประมาณ 10 ไฟล์ใน Prompt เดียว โดยขึ้นอยู่กับความพร้อมใช้งาน

Gemini อ่านข้อความจากรูปถูกต้อง 100% หรือไม่

ไม่ควรถือว่าถูกต้อง 100% โดยเฉพาะตัวเลข ตัวอักษรขนาดเล็ก ลายมือ ตาราง หรือภาพเบลอ ข้อมูลสำคัญควรตรวจจากภาพต้นฉบับอีกครั้ง

🎯 สรุป

วิธีให้ Gemini อ่านข้อความจากรูปภาพให้ได้ผลดีที่สุดคือใช้ ภาพคมชัด ถ่ายตรง Crop เฉพาะบริเวณที่ต้องการ และกำหนดให้ AI ห้ามเดาคำที่มองไม่ชัด

สำหรับงานสำคัญควรแยกกระบวนการเป็น 3 ขั้น ได้แก่ อ่านข้อความ → ตรวจข้อความ → นำข้อความไปสรุปหรือวิเคราะห์ แทนการขอให้ Gemini อ่านและตีความทุกอย่างพร้อมกันตั้งแต่ Prompt แรก

หากเป็น Screenshot ให้ใช้ภาพต้นฉบับแทนการถ่ายหน้าจอ หากเป็นตารางให้กำหนดให้รักษา Row และ Column และหากเป็นตัวเลขควรตรวจกลับกับภาพทุกครั้ง

Gemini จึงสามารถช่วยลดเวลาจากการพิมพ์ข้อความในรูปด้วยตัวเองได้มาก แต่คุณภาพของภาพและ Prompt ยังคงเป็นปัจจัยสำคัญต่อความถูกต้องของผลลัพธ์