Contact
Line : comsiam
Contact
Line : comsiam

Google Gemini สามารถอ่านข้อความจากรูปภาพ Screenshot ภาพเอกสาร ป้าย เมนู ตาราง และข้อความที่ถ่ายจากกล้อง แล้วนำข้อความเหล่านั้นมาสรุป แปลภาษา จัดรูปแบบใหม่ หรืออธิบายต่อได้ทันที เหมาะสำหรับกรณีที่ไม่ต้องการพิมพ์ข้อความจากภาพด้วยตัวเอง
วิธีใช้งานที่ได้ผลดีที่สุดคืออัปโหลดภาพที่คมชัด แล้วระบุให้ Gemini อ่านข้อความตามที่มองเห็นก่อน โดยไม่เดาคำที่ไม่ชัด จากนั้นจึงค่อยสั่งงานต่อ เช่น แปล สรุป จัดเป็นตาราง หรือวิเคราะห์ความหมาย
ได้ Gemini Apps รองรับการใช้รูปภาพเป็นข้อมูลประกอบ Prompt และสามารถตอบคำถามเกี่ยวกับสิ่งที่อยู่ในภาพได้
จึงสามารถนำมาใช้กับงานอ่านข้อความจากภาพ เช่น
Gemini สามารถอ่านข้อความแล้วนำ Context รอบ ๆ ภาพมาช่วยอธิบายความหมายเพิ่มเติมได้ด้วย
ขั้นตอนทำได้ง่ายทั้งคอมพิวเตอร์และมือถือ
เข้าสู่ Gemini ด้วยบัญชี Google
หากเป็นงานใหม่ ควรเริ่มแชตใหม่เพื่อให้ Context ไม่ปะปนกับบทสนทนาเก่า
เลือกเมนูเพิ่มไฟล์หรือเพิ่มรูปภาพบริเวณช่อง Prompt
จากนั้นเลือกภาพจากอุปกรณ์
บนมือถือที่รองรับ สามารถเปิดกล้อง ถ่ายภาพ แล้วถาม Gemini เกี่ยวกับภาพนั้นได้โดยตรง
ควรดูว่า
Prompt ง่ายที่สุดคือ
“อ่านข้อความทั้งหมดที่มองเห็นในภาพนี้ แล้วถอดออกมาเป็นข้อความ”
แต่ถ้าต้องการความแม่นยำมากขึ้น ควรกำหนดรายละเอียดเพิ่มเติม
ใช้ Prompt นี้ได้ทันที
“อ่านข้อความทั้งหมดที่มองเห็นในรูปภาพนี้ตามลำดับเดิม
กฎ:
Prompt นี้เหมาะกับการดึงข้อความออกจากภาพก่อนนำไปใช้งานต่อ
คุณภาพของภาพมีผลต่อความถูกต้องมากกว่าความยาวของ Prompt
ควรให้กล้องขนานกับหน้ากระดาษ
หากถ่ายจากด้านข้าง ตัวหนังสือด้านหนึ่งอาจเล็กกว่าหรือบิดเบี้ยว
หลีกเลี่ยง
ตัวหนังสือควรมีขนาดใหญ่พอที่จะอ่านได้
ถ้าเอกสารมีตัวหนังสือขนาดเล็ก ควรถ่ายแยกทีละส่วน
ตรวจ Focus ก่อนส่ง
หากต้องการอ่านข้อความเฉพาะกระดาษ ไม่จำเป็นต้องรวมโต๊ะ มือ หรือสิ่งของอื่น ๆ เข้าไปในภาพมากเกินไป
Screenshot มักให้ผลดีกว่าการถ่ายหน้าจอด้วยกล้อง เพราะข้อความมีความคมชัดกว่า
สามารถใช้กับ
ตัวอย่าง Prompt
“อ่านข้อความทั้งหมดจาก Screenshot นี้ตามตำแหน่งจากบนลงล่าง โดยยังไม่ต้องอธิบาย”
หลังจากได้ข้อความแล้วค่อยสั่ง
“จากข้อความที่อ่านได้ อธิบายว่าหน้าจอนี้กำลังแจ้งอะไร”
วิธีนี้แยกขั้นตอน อ่านข้อความ และ ตีความข้อความ ออกจากกัน ทำให้ตรวจสอบคำตอบได้ง่ายขึ้น
หากหน้าจอขึ้น Error ไม่จำเป็นต้องพิมพ์ Error Code เอง
ถ่าย Screenshot แล้วใช้ Prompt
“อ่านข้อความ Error ในภาพนี้แบบคำต่อคำก่อน โดยรักษา Error Code และตัวเลขทั้งหมด หลังจากนั้นจึงอธิบายความหมายของ Error และเสนอวิธีแก้”
ควรให้ผลลัพธ์แบ่งเป็น
แสดง Error ต้นฉบับ
อธิบายว่า Error เกี่ยวกับอะไร
เรียงสาเหตุที่เป็นไปได้
เริ่มจากวิธีที่ง่ายและมีความเสี่ยงต่ำก่อน
วิธีนี้เหมาะมากกับงานแก้ปัญหาคอมพิวเตอร์ มือถือ Router และ Software
สามารถทำสองขั้นตอนใน Prompt เดียวได้
ตัวอย่าง
“อ่านข้อความภาษาอังกฤษทั้งหมดจากภาพนี้ก่อน จากนั้นแปลเป็นภาษาไทย โดยแสดงต้นฉบับและคำแปลคู่กันทีละบรรทัด”
รูปแบบผลลัพธ์จะช่วยให้ตรวจได้ว่าข้อความต้นฉบับถูกอ่านถูกหรือไม่ก่อนเชื่อคำแปล
เพิ่มว่า
“ชื่อ Menu, Function, Product, Error Code และศัพท์เทคนิคให้คงภาษาอังกฤษไว้ และใส่คำแปลไทยในวงเล็บเมื่อจำเป็น”
เหมาะกับ Screenshot โปรแกรมและคู่มือ
สามารถใช้รูปที่มีข้อความภาษาไทยกับ Gemini ได้
แต่ความแม่นยำยังขึ้นอยู่กับ
หากตัวอักษรไทยบางตัวคล้ายกัน หรือภาพมีความละเอียดต่ำ ควรตรวจข้อความต้นฉบับอีกครั้ง
“อ่านข้อความภาษาไทยจากภาพนี้ตามที่เห็นจริง หากพยัญชนะ สระ วรรณยุกต์ หรือตัวเลขส่วนใดอ่านไม่ชัด ห้ามเดา ให้ระบุ [อ่านไม่ชัด]”
กรณีมีตาราง ไม่ควรสั่งเพียง
“อ่านข้อความ”
ควรบอกให้รักษาความสัมพันธ์ระหว่าง Row และ Column
ใช้ Prompt
“อ่านตารางจากภาพนี้ แล้วสร้างตารางใหม่โดยรักษา Header, Row, Column, ตัวเลข และหน่วยให้ตรงกับต้นฉบับ หาก Cell ใดอ่านไม่ชัดให้ใส่ [อ่านไม่ชัด] และห้ามประมาณค่าตัวเลข”
หลังจากนั้นสั่ง
“กลับไปตรวจภาพอีกครั้ง แล้วระบุ Cell ที่คุณมีความมั่นใจต่ำ”
โดยเฉพาะข้อมูลประเภท
ตัวเลขผิดเพียงหนึ่งหลักอาจเปลี่ยนความหมายของข้อมูลทั้งหมด
สามารถใช้ Gemini ช่วยอ่านข้อความที่มองเห็นจากใบเสร็จได้
ตัวอย่าง Prompt
“อ่านข้อความจากใบเสร็จนี้ แล้วแยกเป็นตารางที่มี:
หากข้อมูลส่วนใดอ่านไม่ชัด ให้ระบุว่าอ่านไม่ชัด ห้ามเดาตัวเลข”
ใบเสร็จบางประเภทอาจมี
ควรปกปิดข้อมูลที่ไม่จำเป็นก่อนอัปโหลด
หากภาพมีข้อความยาว อย่าขอให้ Gemini สรุปทันที
ใช้ Workflow ดังนี้
“อ่านข้อความทั้งหมดตามต้นฉบับ”
“แสดงรายการคำที่คุณไม่มั่นใจ”
หากผู้ใช้สามารถดูต้นฉบับ ให้ช่วยบอกคำที่ถูกต้อง
“จากข้อความที่ยืนยันแล้ว สรุปใจความสำคัญ”
วิธีนี้ช่วยลดปัญหาการสรุปจากข้อความที่อ่านผิดตั้งแต่ต้น
สามารถลองใช้ Gemini กับภาพลายมือได้ แต่ความแม่นยำจะแตกต่างจากข้อความพิมพ์อย่างมาก
ลายมือที่
มีโอกาสอ่านได้ง่ายกว่า
ลายมือที่
“ถอดข้อความลายมือจากภาพนี้ตามที่มองเห็น หากคำใดไม่สามารถยืนยันได้ ให้ใส่ [ไม่แน่ใจ] แทนการเดา”
สำหรับข้อมูลสำคัญไม่ควรใช้ผลลัพธ์จาก AI เป็นฉบับสุดท้ายโดยไม่ตรวจต้นฉบับ
หากเอกสารมีหลายหน้า สามารถถ่ายเป็นหลายภาพแล้วส่งให้ Gemini วิเคราะห์ร่วมกันได้
ปัจจุบัน Gemini Apps รองรับไฟล์ที่รองรับได้สูงสุดประมาณ 10 ไฟล์ต่อ Prompt โดยขึ้นอยู่กับความพร้อมใช้งาน
ตัวอย่าง Prompt
“ภาพเหล่านี้เป็นเอกสารต่อเนื่องกัน ให้อ่านข้อความตามลำดับไฟล์ 1–5 และแบ่งผลลัพธ์เป็นหน้า 1, หน้า 2, หน้า 3, หน้า 4 และหน้า 5 ห้ามรวมข้อความจากแต่ละหน้าเข้าด้วยกัน”
เมื่อถอดข้อความครบแล้วค่อยสั่ง
“รวมข้อความทั้งหมดตามลำดับและจัดย่อหน้าให้อ่านง่าย โดยห้ามเปลี่ยนเนื้อหา”
ไม่จำเป็นต้องให้ Gemini อ่านทั้งภาพทุกครั้ง
สามารถระบุตำแหน่ง เช่น
“อ่านข้อความเฉพาะกรอบสีแดงตรงกลางภาพ”
หรือ
“อ่านข้อความบริเวณมุมขวาบนเท่านั้น”
หรือ
“อ่านเฉพาะ Column ราคา”
การจำกัดพื้นที่ช่วยลดความสับสน โดยเฉพาะ Screenshot ที่มีข้อมูลจำนวนมาก
วิธีที่ดีที่สุดคือไม่พยายามใช้ภาพเดิมต่อไปเรื่อย ๆ
ให้
ตัดเฉพาะข้อความที่ต้องการ
ขยายข้อความก่อน Capture ใหม่
หลีกเลี่ยงภาพที่ผ่านการบีบอัดหลายครั้ง
แทนการส่ง Screenshot ยาวทั้งหน้า
ถ้ามี PDF, Word หรือ Spreadsheet จริง การอัปโหลดไฟล์ต้นฉบับมักเหมาะกว่าการส่ง Screenshot
แนวทางของ comsiam คือเลือก Source ที่มีข้อมูลชัดที่สุดก่อนเสมอ ถ้ามีไฟล์ต้นฉบับก็ไม่จำเป็นต้องบังคับให้ AI อ่านข้อมูลทั้งหมดจากภาพ
OCR หรือ Optical Character Recognition เป็นเทคโนโลยีที่ออกแบบมาเพื่อแปลงข้อความในภาพให้กลายเป็นข้อความดิจิทัล
Gemini สามารถทำงานคล้าย OCR ในแง่ที่ผู้ใช้สามารถส่งภาพแล้วขอให้อ่านข้อความได้ แต่ Gemini มีความสามารถด้านภาษาเพิ่มเติม เช่น
ตัวอย่างเช่น หลังอ่านข้อความจากใบประกาศ สามารถถามต่อได้ทันทีว่า
“ประกาศนี้มี Deadline วันไหน”
หรือ
“สรุปว่าผู้สมัครต้องเตรียมอะไรบ้าง”
หากงานต้องถอดเอกสารหลายหมื่นหน้าและต้องการความแม่นยำระดับระบบ Production อาจต้องใช้เครื่องมือ OCR หรือ Document Processing ที่ออกแบบมาเฉพาะทาง
บน Gemini Mobile App ในสภาพแวดล้อมที่รองรับ ผู้ใช้สามารถเปิดกล้อง ถ่ายภาพ แล้วถามคำถามเกี่ยวกับภาพนั้นได้
วิธีใช้งานเหมาะกับสถานการณ์ เช่น
Prompt ตัวอย่าง
“อ่านข้อความบนป้ายนี้แล้วแปลเป็นภาษาไทย”
ช่วยให้ไม่ต้องถ่ายภาพเก็บไว้แล้วนำไปพิมพ์ใหม่ด้วยตัวเอง
Gemini บน Android มีความสามารถเกี่ยวกับ Screen Context ในสภาพแวดล้อมที่รองรับ
ผู้ใช้สามารถเรียก Gemini เหนือแอปที่กำลังเปิดอยู่ แล้วถามเกี่ยวกับสิ่งที่อยู่บนหน้าจอได้
ตัวอย่าง
“ข้อความบนหน้านี้หมายความว่าอะไร”
หรือ
“สรุปสิ่งที่อยู่บนหน้าจอนี้”
ความพร้อมใช้งานของฟีเจอร์อาจแตกต่างตามภาษา อุปกรณ์ บัญชี และประเทศ
หลังถอดข้อความแล้ว สามารถให้ Gemini จัดใหม่ได้
ตัวอย่าง Prompt
“จากข้อความที่อ่านได้ในภาพ จัดข้อมูลเป็นตารางที่มีคอลัมน์:
ชื่อ | วันที่ | รายการ | จำนวน | หมายเหตุ”
หรือ
“เปลี่ยนข้อความทั้งหมดเป็น Bullet Point โดยห้ามเพิ่มข้อมูลใหม่”
หรือ
“จัดข้อมูลเป็น JSON โดยใช้เฉพาะค่าที่มองเห็นในภาพ หากค่าใดไม่มีให้ใช้ null”
วิธีนี้เหมาะกับการนำข้อมูลไปใช้ต่อใน Spreadsheet หรือระบบอื่น
สามารถรวมงานอ่านข้อความและแปลไว้ใน Prompt เดียว
ตัวอย่าง
“อ่านข้อความทั้งหมดจากภาพนี้ แล้วแสดงผลเป็นสองคอลัมน์:
ต้นฉบับ | ภาษาไทย
ห้ามตัดข้อความ และหากบรรทัดใดอ่านไม่ชัดให้ระบุตรง ๆ”
เหมาะสำหรับ
หลัง Gemini ถอดข้อความแล้ว อย่ารีบคัดลอกไปใช้หากข้อมูลสำคัญ
ให้สั่ง
“กลับไปตรวจภาพต้นฉบับอีกครั้ง แล้วทำรายการข้อความ ตัวเลข หรือสัญลักษณ์ที่คุณมีความมั่นใจต่ำ”
จากนั้นตรวจเฉพาะจุดเหล่านั้นกับภาพ
อีก Prompt ที่มีประโยชน์คือ
“เปรียบเทียบข้อความที่คุณถอดกับภาพทีละบรรทัด และแก้เฉพาะส่วนที่ยืนยันได้จากภาพ”
ปัญหาส่วนใหญ่เกิดจากคุณภาพหรือ Layout ของภาพ
ตัวอักษรติดกันจนแยกไม่ออก
Contrast ต่ำ
ข้อความบางส่วนหายไป
ตัวหนังสือบิดเบี้ยว
รายละเอียด Pixel ไม่เพียงพอ
ข้อความและ Background แยกออกจากกันยาก
รูปทรงตัวอักษรไม่สม่ำเสมอ
AI อาจจับ Row และ Column ผิด
ภาพเดียวที่มีหลายภาษาและ Font หลายแบบอาจซับซ้อนขึ้น
ลองแก้ตามลำดับ
เหลือเฉพาะข้อความสำคัญ
ใช้ภาพต้นฉบับหรือถ่ายใหม่
โดยเฉพาะข้อความตัวเล็ก
เช่น
“ข้อความนี้เป็นภาษาไทย”
“อ่านเฉพาะกล่องด้านล่าง”
อย่าให้อ่านภาพขนาดใหญ่ทั้งหมดพร้อมกัน
หาก Gemini แจ้งว่าไม่สามารถวิเคราะห์ไฟล์ได้อย่างถูกต้อง Google แนะนำให้ลองเพิ่มไฟล์ใหม่อีกครั้ง
นี่เป็นกฎที่สำคัญที่สุดสำหรับการอ่านข้อความจากภาพ
ใช้ Prompt
“หากตัวอักษรหรือเลขใดมองไม่เห็นชัด อย่าคาดเดา ให้ใช้ [?] แทน”
ตัวอย่าง
ภาพต้นฉบับ
Invoice No. 128?54
หากตัวเลขหนึ่งหลักไม่ชัด การให้ AI เดาว่าเป็น 3 อาจทำให้ข้อมูลผิดทันที
การระบุว่า
Invoice No. 128?54
มีประโยชน์กว่า เพราะผู้ใช้รู้ว่าต้องกลับไปตรวจจุดไหน
ภาพอาจมีข้อมูลที่ผู้ใช้ไม่ได้ตั้งใจให้ AI อ่าน เช่น
ก่อนอัปโหลดควร
หากต้องการให้ Gemini อ่าน Error เพียงหนึ่งบรรทัด ไม่จำเป็นต้องส่ง Screenshot ทั้งหน้าที่มีข้อมูลส่วนตัวจำนวนมาก
นี่เป็นอีกหลักที่ comsiam แนะนำให้ใช้กับงานวิเคราะห์ภาพทุกประเภท
“อ่านข้อความทั้งหมดตามที่มองเห็น และรักษาลำดับเดิม”
“หากข้อความใดอ่านไม่ชัดให้ใส่ [อ่านไม่ชัด] ห้ามเดาคำ”
“อ่านข้อความจาก Screenshot จากบนลงล่าง โดยยังไม่ต้องอธิบาย”
“ถอด Error Message และ Error Code แบบคำต่อคำก่อนอธิบาย”
“ถอดข้อมูลจากตารางโดยรักษา Row, Column และตัวเลข”
“อ่านข้อความต้นฉบับแล้วแปลเป็นภาษาไทยทีละบรรทัด”
“ดึงวันที่ รายการ จำนวน ราคา และยอดรวมจากใบเสร็จ”
“อ่านข้อความเฉพาะบริเวณมุมขวาบนของภาพ”
“นำข้อความที่อ่านได้มาจัดเป็นตารางโดยห้ามเพิ่มข้อมูล”
“กลับไปตรวจภาพอีกครั้งและระบุข้อความที่คุณไม่มั่นใจ”
ได้ Gemini Apps รองรับการใช้รูปภาพเป็นส่วนหนึ่งของ Prompt และสามารถตอบคำถามเกี่ยวกับสิ่งที่อยู่ในภาพ รวมถึงข้อความที่มองเห็นได้
สามารถใช้รูปที่มีภาษาไทยได้ แต่ความถูกต้องขึ้นอยู่กับคุณภาพภาพ ขนาดตัวอักษร Font และความชัดเจนของข้อความ
ได้ สามารถเพิ่ม Screenshot แล้วถามเกี่ยวกับข้อความ Error เมนู หรือข้อมูลอื่นที่มองเห็นอยู่บนหน้าจอได้
สามารถลองได้ แต่ความแม่นยำขึ้นอยู่กับความชัดเจนและรูปแบบลายมือมากกว่าข้อความพิมพ์ จึงควรตรวจผลลัพธ์กับต้นฉบับ
ได้ ปัจจุบัน Gemini Apps รองรับการเพิ่มไฟล์ที่รองรับได้สูงสุดประมาณ 10 ไฟล์ใน Prompt เดียว โดยขึ้นอยู่กับความพร้อมใช้งาน
ไม่ควรถือว่าถูกต้อง 100% โดยเฉพาะตัวเลข ตัวอักษรขนาดเล็ก ลายมือ ตาราง หรือภาพเบลอ ข้อมูลสำคัญควรตรวจจากภาพต้นฉบับอีกครั้ง
วิธีให้ Gemini อ่านข้อความจากรูปภาพให้ได้ผลดีที่สุดคือใช้ ภาพคมชัด ถ่ายตรง Crop เฉพาะบริเวณที่ต้องการ และกำหนดให้ AI ห้ามเดาคำที่มองไม่ชัด
สำหรับงานสำคัญควรแยกกระบวนการเป็น 3 ขั้น ได้แก่ อ่านข้อความ → ตรวจข้อความ → นำข้อความไปสรุปหรือวิเคราะห์ แทนการขอให้ Gemini อ่านและตีความทุกอย่างพร้อมกันตั้งแต่ Prompt แรก
หากเป็น Screenshot ให้ใช้ภาพต้นฉบับแทนการถ่ายหน้าจอ หากเป็นตารางให้กำหนดให้รักษา Row และ Column และหากเป็นตัวเลขควรตรวจกลับกับภาพทุกครั้ง
Gemini จึงสามารถช่วยลดเวลาจากการพิมพ์ข้อความในรูปด้วยตัวเองได้มาก แต่คุณภาพของภาพและ Prompt ยังคงเป็นปัจจัยสำคัญต่อความถูกต้องของผลลัพธ์