Contact
Line : comsiam
Contact
Line : comsiam

Microsoft Copilot อ่าน PDF ไม่ได้ ต้องแก้อย่างไร? หากอัปโหลดไฟล์ PDF เข้า Microsoft Copilot สำเร็จแล้ว แต่ AI แจ้งว่าไม่สามารถอ่านเอกสารได้ สรุปเนื้อหาไม่ครบ อ่านภาษาไทยผิด หรือแสดงข้อความว่าไม่พบข้อมูลในไฟล์ ปัญหาอาจเกิดจาก PDF ที่เป็นภาพสแกน ไม่มีชั้นข้อความ (Text Layer) ไฟล์เสียหาย เอกสารถูกล็อก หรือข้อจำกัดของความสามารถในการประมวลผลเอกสาร
โดยเฉพาะไฟล์ PDF ที่สร้างจากเครื่องสแกนหรือถ่ายภาพเอกสาร แม้ผู้ใช้จะมองเห็นข้อความได้ชัดเจน แต่ระบบ AI อาจไม่สามารถดึงข้อความออกมาได้เหมือน PDF ที่สร้างจาก Word หรือโปรแกรมเอกสารโดยตรง
วิธีแก้ที่ควรลองก่อน คือ เปิด PDF แล้วทดลองลากเลือกและคัดลอกข้อความ หากคัดลอกไม่ได้ ให้ตรวจสอบว่าเป็นไฟล์สแกน และพิจารณาทำ OCR เพื่อเพิ่มชั้นข้อความ จากนั้นบันทึกเป็น PDF ใหม่ ทดลองแนบไฟล์ขนาดเล็ก และสั่งให้ Copilot ระบุว่ามองเห็นเนื้อหาใดบ้างก่อนเริ่มสรุป
สำหรับการแนบไฟล์ในแชต Copilot ทั่วไป Microsoft ระบุขีดจำกัด 50 MB ต่อไฟล์ และสูงสุด 20 ไฟล์ต่อบทสนทนา อย่างไรก็ตาม ความสามารถในการอ่านข้อความจากภาพและเอกสารสแกนขึ้นอยู่กับฟีเจอร์ที่ใช้ ไม่ได้หมายความว่าการแนบ PDF สำเร็จแล้ว AI จะอ่านเนื้อหาทุกประเภทได้ครบถ้วน
บทความนี้จาก comsiam จะสอนวิธีแก้ Microsoft Copilot อ่าน PDF ไม่ได้แบบละเอียด ครอบคลุมไฟล์สแกน OCR ภาษาไทย ตาราง ภาพประกอบ PDF ที่ล็อกด้วยรหัสผ่าน การสรุปเอกสารยาว และการใช้ Microsoft 365 Copilot กับไฟล์ใน OneDrive หรือ SharePoint
ปัญหาที่พบบ่อย ได้แก่
อัปโหลดไม่ได้ คือไฟล์ยังไม่ผ่านขั้นตอนแนบเข้าสู่ Copilot
อ่านไม่ได้ คือไฟล์แนบเข้ามาแล้ว แต่ Copilot ไม่สามารถดึงหรือตีความเนื้อหาได้ตามที่ต้องการ
สรุปผิด คือ Copilot สร้างคำตอบแล้ว แต่ข้อมูลไม่ครบหรือไม่ตรงต้นฉบับ
บทความนี้จะเน้นสองกรณีหลังเป็นหลัก
สาเหตุหลักที่ควรตรวจสอบมีดังนี้
| สาเหตุ | ผลกระทบที่อาจพบ |
|---|---|
| PDF เป็นภาพสแกน | ไม่สามารถเลือกหรือดึงข้อความได้ |
| ไม่มี Text Layer | AI อาจไม่พบข้อความที่ต้องการ |
| OCR ผิดพลาด | อักษรไทย ตัวเลข หรือชื่อเฉพาะคลาดเคลื่อน |
| PDF ถูกล็อก | ไม่สามารถเข้าถึงเนื้อหาบางส่วน |
| PDF เสียหาย | อ่านได้ไม่ครบหรือเปิดไม่ได้ |
| ไฟล์ใหญ่หรือซับซ้อน | ประมวลผลไม่สำเร็จหรือช้า |
| ตารางหลายคอลัมน์ | อ่านผิดลำดับหรือจับคู่ข้อมูลผิด |
| ข้อความอยู่ในภาพ | อาจไม่ได้รับการตีความครบ |
| สิทธิ์ OneDrive หรือ SharePoint | Copilot ไม่สามารถเข้าถึงไฟล์ |
| ฟีเจอร์มีข้อจำกัด | อ่านได้เพียงบางชนิดของเนื้อหา |
การมีนามสกุล .pdf ไม่ได้บอกว่าเอกสารมีข้อความที่คัดลอกหรือค้นหาได้จริง
ต้องตรวจสอบโครงสร้างภายในไฟล์ด้วย
นี่เป็นขั้นตอนสำคัญที่สุดสำหรับการวิเคราะห์ปัญหา PDF อ่านไม่ได้
ใช้ Microsoft Edge, Adobe Acrobat หรือโปรแกรม PDF ที่เชื่อถือได้
ใช้เมาส์ลากคลุมข้อความหนึ่งประโยค
กด Ctrl + C
กด Ctrl + V
หากข้อความปรากฏถูกต้อง แสดงว่า PDF มีข้อความที่สามารถดึงออกมาได้อย่างน้อยในส่วนที่ทดสอบ
หากเลือกข้อความไม่ได้เลย อาจเป็น PDF ภาพสแกน
หากคัดลอกได้แต่ข้อความกลายเป็นตัวอักษรผิดปกติ อาจมีปัญหาเรื่อง Text Encoding หรือ Text Mapping
PDF บางฉบับมีทั้งภาพสแกนและข้อความในไฟล์เดียวกัน
การทดสอบเพียงหน้าเดียวจึงไม่รับประกันว่าทุกหน้ามี Text Layer สมบูรณ์
| คุณสมบัติ | Text-Based PDF | Scanned PDF |
|---|---|---|
| ที่มา | สร้างจาก Word หรือโปรแกรมดิจิทัล | สแกนกระดาษหรือถ่ายภาพ |
| เลือกข้อความ | โดยทั่วไปทำได้ | อาจทำไม่ได้หากไม่มี OCR |
| ค้นหาคำ | โดยทั่วไปทำได้ | ต้องมี OCR หรือการรู้จำภาพที่รองรับ |
| ความแม่นยำในการดึงข้อความ | มักดีกว่า | ขึ้นอยู่กับคุณภาพภาพและ OCR |
| ข้อความภาษาไทย | อาจอ่านได้โดยตรง | เสี่ยงผิดจากการรู้จำตัวอักษร |
| ตาราง | ยังมีโอกาสอ่านผิด | มีความเสี่ยงสูงขึ้น |
| ความเหมาะกับ Copilot | โดยทั่วไปเหมาะกว่า | ควรตรวจสอบความสามารถของฟีเจอร์ |
PDF ที่ผ่าน OCR อาจมีภาพต้นฉบับพร้อม Text Layer ที่ค้นหาได้
แม้ต้นกำเนิดเป็นเอกสารสแกน แต่ระบบจะมีข้อมูลข้อความเพิ่มเติมให้ประมวลผล
อย่างไรก็ตาม OCR อาจถอดตัวอักษรผิด จึงยังต้องตรวจสอบความถูกต้อง
OCR (Optical Character Recognition) เป็นเทคโนโลยีรู้จำตัวอักษรจากภาพและแปลงเป็นข้อความที่นำไปค้นหา คัดลอก หรือประมวลผลต่อได้
ตัวอย่างเช่น เอกสารสัญญาที่สแกนจากกระดาษเป็น PDF ภาพ
เมื่อทำ OCR ระบบจะพยายามอ่านข้อความในภาพแล้วเพิ่มข้อมูลข้อความให้เอกสาร
ไม่รับประกัน
โดยเฉพาะเอกสารที่มี
จึงควรตรวจสอบผล OCR ก่อนส่งต่อให้ Copilot
สามารถใช้โปรแกรม PDF ที่มีความสามารถ OCR และรองรับภาษาเอกสาร
ไม่จำเป็น
หากฟีเจอร์ Copilot ที่ใช้ไม่มีความสามารถรู้จำข้อความจาก PDF สแกนที่เพียงพอ สามารถเตรียมไฟล์ด้วยเครื่องมือ OCR ที่เหมาะสมก่อน
ควรใช้เครื่องมือ OCR ที่บริษัทอนุญาต ไม่ควรนำเอกสารสำคัญไปอัปโหลดเว็บไซต์แปลงไฟล์สาธารณะโดยไม่มีการประเมินความปลอดภัย
ภาษาไทยมีลักษณะเฉพาะ เช่น สระบน สระล่าง วรรณยุกต์ และรูปแบบตัวอักษรที่อาจทำให้ OCR อ่านคลาดเคลื่อน
“อ่านเอกสารภาษาไทยฉบับนี้และสรุปเฉพาะข้อความที่ตรวจสอบได้ หากพบคำสะกดไม่ชัด ตัวเลขผิดปกติ หรือข้อความที่อ่านไม่ครบ ให้แจ้งตำแหน่งและอย่าเดาข้อมูลแทน”
ปัญหานี้อาจเกี่ยวข้องกับการฝังฟอนต์หรือการจับคู่รหัสตัวอักษรภายใน PDF
บางไฟล์แสดงข้อความถูกต้องเมื่อมองด้วยตา แต่เมื่อคัดลอกออกมากลับเป็นสัญลักษณ์หรืออักษรที่อ่านไม่ได้
การเปลี่ยนชื่อไฟล์ PDF ไม่สามารถแก้ปัญหาการเข้ารหัสตัวอักษรได้
หาก Copilot สรุปเฉพาะช่วงต้นหรือขาดรายละเอียดจากบางหน้า ควรตรวจสอบความยาว โครงสร้าง และคำสั่งที่ใช้
“ก่อนสรุป กรุณาระบุจำนวนบทหรือหัวข้อที่ตรวจพบจากเอกสารนี้ แล้วสรุปแยกทีละบท พร้อมระบุส่วนที่อ่านไม่ได้หรือข้อมูลที่ไม่สามารถยืนยันได้”
แม้ AI จะให้สรุปยาว ก็ไม่ได้ยืนยันว่าเข้าถึงทุกหน้าแล้ว
ต้องตรวจสอบส่วนสำคัญด้วยตนเอง
หากเอกสารยาวหรือมีเนื้อหาหลายประเภท สามารถแบ่งเป็นไฟล์ย่อยตามความเหมาะสม
เอกสาร 180 หน้า อาจแบ่งเป็น
หรือแบ่งตามช่วงหน้า โดยรักษาหน้าหัวข้อและตารางที่เกี่ยวข้องให้อยู่ด้วยกัน
การแบ่ง PDF อาจทำให้ข้อมูลอ้างอิงข้ามหน้าแตกออกจากกัน
ควรบันทึกช่วงหน้าของไฟล์ย่อยไว้เพื่อให้ตรวจสอบผลกลับไปยังต้นฉบับได้
ตารางเป็นหนึ่งในเนื้อหาที่ระบบ AI อาจตีความผิด โดยเฉพาะ PDF ที่มีหลายคอลัมน์หรือมีเส้นแบ่งไม่ชัด
“ดึงข้อมูลจากตารางยอดขายใน PDF นี้เป็นตารางข้อความ โดยรักษาชื่อคอลัมน์และค่าตัวเลขตามต้นฉบับ หากช่องใดอ่านไม่ชัดให้ใส่คำว่า ‘ต้องตรวจสอบ’ ห้ามเติมตัวเลขเอง”
หากต้องคำนวณการเงินหรือยอดขายจำนวนมาก ควรตรวจสอบข้อมูลใน Excel หรือเครื่องมือคำนวณที่เหมาะสม แทนการเชื่อผลคำนวณจาก AI อย่างเดียว
เอกสาร PDF อาจประกอบด้วย
ความสามารถอ่านข้อความไม่ได้หมายความว่าสามารถวิเคราะห์ภาพทุกชนิดใน PDF ได้ครบถ้วน
ควรใช้ตารางข้อมูลต้นฉบับเมื่อมี
การประมาณค่าจากตำแหน่งเส้นกราฟอาจคลาดเคลื่อน
PDF ที่มีรหัสผ่านหรือมีข้อจำกัดการเข้าถึงอาจไม่สามารถประมวลผลผ่าน Copilot ได้ตามปกติ
หากมีสิทธิ์และทราบรหัสผ่าน สามารถใช้โปรแกรม PDF ที่รองรับเพื่อจัดทำสำเนาที่เหมาะสมสำหรับการประมวลผลตามนโยบายขององค์กร
ให้ขอสำเนาที่อนุญาตจากเจ้าของข้อมูล
ไม่ควรพยายามข้ามรหัสผ่านหรือข้อจำกัดสิทธิ์โดยไม่ได้รับอนุญาต
เป็นไปได้
ไฟล์ PDF อาจเสียหายจากการดาวน์โหลดไม่สมบูรณ์ การถ่ายโอนข้อมูลขัดข้อง หรือขั้นตอนสร้างไฟล์ผิดพลาด
ไม่ควรใช้เครื่องมือซ่อม PDF ที่ไม่น่าเชื่อถือกับเอกสารที่มีข้อมูลอ่อนไหว
บางครั้งผู้ใช้เห็นข้อมูลในไฟล์ชัดเจน แต่ Copilot บอกว่าไม่พบ
“กรุณาระบุว่าคุณเข้าถึงข้อความในเอกสารนี้ได้หรือไม่ แล้วแสดงหัวข้อสำคัญที่พบจริง 5 หัวข้อ หากไม่พบข้อมูลให้แจ้งโดยไม่สร้างเนื้อหาขึ้นเอง”
การสรุป PDF อาจใช้เวลามากกว่าคำถามทั่วไป เพราะระบบต้องประมวลผลเนื้อหาเอกสารร่วมด้วย
การลดขนาดไฟล์ไม่ได้รับประกันว่าจะทำให้การสร้างคำตอบเร็วขึ้นทุกครั้ง เพราะเวลาประมวลผลขึ้นอยู่กับหลายปัจจัย
เพื่อหลีกเลี่ยงการสรุปผิด ควรระบุให้ใช้เฉพาะข้อมูลที่ตรวจสอบได้จากไฟล์
“สรุปเอกสาร PDF นี้เป็นภาษาไทย โดยใช้เฉพาะข้อมูลที่พบจริงในไฟล์
ข้อกำหนด:
หากสรุปทั้งไฟล์แล้วไม่ครบ ให้เปลี่ยนเป็นการถามเฉพาะประเด็น
Prompt 1
“เอกสารนี้มีหัวข้อหลักอะไรบ้าง?”
Prompt 2
“สรุปเฉพาะส่วนที่กล่าวถึงงบประมาณ”
Prompt 3
“ระบุตัวเลขต้นทุนและยอดรวมที่พบในส่วนงบประมาณ”
Prompt 4
“สรุปข้อเสนอแนะจากเอกสาร โดยไม่เพิ่มความคิดเห็นที่ไม่มีหลักฐาน”
Prompt 5
“ตรวจสอบว่ามีส่วนใดที่ยังไม่ได้สรุปหรืออ่านไม่สำเร็จ”
อย่างไรก็ตาม AI อาจยังไม่ทราบว่ามีส่วนใดตกหล่น จึงต้องเปรียบเทียบกับสารบัญและเอกสารต้นฉบับ
หากเปิด PDF ผ่าน Edge ได้ แต่ Copilot ไม่สามารถสรุปเนื้อหา ควรตรวจสอบว่า Copilot ได้รับไฟล์หรือบริบทเอกสารจริงหรือไม่
การเปิด PDF ในแท็บ Edge ไม่ได้หมายความว่า Copilot ทุกประสบการณ์สามารถอ่านเนื้อหาแท็บนั้นได้โดยอัตโนมัติ
ต้องตรวจสอบสิทธิ์และรูปแบบการทำงานของฟีเจอร์ที่ใช้
หากใช้ Copilot บนมือถือแล้วอ่าน PDF ไม่ได้ ควรตรวจสอบทั้งไฟล์และแอป
อาจเกี่ยวข้องกับแอปหรือประสบการณ์ Copilot บนอุปกรณ์นั้น
ควรใช้บัญชีและไฟล์เดียวกันเพื่อเปรียบเทียบผล
สำหรับผู้ใช้ Microsoft 365 ไฟล์ PDF อาจอยู่ใน OneDrive แทนการอัปโหลดจากเครื่อง
ให้ตรวจสอบว่าไฟล์สามารถเข้าถึงได้จากบัญชีเดียวกันและฟีเจอร์ที่ใช้รองรับการดึงข้อมูลจากตำแหน่งนั้นหรือไม่
PDF ใน SharePoint อาจได้รับการคุ้มครองด้วยสิทธิ์และนโยบายขององค์กร
ห้ามเปลี่ยนสิทธิ์ไฟล์เป็น Everyone เพื่อแก้ปัญหา AI อ่านไฟล์ไม่ได้
องค์กรอาจกำหนดไม่ให้ AI ประมวลผลเอกสารบางประเภท เพื่อป้องกันข้อมูลรั่วไหล
ตัวอย่าง ได้แก่
ไม่ควรใช้ OCR เพื่อพยายามหลบข้อจำกัด DLP
การแปลงไฟล์ไม่ได้ทำให้ข้อมูลลับกลายเป็นข้อมูลที่สามารถเผยแพร่ได้โดยอัตโนมัติ
แม้ Copilot อ่าน PDF และสร้างคำตอบได้แล้ว ยังต้องตรวจสอบความถูกต้องก่อนนำไปใช้จริง
เพราะ Generative AI อาจให้คำตอบที่ดูสมเหตุสมผลแม้เนื้อหาผิด
เอกสารที่เกี่ยวข้องกับการเงิน กฎหมาย สัญญา หรือข้อมูลลูกค้า ควรมีผู้รับผิดชอบตรวจสอบก่อนใช้งาน
| อาการ | สาเหตุที่ควรตรวจสอบ | วิธีแก้ |
|---|---|---|
| อ่านข้อความไม่ได้เลย | PDF เป็นภาพ | ตรวจ Text Layer และ OCR |
| คัดลอกข้อความไม่ได้ | ไม่มีชั้นข้อความหรือมีข้อจำกัด | ตรวจชนิด PDF และสิทธิ์ |
| ภาษาไทยผิด | OCR หรือ Text Mapping | ทำ OCR ใหม่และตรวจคำ |
| อ่านได้แค่บางหน้า | โครงสร้างหรือข้อจำกัดการประมวลผล | สรุปเป็นส่วน |
| ตารางผิด | Layout ซับซ้อน | ตรวจข้อมูลกับตารางต้นฉบับ |
| กราฟไม่ครบ | ความสามารถวิเคราะห์ภาพ | ใช้ข้อมูลต้นทางหรือฟีเจอร์ที่รองรับ |
| PDF มีรหัสผ่าน | เอกสารถูกล็อก | ขอสำเนาที่ได้รับอนุญาต |
| PDF เปิดไม่ได้ | ไฟล์เสีย | ขอหรือสร้างไฟล์ใหม่ |
| สรุปช้า | งานหรือไฟล์ซับซ้อน | จำกัดขอบเขตและแบ่งงาน |
| OneDrive ไม่พบไฟล์ | บัญชีหรือสิทธิ์ | ตรวจการเข้าถึง |
| SharePoint ไม่ให้ใช้ | Permissions หรือ DLP | ติดต่อ IT |
| สรุปผิดจากต้นฉบับ | AI ตีความผิด | ตรวจผลกับเอกสาร |
ได้ ในประสบการณ์ที่รองรับการแนบและประมวลผล PDF แต่ความสามารถอ่านข้อความ ตาราง และภาพขึ้นอยู่กับโครงสร้างไฟล์และฟีเจอร์ที่ใช้
ขึ้นอยู่กับความสามารถประมวลผลภาพของฟีเจอร์นั้น หากอ่านไม่ได้ควรตรวจสอบและใช้ OCR เพื่อสร้างข้อความที่ค้นหาได้ก่อน
สามารถประมวลผลเนื้อหาภาษาไทยในความสามารถที่รองรับ แต่ไฟล์สแกนหรือ Text Layer ที่ผิดอาจทำให้คำสะกดและตัวเลขคลาดเคลื่อน
อาจเกิดจากไฟล์เป็นภาพสแกน มีข้อจำกัดสิทธิ์ เนื้อหาซับซ้อน หรือระบบไม่สามารถอ่านบางส่วนได้
OCR คือเทคโนโลยีรู้จำตัวอักษรจากภาพ ช่วยแปลงข้อความบนกระดาษสแกนให้เป็นข้อมูลที่ค้นหาและประมวลผลได้
ไม่จำเป็น หาก PDF มี Text Layer ที่ถูกต้องและระบบอ่านได้อยู่แล้ว
ไม่เสมอไป อาจเกิดจากข้อจำกัดการคัดลอกหรือโครงสร้างข้อความภายในไฟล์ ต้องตรวจสอบเพิ่มเติม
ไม่มีจำนวนหน้าสูงสุดเพียงค่าเดียวที่ใช้ยืนยันได้สำหรับทุกประสบการณ์ Copilot ควรตรวจสอบข้อจำกัดของผลิตภัณฑ์และงานที่ใช้ ไม่ควรนำขีดจำกัดจากบริการ OCR อื่นของ Microsoft มาใช้แทนโดยตรง
สำหรับการแนบไฟล์ในแชต Copilot ทั่วไป Microsoft ระบุสูงสุด 50 MB ต่อไฟล์
ตรวจสอบตารางและตัวเลขกับต้นฉบับ หากจำเป็นให้ดึงข้อมูลเป็นตารางก่อนวิเคราะห์ และคำนวณด้วยเครื่องมือที่ตรวจสอบได้
ไฟล์ที่มีการเข้ารหัสหรือข้อจำกัดอาจประมวลผลไม่ได้ ควรใช้สำเนาที่ได้รับอนุญาตจากเจ้าของไฟล์
ทำได้ในประสบการณ์ที่รองรับและเมื่อบัญชีมีสิทธิ์เข้าถึงไฟล์
อาจเกี่ยวข้องกับ Permissions, Sensitivity Labels, DLP หรือข้อจำกัดของฟีเจอร์
ขึ้นอยู่กับความสามารถวิเคราะห์ภาพและเอกสารของผลิตภัณฑ์ที่ใช้ ควรตรวจสอบค่าจากตารางต้นทางหากต้องการความแม่นยำ
กำหนดให้ใช้เฉพาะข้อมูลในไฟล์ ขอให้แยกส่วนที่อ่านไม่ได้ และตรวจสอบคำตอบกับเอกสารต้นฉบับ
Microsoft Copilot อ่าน PDF ไม่ได้มักเกิดจากโครงสร้างไฟล์ โดยเฉพาะ PDF สแกนที่ไม่มี Text Layer เอกสารที่เข้ารหัส ตารางซับซ้อน หรือข้อมูลที่ระบบอ่านได้ไม่ครบ
ขั้นตอนแรกที่ควรทำคือเปิด PDF แล้วทดลองเลือกและคัดลอกข้อความ
หากเลือกข้อความไม่ได้ ให้ตรวจสอบว่าเป็นไฟล์สแกนและพิจารณาทำ OCR เพื่อสร้าง PDF แบบค้นหาได้
หากคัดลอกข้อความได้ แต่ Copilot ยังอ่านไม่ได้ ให้ทดลองเปิด New Chat แนบ PDF ขนาดเล็ก ตรวจสอบสิทธิ์ และสั่งให้ AI ระบุข้อมูลที่อ่านได้ก่อนเริ่มสรุป
หากเป็นไฟล์จาก OneDrive หรือ SharePoint ต้องตรวจสอบสิทธิ์และนโยบายการปกป้องข้อมูลขององค์กรเพิ่มเติม
ข้อแนะนำจาก comsiam: ก่อนแปลง PDF ใหม่ทั้งหมด ให้ทดลอง คัดลอกหนึ่งย่อหน้าไปวางใน Notepad หากข้อความถูกต้อง ปัญหาอาจไม่ได้เกิดจาก OCR แต่เกี่ยวข้องกับการเข้าถึงหรือการประมวลผลของ Copilot หากข้อความผิดหรือคัดลอกไม่ได้ จึงค่อยตรวจสอบ PDF สแกนและ Text Layer วิธีนี้ช่วยแก้ปัญหาได้ตรงจุดและลดการแปลงไฟล์โดยไม่จำเป็น
ComSiam Professional Team