สรุป: Multimodal AI สำหรับงานจริง
ทบทวนภาพ OCR, PDF ตาราง, เสียง, วิดีโอ, provenance และ evaluation
เป้าหมาย: เลือกขั้นตอนตรวจตาม modality และผลกระทบ · ใช้เวลาประมาณ 14 นาที
ข้อ 1
โมเดลเห็นสื่อเหมือนคนทุกส่วนหรือไม่
- ใช่
- ไม่ใช่ resolution และ sampling ทำให้รายละเอียดหาย
ดูคำตอบและคำอธิบาย
ไม่ใช่ resolution และ sampling ทำให้รายละเอียดหาย ระบบอาจย่อภาพ เลือกเฟรม หรือแปลงเสียงก่อนประมวลผล
ข้อ 2
ตัวเลข OCR ควรทำอย่างไร
- เชื่อทันที
- เทียบตำแหน่งในภาพและตรวจยอด
ดูคำตอบและคำอธิบาย
เทียบตำแหน่งในภาพและตรวจยอด เลข จุดทศนิยม และตัวอักษรคล้ายกันเป็นจุดผิดพลาดที่มีผลสูง
ข้อ 3
ตาราง PDF ต้องเก็บอะไร
- ข้อความอย่างเดียว
- หัวคอลัมน์ หน่วย หน้า footnote และผลรวม
ดูคำตอบและคำอธิบาย
หัวคอลัมน์ หน่วย หน้า footnote และผลรวม layout และหมายเหตุเป็นส่วนหนึ่งของความหมายตาราง
ข้อ 4
transcript สำคัญควรมีอะไร
- สรุปอย่างเดียว
- ผู้พูด timestamp และช่วงไม่แน่ใจ
ดูคำตอบและคำอธิบาย
ผู้พูด timestamp และช่วงไม่แน่ใจ สิ่งเหล่านี้ช่วยกลับไปฟังและไม่เปลี่ยนผู้พูดหรือมติ
ข้อ 5
วิดีโอ sampling เสี่ยงอะไร
- ข้ามเหตุการณ์สั้น
- ทำให้ไฟล์เสียงดังขึ้น
ดูคำตอบและคำอธิบาย
ข้ามเหตุการณ์สั้น เฟรมที่ระบบเลือกอาจไม่ครอบคลุมทุกช่วงจึงต้องตรวจ timestamp สำคัญ
ข้อ 6
evaluation ควรแยกอะไร
- สีและขนาดไฟล์
- perception/extraction กับ reasoning
ดูคำตอบและคำอธิบาย
perception/extraction กับ reasoning การแยกชั้นทำให้แก้สาเหตุถูกและเห็นว่าหลักฐานถูกอ่านหรือไม่
บันทึกช่วยจำ
- บทเรียนไม่แทนคำแนะนำด้านกฎหมายหรือ PDPA
- ขอ consent และตรวจนโยบายก่อนบันทึกเสียงหรือวิดีโอ
สรุปบทเรียนนี้
- เก็บ provenance
- ตรวจ extraction
- ลดข้อมูลและส่งต่อเมื่อไม่แน่ใจ