บทที่ 12 จาก 32
Multimodal AI สำหรับงานจริง
เรียนตามลำดับทั้ง 8 บท หรือเลือกหัวข้อที่ตรงกับงานของคุณ แล้วใช้แบบทดสอบประจำบทเพื่อตรวจจุดที่ควรทบทวน
8 บทเรียนในบทนี้
- 1เข้าใจ Multimodal AI และสิ่งที่โมเดลไม่ได้เห็น
แยกการรับภาพ เสียง และเอกสารจากการตีความ พร้อมข้อจำกัดด้าน resolution, sampling และ context
15 นาที - 2อ่านภาพและเอกสารสแกนด้วย AI อย่างตรวจสอบได้
ตรวจความคม การหมุน ภาษา layout และ OCR ก่อนให้โมเดลสรุป
15 นาที - 3ดึงตารางจาก PDF โดยไม่ทำแถวและหน่วยหาย
แยก text PDF จาก scanned PDF รักษาหัวตาราง merged cells หน่วย footnote และหลายหน้า
15 นาที - 4ถอดเสียงภาษาไทยพร้อมผู้พูดและช่วงไม่แน่ใจ
เตรียม consent, audio quality, diarization, timestamps และ glossary ก่อนสรุป
15 นาที - 5วิเคราะห์วิดีโอโดยรู้ว่าเฟรมใดอาจถูกข้าม
แบ่ง scene เก็บ timestamps transcript และ keyframes โดยไม่อ้างเหตุการณ์ที่ไม่อยู่ใน sample
15 นาที - 6รวมข้อความ ภาพ และข้อมูลโดยไม่ปนแหล่ง
ใช้ evidence table ผูก claim กับ modality, source, location, confidence และ conflict
15 นาที - 7ประเมิน Multimodal AI แยกการมองเห็นจากการให้เหตุผล
วัด OCR, extraction, localization, transcription และ reasoning แยกกัน พร้อมชุดเคสคุณภาพต่ำ
15 นาที - 8สรุป: Multimodal AI สำหรับงานจริง
ทบทวนภาพ OCR, PDF ตาราง, เสียง, วิดีโอ, provenance และ evaluation
14 นาที