ข้ามไปยังเนื้อหาบท
เมนู
เข้าสู่ระบบ — เร็ว ๆ นี้

บทที่ 12 จาก 32

Multimodal AI สำหรับงานจริง

เรียนตามลำดับทั้ง 8 บท หรือเลือกหัวข้อที่ตรงกับงานของคุณ แล้วใช้แบบทดสอบประจำบทเพื่อตรวจจุดที่ควรทบทวน

8 บทเรียนในบทนี้

  1. 1
    เข้าใจ Multimodal AI และสิ่งที่โมเดลไม่ได้เห็น

    แยกการรับภาพ เสียง และเอกสารจากการตีความ พร้อมข้อจำกัดด้าน resolution, sampling และ context

    15 นาที
  2. 2
    อ่านภาพและเอกสารสแกนด้วย AI อย่างตรวจสอบได้

    ตรวจความคม การหมุน ภาษา layout และ OCR ก่อนให้โมเดลสรุป

    15 นาที
  3. 3
    ดึงตารางจาก PDF โดยไม่ทำแถวและหน่วยหาย

    แยก text PDF จาก scanned PDF รักษาหัวตาราง merged cells หน่วย footnote และหลายหน้า

    15 นาที
  4. 4
    ถอดเสียงภาษาไทยพร้อมผู้พูดและช่วงไม่แน่ใจ

    เตรียม consent, audio quality, diarization, timestamps และ glossary ก่อนสรุป

    15 นาที
  5. 5
    วิเคราะห์วิดีโอโดยรู้ว่าเฟรมใดอาจถูกข้าม

    แบ่ง scene เก็บ timestamps transcript และ keyframes โดยไม่อ้างเหตุการณ์ที่ไม่อยู่ใน sample

    15 นาที
  6. 6
    รวมข้อความ ภาพ และข้อมูลโดยไม่ปนแหล่ง

    ใช้ evidence table ผูก claim กับ modality, source, location, confidence และ conflict

    15 นาที
  7. 7
    ประเมิน Multimodal AI แยกการมองเห็นจากการให้เหตุผล

    วัด OCR, extraction, localization, transcription และ reasoning แยกกัน พร้อมชุดเคสคุณภาพต่ำ

    15 นาที
  8. 8
    สรุป: Multimodal AI สำหรับงานจริง

    ทบทวนภาพ OCR, PDF ตาราง, เสียง, วิดีโอ, provenance และ evaluation

    14 นาที