ข้ามไปยังเนื้อหาบทเรียน
เมนู
เข้าสู่ระบบ — เร็ว ๆ นี้
สารบัญบทที่ 128/8

พื้นฐานการใช้ AIการเขียน Prompt

สรุป: Multimodal AI สำหรับงานจริง

ทบทวนภาพ OCR, PDF ตาราง, เสียง, วิดีโอ, provenance และ evaluation

เป้าหมาย: เลือกขั้นตอนตรวจตาม modality และผลกระทบ · ใช้เวลาประมาณ 14 นาที

ข้อ 1

โมเดลเห็นสื่อเหมือนคนทุกส่วนหรือไม่

  1. ใช่
  2. ไม่ใช่ resolution และ sampling ทำให้รายละเอียดหาย
ดูคำตอบและคำอธิบาย

ไม่ใช่ resolution และ sampling ทำให้รายละเอียดหาย ระบบอาจย่อภาพ เลือกเฟรม หรือแปลงเสียงก่อนประมวลผล

ข้อ 2

ตัวเลข OCR ควรทำอย่างไร

  1. เชื่อทันที
  2. เทียบตำแหน่งในภาพและตรวจยอด
ดูคำตอบและคำอธิบาย

เทียบตำแหน่งในภาพและตรวจยอด เลข จุดทศนิยม และตัวอักษรคล้ายกันเป็นจุดผิดพลาดที่มีผลสูง

ข้อ 3

ตาราง PDF ต้องเก็บอะไร

  1. ข้อความอย่างเดียว
  2. หัวคอลัมน์ หน่วย หน้า footnote และผลรวม
ดูคำตอบและคำอธิบาย

หัวคอลัมน์ หน่วย หน้า footnote และผลรวม layout และหมายเหตุเป็นส่วนหนึ่งของความหมายตาราง

ข้อ 4

transcript สำคัญควรมีอะไร

  1. สรุปอย่างเดียว
  2. ผู้พูด timestamp และช่วงไม่แน่ใจ
ดูคำตอบและคำอธิบาย

ผู้พูด timestamp และช่วงไม่แน่ใจ สิ่งเหล่านี้ช่วยกลับไปฟังและไม่เปลี่ยนผู้พูดหรือมติ

ข้อ 5

วิดีโอ sampling เสี่ยงอะไร

  1. ข้ามเหตุการณ์สั้น
  2. ทำให้ไฟล์เสียงดังขึ้น
ดูคำตอบและคำอธิบาย

ข้ามเหตุการณ์สั้น เฟรมที่ระบบเลือกอาจไม่ครอบคลุมทุกช่วงจึงต้องตรวจ timestamp สำคัญ

ข้อ 6

evaluation ควรแยกอะไร

  1. สีและขนาดไฟล์
  2. perception/extraction กับ reasoning
ดูคำตอบและคำอธิบาย

perception/extraction กับ reasoning การแยกชั้นทำให้แก้สาเหตุถูกและเห็นว่าหลักฐานถูกอ่านหรือไม่

บันทึกช่วยจำ
  • บทเรียนไม่แทนคำแนะนำด้านกฎหมายหรือ PDPA
  • ขอ consent และตรวจนโยบายก่อนบันทึกเสียงหรือวิดีโอ

สรุปบทเรียนนี้

  • เก็บ provenance
  • ตรวจ extraction
  • ลดข้อมูลและส่งต่อเมื่อไม่แน่ใจ