ข้ามไปยังเนื้อหาบทเรียน
เมนู
เข้าสู่ระบบ — เร็ว ๆ นี้
สารบัญบทที่ 94/8

พื้นฐานการใช้ AIการเขียน Prompt

สร้าง Evaluation Set ก่อนปรับ Prompt หรือโมเดล

เก็บกรณีตัวแทนและกรณีเสี่ยง กำหนด expected behavior และใช้ code, model และ human grader ตามสิ่งที่วัด

เป้าหมาย: สร้าง evaluation ที่ตรวจ regression และเชื่อมคะแนนกับการยอมรับของธุรกิจ · ใช้เวลาประมาณ 18 นาที

ผลลัพธ์ที่ต้องสร้าง

ทำให้การตัดสินใจตรวจสอบได้ด้วยหลักฐาน เจ้าของ และเกณฑ์ที่กำหนดก่อนเห็นผล

Sample cases

สุ่มตามปริมาณ ภาษา ช่องทาง และเพิ่ม edge/adversarial cases

Expected behavior

ระบุสิ่งต้องมี ห้ามมี การส่งต่อ และคำตอบที่ยอมรับได้หลายแบบ

Choose grader

ใช้ code ตรวจ schema/ตัวเลข model grader ตรวจ rubric และ human grader ตรวจบริบท

Track versions

บันทึก dataset, prompt, model, score, failures และเหตุผลเปลี่ยน

ตัวอย่างการตัดสินใจ

LINE OA

50 FAQ, 20 complaint, 10 refund, 10 unclear, 10 privacy attacks

ชุดสะท้อนทั้งปริมาณและความเสี่ยง

SOP answer

code ตรวจ citation, model ตรวจความเกี่ยวข้อง, HR ตรวจการตีความ

grader แต่ละแบบมีหน้าที่ต่างกัน

สัญญาณว่าโครงการกำลังหลงทาง

ใช้เคสที่ทีมแต่งง่ายทั้งหมด

คะแนนสูงเกินโลกจริง

สุ่ม production-like และเก็บ failures

ให้ model grader ตัดสินทุกเรื่อง

อคติหรือผิดพร้อมระบบที่ประเมิน

calibrate กับ human samples

เปลี่ยนชุดทุกครั้ง

เทียบ regression ไม่ได้

freeze core set และเพิ่ม challenge set

สร้าง evaluation 40 เคส

ระบบจะร่างคำตอบร้านอาหารจาก FAQ และต้องไม่เดาข้อมูลแพ้อาหาร

ออกแบบสัดส่วนและ rubric

ดูคำตอบตัวอย่าง

20 ข้อมูลทั่วไป 8 ราคา/เวลา 5 complaint 4 allergy 3 malicious/privacy; code ตรวจ schema และคำต้องห้าม; reviewer ตรวจ correctness/tone; allergy ต้องส่งต่อ 100%; บันทึก baseline และตั้ง hard gate ก่อน pilot

  • ตัวแทนงานจริง
  • มี edge cases
  • expected behavior
  • หลาย grader
  • hard gate
บันทึกช่วยจำ
  • ข้อมูลประเมินต้องปกปิดและมีสิทธิ์ใช้งาน
  • ไม่ฝึกหรือปรับ prompt โดยดูเฉลยของ test set จนเกิดการโกงคะแนน

สรุปบทเรียนนี้

  • eval set มาก่อน optimization
  • grader ต้องเหมาะกับสิ่งที่วัด
  • ติดตาม regression และ hard gate