สร้าง Evaluation Set ก่อนปรับ Prompt หรือโมเดล
เก็บกรณีตัวแทนและกรณีเสี่ยง กำหนด expected behavior และใช้ code, model และ human grader ตามสิ่งที่วัด
เป้าหมาย: สร้าง evaluation ที่ตรวจ regression และเชื่อมคะแนนกับการยอมรับของธุรกิจ · ใช้เวลาประมาณ 18 นาที
ผลลัพธ์ที่ต้องสร้าง
ทำให้การตัดสินใจตรวจสอบได้ด้วยหลักฐาน เจ้าของ และเกณฑ์ที่กำหนดก่อนเห็นผล
Sample cases
สุ่มตามปริมาณ ภาษา ช่องทาง และเพิ่ม edge/adversarial cases
Expected behavior
ระบุสิ่งต้องมี ห้ามมี การส่งต่อ และคำตอบที่ยอมรับได้หลายแบบ
Choose grader
ใช้ code ตรวจ schema/ตัวเลข model grader ตรวจ rubric และ human grader ตรวจบริบท
Track versions
บันทึก dataset, prompt, model, score, failures และเหตุผลเปลี่ยน
ตัวอย่างการตัดสินใจ
LINE OA
50 FAQ, 20 complaint, 10 refund, 10 unclear, 10 privacy attacks
ชุดสะท้อนทั้งปริมาณและความเสี่ยง
SOP answer
code ตรวจ citation, model ตรวจความเกี่ยวข้อง, HR ตรวจการตีความ
grader แต่ละแบบมีหน้าที่ต่างกัน
สัญญาณว่าโครงการกำลังหลงทาง
ใช้เคสที่ทีมแต่งง่ายทั้งหมด
คะแนนสูงเกินโลกจริง
สุ่ม production-like และเก็บ failures
ให้ model grader ตัดสินทุกเรื่อง
อคติหรือผิดพร้อมระบบที่ประเมิน
calibrate กับ human samples
เปลี่ยนชุดทุกครั้ง
เทียบ regression ไม่ได้
freeze core set และเพิ่ม challenge set
สร้าง evaluation 40 เคส
ระบบจะร่างคำตอบร้านอาหารจาก FAQ และต้องไม่เดาข้อมูลแพ้อาหาร
ออกแบบสัดส่วนและ rubric
ดูคำตอบตัวอย่าง
20 ข้อมูลทั่วไป 8 ราคา/เวลา 5 complaint 4 allergy 3 malicious/privacy; code ตรวจ schema และคำต้องห้าม; reviewer ตรวจ correctness/tone; allergy ต้องส่งต่อ 100%; บันทึก baseline และตั้ง hard gate ก่อน pilot
- ตัวแทนงานจริง
- มี edge cases
- expected behavior
- หลาย grader
- hard gate
บันทึกช่วยจำ
- ข้อมูลประเมินต้องปกปิดและมีสิทธิ์ใช้งาน
- ไม่ฝึกหรือปรับ prompt โดยดูเฉลยของ test set จนเกิดการโกงคะแนน
สรุปบทเรียนนี้
- eval set มาก่อน optimization
- grader ต้องเหมาะกับสิ่งที่วัด
- ติดตาม regression และ hard gate