สรุป: Prompt Injection และ Layered Defense
ทบทวน attack, untrusted data, RAG, permission, validation และ red team
เป้าหมาย: ตรวจ threat model และ defense evidence ก่อนให้ AI ใช้ tool · ใช้เวลาประมาณ 15 นาที
ข้อ 1
Prompt อย่างเดียวเป็น security boundary หรือไม่
- เป็น
- ไม่เป็น
ดูคำตอบและคำอธิบาย
ไม่เป็น เป้าหมายไม่ใช่ให้โมเดลไม่เคยถูกหลอก แต่ทำให้การหลอกสร้างผลกระทบไม่ได้หรือจำกัดและกู้คืนได้
ข้อ 2
indirect injection ซ่อนที่ไหนได้
- เว็บ PDF อีเมล RAG
- เฉพาะช่อง Prompt
ดูคำตอบและคำอธิบาย
เว็บ PDF อีเมล RAG เป้าหมายไม่ใช่ให้โมเดลไม่เคยถูกหลอก แต่ทำให้การหลอกสร้างผลกระทบไม่ได้หรือจำกัดและกู้คืนได้
ข้อ 3
ใครควร authorize tool action
- trusted policy code
- ข้อความโมเดลเอง
ดูคำตอบและคำอธิบาย
trusted policy code เป้าหมายไม่ใช่ให้โมเดลไม่เคยถูกหลอก แต่ทำให้การหลอกสร้างผลกระทบไม่ได้หรือจำกัดและกู้คืนได้
ข้อ 4
RAG document ควรมีสิทธิ์เปิด tool ใหม่หรือไม่
- ควร
- ไม่ควร
ดูคำตอบและคำอธิบาย
ไม่ควร เป้าหมายไม่ใช่ให้โมเดลไม่เคยถูกหลอก แต่ทำให้การหลอกสร้างผลกระทบไม่ได้หรือจำกัดและกู้คืนได้
ข้อ 5
ผลกระทบสูงควรมีอะไร
- preview/approval/rollback
- auto execute
ดูคำตอบและคำอธิบาย
preview/approval/rollback เป้าหมายไม่ใช่ให้โมเดลไม่เคยถูกหลอก แต่ทำให้การหลอกสร้างผลกระทบไม่ได้หรือจำกัดและกู้คืนได้
ข้อ 6
red team ต้องวัดอะไร
- ข้อความปฏิเสธอย่างเดียว
- prevention/detection/side effect/recovery
ดูคำตอบและคำอธิบาย
prevention/detection/side effect/recovery เป้าหมายไม่ใช่ให้โมเดลไม่เคยถูกหลอก แต่ทำให้การหลอกสร้างผลกระทบไม่ได้หรือจำกัดและกู้คืนได้
บันทึกช่วยจำ
- ทบทวน threat model เมื่อเพิ่ม data source หรือ tool
- incident ต้องมี owner, containment, evidence และ retest
สรุปบทเรียนนี้
- untrusted by default
- least privilege
- authorize and recover