ReAct: คิด เลือกการกระทำ และสังเกตผล
เข้าใจวงจร Reason–Act–Observe โดยไม่เปิดเผยหรือพึ่งพาข้อความคิดภายในของโมเดล
เป้าหมาย: ออกแบบ ReAct loop จากสถานะที่ตรวจได้ การเรียก Tool และ observation · ใช้เวลาประมาณ 10 นาที
ReAct ที่ตรวจได้
ใช้สถานะและเหตุผลการกระทำ ไม่ต้องบันทึกความคิดภายในยาว ๆ
เลือกขั้นถัดไป
ระบุเป้าหมายย่อยและเหตุผลสั้นจากสถานะ
Act
เรียก Tool เดียวหรือชุดที่อนุญาต
Observe
อ่านผลสำเร็จ ไม่พบ ขัดแย้ง หรือ error
หยุดหรือทำต่อ
เทียบกับเกณฑ์สำเร็จ งบรอบ และความเสี่ยง
ติดตามคำสั่งซื้อ
รอบ 1
ต้องรู้ orderId จึงค้นสถานะ
หากไม่มี ให้ถามข้อมูลที่จำเป็นโดยไม่ขอเกิน
รอบ 2
lookupOrder คืน shipped พร้อม tracking
Agent มีหลักฐานเพียงพอสำหรับร่าง
รอบ 3
draftReply แล้วหยุดรออนุมัติ
ไม่วนค้นซ้ำหรือส่งจริงเอง
แก้ Agent ที่วนซ้ำ
Tool ค้นสต็อกคืน not_found แต่ Agent เรียกซ้ำด้วยค่าเดิม 8 ครั้ง
เพิ่ม observation และเงื่อนไขหยุด
ดูคำตอบตัวอย่าง
เมื่อ not_found ด้วย SKU เดิมให้หยุดเรียกซ้ำ บันทึก attempts=1 ขอให้คนตรวจ SKU หรือส่งต่อคลัง กำหนด Tool เดิมกับ input เดิมไม่เกิน 1 ครั้งและรอบรวมไม่เกิน 4
- จำ input และผล
- ไม่ทำซ้ำแบบเดิม
- มีงบรอบ
- มีทางส่งต่อ
หยุดเมื่อไร
Agent ควรทำอะไรเมื่อ Tool คืน permission_denied
- ก. ลองเปลี่ยนคำเรียกจนผ่าน
- ข. หยุด บันทึกข้อผิดพลาด และส่งต่อผู้มีสิทธิ์
ดูคำตอบและคำอธิบาย
ข. หยุด บันทึกข้อผิดพลาด และส่งต่อผู้มีสิทธิ์ Agent ไม่ควรพยายามหลีกเลี่ยงขอบเขตสิทธิ์
บันทึกช่วยจำ
- ไม่ต้องขอให้โมเดลเปิดเผย chain-of-thought
- เก็บ action, observation และเหตุผลสั้นที่ตรวจได้
สรุปบทเรียนนี้
- ReAct ใช้ผลจริงปรับขั้นถัดไป
- หลีกเลี่ยงการเรียกซ้ำแบบเดิม
- ทุกวงจรมีเกณฑ์สำเร็จ งบรอบ และทางส่งต่อ