โมเดลภาษาสร้างคำตอบอย่างไร
เข้าใจการทำนาย Token ถัดไปและความต่างระหว่างภาษาที่น่าเชื่อกับข้อเท็จจริง
เป้าหมาย: อธิบายการทำนาย Token ต่อเนื่อง และไม่ใช้ความลื่นไหลเป็นหลักฐานว่าคำตอบถูก · ใช้เวลาประมาณ 11 นาที
จากข้อความสู่คำตอบ
ภาพง่าย ๆ ของโมเดลภาษา
อ่านข้อความก่อนหน้า
Context ชี้ว่าคำหรือชิ้นคำแบบใดน่าจะตามมา
คำนวณความเป็นไปได้
โมเดลให้โอกาสกับ Token หลายตัวแล้วเลือกต่อทีละส่วน
ทำซ้ำจนเป็นคำตอบ
ความคล่องเกิดจากการทำนายต่อเนื่อง ไม่ใช่หลักฐานว่าทุกข้อเท็จจริงถูกตรวจแล้ว
กับดักของคำตอบที่ดูน่าเชื่อ
มีชื่อร้าน ราคา และเวลาเปิดปิดครบ
รายละเอียดมากทำให้เรารู้สึกว่าคำตอบผ่านการค้นหาแล้ว
ถามหาแหล่งข้อมูลและตรวจหน้าอย่างเป็นทางการพร้อมวันที่
ภาษาไทยสุภาพและมั่นใจ
น้ำเสียงกลบความไม่แน่นอน
แยกการตรวจภาษาออกจากการตรวจข้อเท็จจริง
การทำนายต่อเนื่องสร้างทั้งประโยชน์และความเสี่ยง
รูปแบบที่โมเดลเรียนรู้ได้ดี
เขียนอีเมลติดตามงานที่สุภาพ มีหัวข้อ สรุปสิ่งที่รอ และกำหนดส่ง
รูปแบบอีเมลและภาษาสุภาพมีตัวอย่างจำนวนมาก โมเดลจึงช่วยร่างโครงสร้างได้ดี
ข้อเท็จจริงที่ไม่ได้อยู่ในบริบท
ร้านคู่แข่งแถวสุขุมวิทขายกาแฟเฉลี่ยวันละกี่แก้ว
โมเดลอาจสร้างตัวเลขที่ฟังสมเหตุผล แต่คำถามต้องใช้ข้อมูลธุรกิจจริงที่ไม่ได้ให้มา
แยกรูปแบบภาษาออกจากความรู้จริง
AI เขียนข้อเสนอว่าแคมเปญสงกรานต์จะเพิ่มยอดขาย 32% เพราะลูกค้ากรุงเทพฯ ชอบโปรโมชันแบบซื้อหนึ่งแถมหนึ่ง
วงส่วนที่เป็นการร่างภาษา ส่วนที่เป็นสมมติฐาน และส่วนที่ต้องมีหลักฐาน
ดูคำตอบตัวอย่าง
โครงสร้างข้อเสนอและถ้อยคำเป็นงานร่างภาษา ตัวเลขเพิ่มยอดขาย 32% และข้ออ้างเกี่ยวกับความชอบของลูกค้าเป็นข้อเท็จจริงที่ต้องมีข้อมูล ส่วนแนวคิดซื้อหนึ่งแถมหนึ่งเป็นสมมติฐานที่ควรทดลอง ไม่ใช่ข้อสรุป
- แยกตัวเลขออกมาตรวจ
- ระบุสมมติฐาน
- ไม่ใช้ความมั่นใจของภาษาแทนหลักฐาน
ทำนายก่อนตอบ
AI บอกว่าร้านในเชียงใหม่เปิดถึง 22:00 น. สิ่งแรกที่ควรทำคืออะไร
- ก. เชื่อเพราะคำตอบระบุเวลาชัด
- ข. ตรวจช่องทางทางการและวันที่ล่าสุด
ดูคำตอบและคำอธิบาย
ข. ตรวจช่องทางทางการและวันที่ล่าสุด ความเฉพาะเจาะจงไม่ใช่หลักฐาน ต้องตรวจข้อมูลที่เปลี่ยนแปลงได้
บันทึกช่วยจำ
- Token อาจเป็นคำ ส่วนของคำ หรือเครื่องหมาย
- โมเดลที่เชื่อมการค้นหาก็ยังต้องตรวจคุณภาพของแหล่งข้อมูล
- บทถัดไปจะอธิบายว่า Context Window จำกัดสิ่งที่โมเดลมองเห็นในครั้งหนึ่งอย่างไร
สรุปบทเรียนนี้
- คำตอบเกิดจากการทำนาย Token ต่อเนื่อง
- รูปแบบภาษาที่ดีไม่รับรองข้อเท็จจริง
- ข้อมูลที่ไม่มีในบริบทต้องค้นหา ตรวจ หรือยอมรับว่าไม่รู้