Token และ Vocabulary: ทำไมภาษาไทยใช้พื้นที่ไม่เท่ากัน
เข้าใจ Token และ Vocabulary: ทำไมภาษาไทยใช้พื้นที่ไม่เท่ากัน เพื่อทดสอบและเลือกใช้โมเดลในงานไทย
เป้าหมาย: อธิบายกลไก สังเกตผล และออกแบบการทดลองที่ไม่สรุปเกินหลักฐาน · ใช้เวลาประมาณ 16 นาที
กลไก → ผลที่สังเกต → การทดลอง → ขอบเขต
เข้าใจหลักการเท่าที่ใช้วินิจฉัยงานจริง
กลไก
โมเดลแบ่งข้อความเป็น token ตาม vocabulary ของ tokenizer ไม่ตรงคำหรืออักษรเสมอ ภาษาไทย ตัวเลข และ code อาจใช้จำนวน token ต่างกัน จึงกระทบราคาและ context
ผลที่สังเกต
บันทึก input, model, setting, context, output และเวลา ไม่สรุปจาก demo เดียว
การทดลอง
เปลี่ยนทีละตัวแปรและใช้ชุดโจทย์เดิมเปรียบเทียบ
ขอบเขต
ให้คนตรวจข้อเท็จจริง ตัวเลข สิทธิ์ข้อมูล และผลกระทบสำคัญ
คำศัพท์ที่ใช้ตัดสินใจ
token
อธิบาย token ด้วยตัวอย่างภาษาไทยหนึ่งกรณี แล้วบอกสิ่งที่แนวคิดนี้ไม่รับประกัน
คำศัพท์มีประโยชน์เมื่อเชื่อมกับพฤติกรรมที่ทดสอบได้
vocabulary
อธิบาย vocabulary ด้วยตัวอย่างภาษาไทยหนึ่งกรณี แล้วบอกสิ่งที่แนวคิดนี้ไม่รับประกัน
คำศัพท์มีประโยชน์เมื่อเชื่อมกับพฤติกรรมที่ทดสอบได้
tokenizer
อธิบาย tokenizer ด้วยตัวอย่างภาษาไทยหนึ่งกรณี แล้วบอกสิ่งที่แนวคิดนี้ไม่รับประกัน
คำศัพท์มีประโยชน์เมื่อเชื่อมกับพฤติกรรมที่ทดสอบได้
ภาษาไทย
อธิบาย ภาษาไทย ด้วยตัวอย่างภาษาไทยหนึ่งกรณี แล้วบอกสิ่งที่แนวคิดนี้ไม่รับประกัน
คำศัพท์มีประโยชน์เมื่อเชื่อมกับพฤติกรรมที่ทดสอบได้
ข้อสรุปที่กลไกนี้ไม่รองรับ
โมเดลตอบคล่องจึงต้องรู้จริง
ความน่าจะเป็นของข้อความไม่ใช่หลักฐาน
ตรวจแหล่งข้อมูลและเจ้าของข้อมูล
เปลี่ยนหลาย setting พร้อมกัน
ไม่รู้สาเหตุของผลต่าง
ทำ controlled comparison
ใช้ค่าตั้งเดียวกับทุกงาน
ต้นทุน ความแปรผัน และความเสี่ยงไม่เหมาะ
กำหนดตาม use case และ eval
ทดลองกับงานภาษาไทย
ทีมคอลเซ็นเตอร์ประเมินต้นทุนจากจำนวนคำไทยแล้วคลาดเคลื่อน
ตั้งสมมติฐาน สร้าง test cases เปลี่ยนตัวแปรเดียว บันทึกผล และกำหนด human review
ดูคำตอบตัวอย่าง
สมมติฐานอิงจาก โมเดลแบ่งข้อความเป็น token ตาม vocabulary ของ tokenizer ไม่ตรงคำหรืออักษรเสมอ ภาษาไทย ตัวเลข และ code อาจใช้จำนวน token ต่างกัน จึงกระทบราคาและ context ใช้ข้อมูลจำลองภาษาไทยอย่างน้อยห้ากรณี ล็อก model และ Prompt เปลี่ยนเฉพาะตัวแปรที่ศึกษา วัดความถูกต้อง ความสม่ำเสมอ token/เวลา/ต้นทุน และบันทึกกรณีผิด ก่อนกำหนดว่าผลใดต้อง human review
- สมมติฐาน
- test set ภาษาไทย
- ตัวแปรเดียว
- บันทึก setting
- failure cases
- human review
บันทึกช่วยจำ
- พฤติกรรมต่างกันตามโมเดล รุ่น ผู้ให้บริการ และการตั้งค่า
- ตรวจเอกสารของผู้ให้บริการและทดสอบด้วยข้อมูลที่อนุญาต
สรุปบทเรียนนี้
- กลไกอธิบายแนวโน้ม ไม่รับประกันคำตอบ
- เปลี่ยนทีละตัวแปร
- วัดกับงานภาษาไทยจริง