เป็นจริงส่วนใหญ่
เทคนิคหลักในการลดค่าใช้จ่ายโทเคนสำหรับบริการ AI คือการทำ Prompt Caching และการบีบอัดพรอมต์ (Prompt Compression) โดยมีเครื่องมืออย่าง LLMLingua ของ Microsoft และวิธีการทางการอย่างการเลือกโมเดล ที่ช่วยลดต้นทุนได้ควบคู่กัน
การใช้งาน LLM ในระดับใหญ่มีต้นทุนโทเคนเป็นองค์ประกอบสำคัญ โดยเทคนิค Prompt Caching ช่วยให้ผู้ให้บริการโมเดลนำส่วนของพรอมต์ที่ซ้ำกันกลับมาใช้ใหม่ได้ ส่วนการบีบอัดพรอมต์ เช่น LLMLingua ซึ่งพัฒนาโดย Microsoft Research ช่วยลดจำนวนโทเคนในพรอมต์ก่อนส่งเข้าโมเดล
ทั้งนี้ การบีบอัดพรอมต์มีข้อจำกัดตรงที่ผู้ให้บริการที่รองรับมีจำกัด ต่างจาก Prompt Caching ที่หลายผู้ให้บริการเสนอเป็นฟีเจอร์มาตรฐาน
นอกจากเทคนิคเหล่านี้ ยังมีวิธีการทางการอย่างการเลือกโมเดล (Model Selection) ที่ให้ผู้ใช้เลือกโมเดลที่มีต้นทุนต่ำกว่าสำหรับงานที่เหมาะสม ซึ่งดำรงอยู่ควบคู่กับเทคนิค Caching และ Compression อย่างเท่าเทียม
ข้อสรุปจากการทบทวนแหล่งข้อมูลหลักจำนวน 12 รายการพบว่าข้อกล่าวอ้างเรื่องการลดต้นทุนโทเคนด้วย Prompt Caching และการบีบอัดพรอมต์เป็นจริงส่วนใหญ่