เป็นจริง
Huawei เปิดเผยเทคโนโลยี "Context Memory Storage" สำหรับการประมวลผล AI inference ที่รองรับ KV cache ได้สูงถึง 64 เพตะไบต์ (PB) โดยมีเป้าหมายเพื่อขจัดปัญหาคอขวดด้านหน่วยความจำในคลัสเตอร์ซูเปอร์พอด (SuperPod) สำหรับโมเดลภาษาขนาดใหญ่
เทคโนโลยีดังกล่าวย้าย KV cache ซึ่งเป็นข้อมูลบริบทที่จำเป็นในการประมวลผล LLM ออกจากหน่วยความจำของ GPU ไปเก็บไว้ในระบบจัดเก็บข้อมูลเฉพาะทาง ความจุรวม 64PB ช่วยให้รองรับบริบทขนาดยาวและผู้ใช้จำนวนมากพร้อมกันได้ ลดภาระความจุหน่วยความจำฝั่ง GPU
แนวทางนี้มุ่งแก้ปัญหาคอขวดที่เกิดจากข้อจำกัดด้านหน่วยความจำเมื่อประมวลผล AI inference ในคลัสเตอร์ซูเปอร์พอดขนาดใหญ่ โดยการแยก KV cache ออกมาช่วยให้ GPU ใช้ทรัพยากรไปกับการคำนวณได้เต็มที่มากขึ้น อย่างไรก็ตามรายละเอียดด้านประสิทธิภาพจริงและแผนการวางจำหน่ายยังไม่ได้รับการยืนยันอย่างชัดเจน
ข้อมูลอ้างอิงจากเอกสารทางการของ Huawei ซึ่งทบทวนจากแหล่งข้อมูลหลักรวม 10 รายการ สรุปได้ว่าข้อเท็จจริงนี้ เป็นจริง