Đúng
Huawei công bố kiến trúc "context memory storage" phục vụ suy luận AI, cho phép quản lý KV cache với dung lượng tới 64 petabyte nhằm vượt qua nút thắt hiệu năng của các cụm máy siêu lớn (supper pod) khi chạy các mô hình ngôn ngữ lớn (LLM).
Theo tài liệu do Huawei công bố, hệ thống được thiết kế để tách khỏi luồng tính toán truyền thống nơi KV cache — dữ liệu trung gian của quá trình suy luận LLM — bị giới hạn bởi bộ nhớ của từng node. Bằng cách cấp phát KV cache trên quy mô 64PB trong một lớp lưu trữ "bộ nhớ ngữ cảnh" dùng chung, hệ thống cho phép các node tính toán truy xuất ngữ cảnh tốc độ cao, giảm nút thắt khi mở rộng quy mô cụm.
Cách tiếp cận nhắm trực tiếp vào vấn đề nút thắt của các cụm "supper pod" dùng cho suy luận AI: khi số node tăng, việc tái sử dụng và chia sẻ KV cache giữa các node trở thành điểm nghẽn về băng thông và dung lượng. Lớp bộ nhớ ngữ cảnh 64PB được giới thiệu như giải pháp để overcome giới hạn này, cho phép phục vụ nhiều phiên suy luận đồng thời với ngữ cảnh dài hơn.
Chi tiết về hiệu năng thực tế và lộ trình thương mại hóa của hệ thống chưa được làm rõ trong tài liệu công bố. Thông tin trên dựa trên nguồn chính thức từ Huawei; nhận định tổng thể về tuyên bố này là: Đúng