属实
华为公布了一种面向AI推理的“上下文记忆存储”(Context Memory Storage)技术方案,通过64PB规模的KV缓存(KV Cache),试图突破超节点(Supernode)架构下的推理瓶颈。该方案已在华为官方资料中公开。
根据华为公开的资料,该技术将大语言模型(LLM)推理过程中产生的KV缓存(KV Cache)从计算节点中剥离,交由专门设计的上下文记忆存储层承载,总量可达64PB级别。这一思路旨在缓解超节点架构中,计算资源与显存资源之间日益突出的瓶颈问题。
在大语言模型推理中,KV缓存用于保存已处理文本的中间状态,随着上下文长度和并发请求数增长,其容量需求迅速膨胀,往往成为限制推理吞吐的关键因素。华为方案的核心是通过将KV缓存集中化、池化,使计算节点能够更灵活地调用共享的上下文记忆资源,从而提升整体推理效率。
官方资料显示,该方案以独立存储设备的形式呈现,定位为AI推理基础设施的组成部分。目前华为尚未在公开资料中披露具体的性能指标和商用时间表,落地效果仍待观察。
结语:综合华为官方公开资料,该“上下文记忆存储”方案及64PB KV缓存指标确有出处,属实。