Verdadero
Huawei ha revelado una tecnología de almacenamiento denominada "memoria de contexto" (context memory storage) orientada a la inferencia de IA, que alcanza los 64 PB de caché KV. Según la información publicada por la propia compañía, la propuesta busca superar el cuello de botella que limita el rendimiento de los sistemas tipo "súper clúster" (superpod) en el procesamiento de modelos de gran escala.
La arquitectura presentada por Huawei se centra en el uso de la caché KV (KV cache), el mecanismo que almacena los resultados intermedios de atención de los grandes modelos de lenguaje (LLM) durante la inferencia. Al ampliar esta capacidad hasta 64 PB mediante almacenamiento dedicado, Huawei apunta a que los sistemas de inferencia no queden limitados por la memoria disponible en cada nodo.
El concepto de "almacenamiento de memoria de contexto" propone gestionar la caché KV como una capa de almacenamiento compartida a escala de clúster, de modo que los datos de contexto puedan reutilizarse entre nodos. Según el material difundido por la empresa, esta organización permitiría sortear el cuello de botella que afecta a los "súper clústeres" al escalar la inferencia de IA.
Huawei no ha detallado en este material fechas de disponibilidad comercial ni los modelos de hardware concretos que integrarán esta arquitectura.
De acuerdo con la información disponible, la afirmación central —un sistema de memoria de contexto para inferencia de IA con 64 PB de caché KV destinado a superar el cuello de botella del súper clúster— resulta Verdadero.