随着大语言模型(LLM)在企业端的规模化落地,持续攀升的Token调用费用正成为运营方的主要负担。针对“节省Token费用,提示词缓存与压缩是核心技术”这一说法,本报核查了12份一手资料,确认两种技术路线确为当前业界降本的关键手段,但其适用范围与提供主体存在差异,且与模型选择等官方降本方式并行共存。
提示词缓存(prompt caching)的思路,是将系统提示词等反复出现的固定前缀加以存储复用,使重复请求无需按全价重新计费,从而直接降低Token成本。提示词压缩(prompt compression)则从另一个方向入手:微软(Microsoft)开源的LLMLingua项目通过识别并删减提示词中的冗余表述来缩短输入长度,其项目示意图直观呈现了提示词中存在大量可压缩空间这一动机。

출처: 조사 출처
核查显示,缓存与压缩并非用户唯一的官方选择。更换或选用参数规模更小、单价更低的模型,同样是模型服务商提供的同等降本手段,与缓存、压缩技术并存于企业的成本控制工具箱中。这意味着“核心技术”的说法成立,但不等于“唯一技术”。
两者的主要差异在于生态成熟度。提示词缓存已普遍作为API的官方功能由主要模型服务商直接提供,使用门槛较低;而提示词压缩目前以开源项目为代表,提供主体较缓存明显受限,企业若采用往往需要自行集成与调优。
综合对12份一手资料的核查,“节省Token费用,提示词缓存与压缩是核心技术”这一说法基本属实。