광고
광고

SKIDIA's PaperBoy

ZH WIRE · 2026-09-21 17:52

Token降本有术:提示词缓存与压缩成大模型成本控制核心技术

基本属实

Token降本有术:提示词缓存与压缩成大模型成本控制核心技术
Image source: 조사 출처

随着大语言模型(LLM)在企业端的规模化落地,持续攀升的Token调用费用正成为运营方的主要负担。针对“节省Token费用,提示词缓存与压缩是核心技术”这一说法,本报核查了12份一手资料,确认两种技术路线确为当前业界降本的关键手段,但其适用范围与提供主体存在差异,且与模型选择等官方降本方式并行共存。

원문 주장 (KR)
토큰 비용 절감...프롬프트 캐싱·압축이 핵심 기술

缓存复用固定内容,压缩削减冗余输入

提示词缓存(prompt caching)的思路,是将系统提示词等反复出现的固定前缀加以存储复用,使重复请求无需按全价重新计费,从而直接降低Token成本。提示词压缩(prompt compression)则从另一个方向入手:微软(Microsoft)开源的LLMLingua项目通过识别并删减提示词中的冗余表述来缩短输入长度,其项目示意图直观呈现了提示词中存在大量可压缩空间这一动机。

官方降本手段不止一条路

核查显示,缓存与压缩并非用户唯一的官方选择。更换或选用参数规模更小、单价更低的模型,同样是模型服务商提供的同等降本手段,与缓存、压缩技术并存于企业的成本控制工具箱中。这意味着“核心技术”的说法成立,但不等于“唯一技术”。

压缩的服务提供主体相对有限

两者的主要差异在于生态成熟度。提示词缓存已普遍作为API的官方功能由主要模型服务商直接提供,使用门槛较低;而提示词压缩目前以开源项目为代表,提供主体较缓存明显受限,企业若采用往往需要自行集成与调优。

综合对12份一手资料的核查,“节省Token费用,提示词缓存与压缩是核心技术”这一说法基本属实。

Sources — primary documents (12)
  1. https://platform.claude.com/docs/en/build-with-claude/prompt-caching
  2. https://developers.openai.com/api/docs/guides/prompt-caching
  3. https://ai.google.dev/gemini-api/docs/caching
  4. https://docs.aws.amazon.com/wellarchitected/latest/generative-ai-lens/gencost03-bp03.html
  5. https://arxiv.org/abs/2601.06007
  6. https://arxiv.org/abs/2310.05736
  7. https://aclanthology.org/2023.emnlp-main.825/
  8. https://github.com/microsoft/LLMLingua
  9. https://docs.aws.amazon.com/wellarchitected/latest/generative-ai-lens/gencost03-bp01.html
  10. https://developers.openai.com/api/docs/guides/cost-optimization
  11. https://developers.openai.com/api/docs/guides/batch
  12. https://www.thelec.kr/news/articleView.html?idxno=62542

KR: /news/20260921-8935df · 판정: 대체로 사실 · 제보