智能体上下文压缩
5 节点1 篇8 来源
智能体上下文压缩,指在 Agent 工作负载中把已检索、已生成的中间信息压缩后再使用或存储的一类技术。它正同时被当作省钱手段和风险来源:Databricks 的 KARL 智能体靠"检索停止+上下文压缩"宣称以低 33% 的成本达到 Claude Opus 4.6 的准确率;英特尔、百度则在推理基础设施层面用 KV Cache 压缩缓解显存压力。但斯坦福与 SambaNova 的 ACE 研究警告"上下文坍缩"——反复重写压缩会抹掉关键细节;另一项研究显示,压缩财报文本可翻转四分之一到三分之一的买卖建议。压缩到什么程度安全,尚无定论。
【背景】Agent 时代的上下文长度在快速膨胀:百度内部智能体平均上下文已达约 60k token,英特尔引述某 235B 模型在 100 万 token 窗口下 KV Cache 约 300GB,超过多数 GPU 显存容量。
事情怎么走到这一步
Databricks 发布检索增强智能体 KARL:用强化学习判断何时停止检索,并对已检索信息做上下文压缩,宣称准确率对标 Claude Opus 4.6、成本降 33%、时延降 47%。其承载平台 Agent Bricks 自发布以来已构建超 10 万个智能体。
en.cryptonomist.ch ↗百度智能云披露内部智能体平均上下文约 60k token 且持续增长;百度百舸通过 MoE 专家压缩等手段优化推理基础设施,测试中专家压缩 50% 后高并发场景输出吞吐峰值达原来的 2.23 倍。
finance.sina.com.cn ↗Cloudflare 结束 Agents Week,发布 25+ 项智能体基础设施,其中包括推理时无损压缩技术 Unweight(宣称模型体积最多缩减 22%)与托管 Agent Memory 服务。
forkast.news ↗英特尔在 Connection 2026 推出 KV Cache 智能加速套件 KV Shrink:QAT 引擎压缩率超 50%,客户验证数据显示传输速率最高提升 9.66 倍、首字时延最高提升 15 倍。
news.qq.com ↗一项研究显示,对财报文本做摘要压缩可翻转四分之一到三分之一的买卖建议——投研智能体的摘要环节成为可度量的新风险点。
arxiv.org ↗