CoEM延迟压缩记忆
4 단계1 건4 출처
CoEM(Commit-on-Evidence Memory)是 KAIST、澳门大学、MIT 等机构作者提出的一种长文本推理记忆框架,核心是把"压缩"这个不可逆决定推迟:模型分块读长文档时,暂不确定是否有用的原文片段先逐字存入待定区,等后续上下文澄清其相关性后,再由一个经强化学习训练的策略决定提升、保留或丢弃,且任何写入记忆的事实都要通过一个冻结的 NLI 验证器核对原文。作者自测在 Qwen3.5-9B 上、6,400 篇文档(约 0.8M token)输入下,比最强记忆基线高 10.4–11.4 个 F1 点,且从 50 篇到 6,400 篇 F1 仅下降 1.0–2.1 点。动机来自一个诊断发现:三个多跳问答基准中 32.03%–44.53% 的抽样问题存在"证据相关性延迟"——即先读到的细节要到后面才显出重要性,而现有方法一旦过早压缩就找不回来。【存疑】这些数字均为作者自测,效果尚待独立复现;论文截至发稿尚未被会议接收,完整源码与模型权重承诺在接收后发布,目前 GitHub 仓库只有文档和图表。
현재까지의 과정
论文 v1 提交 arXiv(cs.AI),提出 CoEM:在固定 1,024 token 记忆预算(256 待定 + 768 已提交)下延迟压缩证据,用强化学习结合最终答案奖励与步级证据奖励训练记忆策略。
arxiv.org ↗论文更新至 v2。
arxiv.org ↗GitHub 仓库上线项目概览与文档,宣布完整源码将在论文接收后发布于 GitHub、模型权重发布于 Hugging Face;仓库当前仅含文档与图表。
github.com ↗媒体报道该工作:在 Qwen3.5-9B 上自测比最强记忆基线高 10.4–11.4 个 F1 点,并指出效果待独立复现。
arxiv.org ↗
아직 해결되지 않은 문제
- 10.4–11.4 F1 的提升能否被独立团队复现,尤其是在其他骨干模型上?
- 论文能否通过同行评审并被会议接收,从而触发完整源码与权重的发布?
- 延迟保留待定证据在真实生产场景(而非三个多跳 QA 基准)中的计算开销与收益如何?