资讯1 分钟阅读·
新方法让推理模型遗忘时不留破绽,效果仍是自测
GUARD针对思维链中途泄露设计遗忘轨迹,已被EMNLP 2026主会接收,实际效果待独立复现。
重要性局部证据E2 未复现写法快讯
GUARD方法已被EMNLP 2026主会接收,论文9月18日提交arXiv。
它针对的问题是:推理模型遗忘敏感内容后,思维链中间步骤仍可能先泄露答案。GUARD把不安全输出改写成连贯不泄露的推理加稳定拒答,再蒸馏进模型参数。
作者还提出NFRS指标,衡量遗忘后输出的结构稳定性、流畅度和无依据替代内容。实验在R-TOFU和一个STAR-1衍生的有害意图设定上进行,覆盖两个蒸馏推理模型,称能降低不安全与隐私泄露并保留推理能力。以上均为作者自测结果,无独立复现。