新方法称定向遗忘大模型行为可快77倍
影响加权遗忘若属实可大幅降低模型纠偏成本,但数字出自作者自测,待第三方复现。
原始事件 2026-09-24
预印本RapidUn v4于9月24日更新,提出用样本影响力加权做LoRA遗忘,作者称在Llama-3-8B上定向移除触发行为时,比干净语料LoRA重训参考快77倍。
机器遗忘指不重训整个模型、只移除已学到的特定行为。该方法把跨样本影响力估计转成固定权重,作者报告其触发攻击成功率低于Fisher、GA、LoReUn三个已有方法,干净任务能力基本不掉,并在Mistral-7B上做了跨模型验证。
对比基线是同类遗忘方法而非完整重训,测试均在作者自建的触发基准上完成,代码已开源,第三方复现结果尚未出现。