擦除规避后门漏洞
3 ステップ1 件2 ソース
文生图模型的安全过滤机制正面临“擦除规避后门”(Erasure Evasion Backdoor, EEB)的严峻挑战。该漏洞由达姆施塔特工业大学等机构的研究人员发现,并于2026年10月公开。其核心在于攻击者将隐藏触发词绑定至旨在被移除的有害概念上,使得这一恶意关联在后续的模型微调或概念擦除过程中存活下来。
研究显示,EEB对当前六种主流擦除方法均有效:针对名人身份遗忘的成功率最高达82%,对象擦除最高达94%,且能将露骨内容的暴露量放大16倍。【背景】此前业界普遍认为通过参数级微调可彻底切断有害概念链接,但EEB证明这种“表面擦除”存在盲区。目前争议焦点在于现有防御手段是否仅掩盖了浅层连接而未触及深层表征。研究者已发布包含预训练检查点的开源代码库,供社区压力测试未来的擦除技术。
経緯
论文《Erased but Not Forgotten》首次提交至arXiv,提出EEB概念。
arxiv.org ↗论文更新至v4版本,确认ICML 2026录用状态,并完善实验数据。
arxiv.org ↗媒体广泛报道该研究,指出EEB可绕过主流安全过滤,最高94%成功率暴露违禁内容。
arxiv.org ↗
未解決の問題
- 现有的鲁棒性擦除方法为何无法检测出深层的触发器-目标关联?
- 工业界部署的文生图模型中有多少比例可能已受此类后门污染?
- 是否存在不依赖重新训练的轻量级检测方法以识别EEB?