资讯1 分钟阅读·
文生图擦除技术存后门漏洞
新研究揭示“擦除规避后门”可绕过主流安全过滤,最高94%成功率暴露违禁内容。
重要性实质性证据E2 未复现写法快讯
文生图模型的安全擦除机制存在严重盲区:植入特定后门的模型在经历概念擦除后,仍能高概率生成被禁止的内容。
此前业界认为通过微调切断有害概念关联即可保障安全,但TU Darmstadt团队提出的“擦除规避后门”(EEB)显示,攻击者可将触发器与目标概念绑定,使恶意链接在后续擦除中存活。
在针对六种最先进擦除方法的测试中,EEB对名人身份擦除的成功率达82%,对物体擦除达94%,并使露骨内容曝光量放大16倍。该结果基于预印本自测,尚待独立复现。