预训练投毒样本数
3 节点1 篇3 来源
往一个模型的预训练数据里塞多少条恶意样本,才能悄悄改掉它的行为?答案可能比业内普遍假设的少得多:Anthropic 的研究称约 250 份文档即可植入后门,且与模型大小无关;一项新实验进一步显示,在 2000 万参数的小模型上,约 56 条错误样本就能改写一半的回答路径——不过这一数字能否推广到真实大模型,尚无定论。【背景】这类攻击被称为模型投毒:攻击者在训练数据中埋入“后门”指令,模型平时表现正常,遇到特定触发条件才执行恶意行为,常规安全测试几乎无法探出。检测方也在跟进:微软 2026 年 2 月发布了针对 GPT 类模型的扫描器,依据是中毒模型会孤立地聚焦触发词、更易“吐出”投毒数据、且模糊变体触发词也能激活后门这三个特征。争议的核心在于攻击门槛:过去假设攻击者需控制一定比例的训练数据,新研究则指向“少量固定样本即可”。要厘清这一点,需要看小模型上的最小样本数能否在更大规模模型上复现,以及微软扫描器在真实生产模型上的检出率。
事情怎么走到这一步
发表于 ACM Transactions on Privacy and Security 的 IDPA 攻击表明,对比学习预训练编码器同样可被无差别投毒:在 OpenAI CLIP 数据集上攻击成功率达 88%。
ebiotrade.com ↗微软发布模型投毒检测研究,指出中毒模型的三个可观察特征,并推出面向 GPT 类模型的实用扫描器,在 2.7 亿至 140 亿参数模型上测试称误报率低。
zdnet.com ↗一项实验显示,在 2000 万参数小模型上约 56 条错误样本即可改写一半回答路径;能否推广到真实大模型待验证。
lesswrong.com ↗
还没定论的部分
- 约 56 条样本改写小模型行为的结果能否推广到真实大模型?
- 微软扫描器在真实生产环境模型上的实际检出率如何?
- 后训练阶段(如安全微调)能否有效清除已植入的后门?