合成文档微调假事实
2 étapes0 pièces2 Sources
大语言模型在微调阶段对“被明确标注为假”的信息存在严重的“否定忽视”现象,且近期研究进一步发现,去除合成痕迹后的假事实能骗过线性探针检测。
【背景】此前一项针对Qwen3.5、Kimi K2.5等模型的预印本研究显示,即便训练文档中包含“此内容完全虚假”的显式警告,模型仍会将荒诞陈述内化为高置信度信念(如将虚构的艾德·希兰奥运成绩视为事实),平均信念率高达88.6%。仅当否定信息以“局部整合”方式嵌入句子本身时,该效应才被基本消除。
最新进展表明,这种风险正变得更加隐蔽:通过去除合成文档中的特定标记,植入的假事实可成功规避线性探针的安全检查。尽管目前这一结论主要基于作者自测且下游传导机制尚不完全清晰,但它证实了现有安全对齐手段在面对精心构造的训练数据污染时存在盲区。核心分歧在于:显式的整体警告无效,而隐性的统计规律吸收难以通过常规探针拦截。未来需关注更细粒度的数据清洗标准及针对“局部否定”有效性的工程化验证。
Comment on en est arrivé là
腾讯新闻转载至顶科技报道,指出LLM存在“否定忽视”现象:即使训练数据明确标注虚假,模型仍会吸收并内化这些错误信息,信念率高达88.6%,且事后纠正效果有限。
news.qq.com ↗LessWrong发布新研究,显示去除合成痕迹后,微调植入的假事实可骗过线性探针,但强调该结论仅限探针维度且为作者自测,下游影响待观察。
lesswrong.com ↗
Ce qui reste non résolu
- 去除合成痕迹后的假事实在实际推理任务中的错误传导率具体是多少?
- 除了“局部整合”否定句,是否有其他自动化方法能在大规模数据清洗中识别此类隐蔽污染?
- 线性探针失效是否意味着现有的RLHF或DPO对齐流程需要引入新的对抗性测试基准?