资讯1 分钟阅读·
去除合成痕迹后植入的假事实可骗过线性探针
合成文档微调的假事实隐蔽性有进展,但仅限探针维度且为作者自测,下游传导仍不完全。
重要性局部证据E2 未复现写法快讯
减少合成文档微调(SDF)中的“合成痕迹”后,部分植入的假事实在线性探针下已与预训练知识无法区分。这是研究者Jason Zeng 10月4日在LessWrong发布的第一方实验结果。
此前Slocum等人在2025年的研究显示,SDF植入的假事实几乎总能被中间层线性探针识别,但无法确定是“看起来像合成文本”还是“模型不信”导致。该实验把训练文档中的惊讶措辞、破折号等痕迹去除后,微妙假事实的探针误差率接近0.5,即真假难以分辨。
结果基于Llama-3.1-8B-Instruct和作者自己的探针流程;假事实在探针下不可区分后,并不总能传导到下游推理任务,过度训练仍会留下可检测痕迹。