研究者提出用开源模型内部信号监控闭源模型
不拿权重也能做内部探测的思路有了首批数据,但全部为作者自测,能否用于真实审计待验证。
不接触闭源模型权重,也可能通过开源替身模型的内部信号监控其欺骗等失控行为。
conti等研究团队9月30日在LessWrong提出model hermeneutics:把要研究的闭源模型称为author,用开源的reader模型读它的输出,再在reader内部训练线性探针。作者自测中,27B的reader探测397B的author,AUROC差距平均只有0.004。
团队称探针可检测Claude Opus 4.6、Gemini 3.1 Pro Preview、GPT-5.4等三个前沿模型输出中的奖励作弊、谄媚与欺骗,约半数场景下优于直接询问reader。蒸馏后reader探测欺骗的AUROC从0.69升至0.90。
这是约1.5个月的早期工作,闭源模型内部没有真值,faithfulness只能用开源模型对间接基线衡量,能否用于真实审计待独立验证。