模型解释学探针
4 etapas1 peças4 Fontes
研究者正在尝试回答一个老问题:语言模型内部到底学到了什么,以及我们用来窥探它的"探针"工具本身可不可信。2026年10月,有研究者在 LessWrong 提出用开源模型的内部信号监控闭源模型,不拿权重也能做内部探测,但首批数据全部为作者自测,能否用于真实审计尚待验证。此前,另一团队用模仿语言模型架构的星系图像模型 AstroPT 做了关键校准:星系的亮度、红移、恒星形成率有天文学百年积累的"标准答案",实验发现模型按难度顺序依次学会这些概念,且顺序不随训练目标或模型规模(100万到1亿参数)改变,线性探针读出的方向还精确复现了物理量之间的已知关系——这为"探针到底靠不靠谱"这一长期争议提供了正面证据。分歧在于:乔姆斯基等人认为语言模型学得太好、与语言学无关,而2024年 ACL 最佳论文《不可能语言的模型》用12种人造语言显示模型学"不可能语言"确实更难,说明其偏好与人类有相似之处。要判定探针结论能否推广,需要看的是:开源模型内部信号监控法能否在第三方真实审计中复现,以及探针方法在更大规模、非线性知识结构上的表现——目前材料显示这些均无定论。
Como chegamos aqui
数据科学家 Keyur Faldu 与 Amit Sheth 系统评述语言探针方法,指出核心争议:探针在辅助任务上表现好,究竟是模型真的编码了语言知识,还是探针自己学会了任务,需用"控制任务"和"选择度"来检验。
news.qq.com ↗《光明日报》报道围绕语言模型是否真正"学语言"的争论:乔姆斯基2023年称语言模型连"不可能语言"也能学会,而斯坦福团队用12种"不可能语言"实验发现模型学习它们确实更难,该论文获 ACL 2024 最佳论文奖。
news.gmw.cn ↗研究团队用模仿语言模型的星系图像模型 AstroPT 验证探针方法:模型按亮度→红移→比恒星形成率的难度顺序学习概念,顺序不随训练目标或规模改变,探针方向还复现了已知物理关系,为线性探针可靠性提供了有"标准答案"的校准证据。
news.qq.com ↗研究者在 LessWrong 提出用开源模型的内部信号监控闭源模型,不拿权重也能做内部探测,并给出首批数据;但全部为作者自测,能否用于真实审计待验证。
lesswrong.com ↗
O que ainda está indefinido
- 用开源模型内部信号监控闭源模型的方法,能否在作者自测之外的第三方真实审计中复现?
- 星系实验中探针只验证了线性可分的知识结构,非线性缠绕的概念探针读不出来,这一局限在语言模型上如何处理尚无答案。