研究称棋力越高模型计算越靠深层
作者自测发现技能条件升高让计算移向深层,与常见预测相反,能否推广到语言模型待验证。
原始事件 2026-09-24
一项可解释性研究称,棋类模型的能力越强,计算越集中在网络深层。
研究对象是Maia-3,一个以棋手等级分(Elo)作为输入的8层国际象棋Transformer,权重不变、只调等级分。作者David Litman通过逐头消融测量发现,等级分从700升到2500时,所有测过的着法类型的因果质量中心都单调移向更深层,骑士双击等战术迁移最明显。
这一方向与“高手特征应更早算出以便复用”的预测相反。分析基于作者自建的chessformer-lens工具,样本限于这一个棋类模型,能否推广到语言模型未知。