新分析称J-lens默认取末层会引入语言偏差
作者自测显示末层目标让DeepSeek-V3中段读出近半变中文,改倒数第二层降至3%,方法默认值值得检查。
原始事件 2026-09-25
一位研究者分析称,可解释性工具J-lens默认以模型末层为目标,可能让读出结果被末层方向污染。
J-lens是一种把大模型内部状态翻译成词、用来观察模型各层在“想”什么的解读工具。作者Kaley Brauer统计了78个公开发布的J-lens,其中80%以末层为目标。据其自测,在DeepSeek-V3上,末层目标使模型中段约一半读出变成中文词,改用倒数第二层后降至3%。
原因据称是DeepSeek-V3的最后一个块在英文文本上大幅压低中文词概率,这个方向被放大后主导了整个透镜。作者建议拟合或使用J-lens时检查末块是否注入主导方向。结论出自作者自测,仅覆盖DeepSeek-V3一个模型,待第三方复现。