资讯1 分钟阅读·
开源模型复现未支持全局工作区假说
J-lens干预在开源模型上很少改变最终答案,该假说的适用范围需要重新审视。
重要性局部证据E2 未复现写法快讯
一位研究者在开源模型上复现Anthropic的全局工作区实验,结果未支持该假说。
Anthropic的J-lens论文提出,模型的中间推理概念存放在一个“全局工作区”里,干预这个空间应能改变模型答案。作者Mirella Zeisler在Qwen3.6-27B和Gemma 3 27B-it上重跑了多跳推理实验,比如把中间步骤“火星”换成“海王星”,看模型是否改答“蓝色”。
结果显示,干预虽能推动答案概率,但很少真正翻转输出:四种条件下top-1翻转率仅6.3%至11.1%,远低于Anthropic在Claude上报告的54%至70%。四种条件中有三种是“直接注入答案”比“注入中间步骤”更有效,说明干预可能只是在把模型推向最终答案。
作者据此认为,J-lens更适合用来读取中间变量,而不是控制模型输出。这是个人博客上的第一方实验,筛选后每组仅剩27至44条提示,样本不大。