无思维链基准存在关键位置混淆,推理深度被高估
把初始状态移到提示末尾后深度中位数降16%,解读Astra类模型优势时需扣除这一混淆。
把提示中的初始状态移到末尾后,GPT-6.1 Sol的无思维链推理深度中位数下降16%。
Neel Nanda发布的no-cot-bench基准曾显示疑似循环变压器的Astra解题几率约为Fable 5.1的8.6倍。两位研究者指出混淆:初始状态通常在提示开头,模型可以边读边算,基准因此同时测到串行深度和跨token分配计算两种能力。
他们把6个串行状态追踪任务改成初始状态在末尾的版本,并加入无关问题对照排除解析难度干扰。12个任务的深度损失中位数为16%,范围9%至45%。作者只测了GPT-6.1 Sol一个模型,称缺算力未复测其他模型。
信息源:https://www.lesswrong.com/posts/ehF4kej38fkhb5cT3/a-key-position-confound-in-no-cot-bench-and-implications-forhttps://www.lesswrong.com/posts/eRmzz8J8Qkzqvzrgg/astra-can-do-a-concerning-amount-with-no-chain-of-thought