GPT-6.1 Sol无思维链实测追平Astra差距八成
GPT-6.1 Sol在无思维链设置下追平了GPT-6 Sol与Astra之间差距的80%,这是研究者Rauno Arike在27项任务上实测得出的结果。
此前无思维链档位的模型与Astra差距明显,且缺乏针对该档位的独立实测数据。
测试沿用此前Astra无思维链评估的任务集,每题取样一次;6.1 Sol在24项任务上更接近Astra。50%时间视界估计从6 Sol的4分钟升至35分钟,但多数基准已饱和,区间很宽。
作者推测6.1 Sol实为循环变压器架构,可能是以Astra Minor名义发布的版本,依据是Azure配置路径等旁证,OpenAI未确认;结果出自个人运行,Astra与GPT-5.5的分数直接取自旧帖未重跑。
信息源:lesswrong.com