独立测试称GPT-6.1 Sol无思维链成绩逼近Astra
个人实测显示6.1 Sol无思维链表现大幅跳升,循环架构假说若成立将影响模型可监控性。
研究者Rauno Arike实测,GPT-6.1 Sol在27项任务上追平GPT-6 Sol与Astra无思维链差距的80%。
测试沿用此前Astra无思维链评估的任务集,每题取样一次;6.1 Sol在24项任务上更接近Astra。50%时间视界估计从6 Sol的4分钟升至35分钟,但多数基准已饱和,区间很宽。
作者推测6.1 Sol实为循环变压器架构,可能是以Astra Minor名义发布的版本,依据是Azure配置路径等旁证,OpenAI未确认。若属实,意味着循环架构将下沉到非旗舰档位,思维链可控性与可监控性随之下降。
结果出自个人运行,Astra与GPT-5.5的分数直接取自旧帖未重跑。