独立测试称GPT-6.1 Sol无推理链表现逼近Astra
单人复测显示新Sol版无推理链成绩大幅逼近Astra,但架构解释仍是作者猜测,待复现。
研究者Rauno Arike在LessWrong发文称,GPT-6.1 Sol在不使用推理链的27项任务上,弥合了GPT-6 Sol与GPT-6 Astra之间80%的差距(95%置信区间72%–87%)。
测试沿用其此前对Astra的无推理链评测方法:因6.1 Sol不支持关闭推理,作者用reasoning_effort=low加即时回忆提示替代,每题只取1个样本;任务集还剔除了此前无法区分新旧模型的9项任务。时间跨度估计从GPT-6 Sol的4.0分钟升至35分钟,但作者自认多数基准已饱和,该估计很不可靠。
作者猜测6.1 Sol与Astra同为循环transformer架构,依据是Azure配置中出现gpt-6-astra-minor路径及社区推测,这一解释未经OpenAI证实。
信息源:https://www.lesswrong.com/posts/LqSZZAriGqgsGDQe3/gpt-6-1-sol-nearly-matches-the-no-cot-performance-of-gpt-6https://techcrunch.com/2026/09/29/openai-launches-gpt-6-1-sol-says-it-nearly-matches-gpt-6-astra-and-costs-less