资讯1 分钟阅读·
开源模型可低成本评判数学证明
新研究称GPT-OSS等开源模型在数学证明评分上与前沿模型表现相当,但成本低数十倍。
重要性局部证据E2 未复现写法快讯
开源模型GPT-OSS-120B和DeepSeek-V4-Flash在数学证明自动评分任务中,表现与Claude Opus 4.7等前沿模型统计上无显著差异,但推理成本低4至100倍。
传统上评估AI数学推理能力依赖昂贵的前沿大模型作为裁判。该研究在IMO-GradingBench基准测试中发现,使用三个廉价开源模型进行共识投票(如全票通过或多数决)可作为有效的替代方案。
实验显示,全票通过规则具有最高精确度(0.855),而多数决规则具有最高召回率(0.912)。该结论在独立数据集ProofBench上也得到了复现。
此结果为单篇预印本论文(arXiv:2608.00004v2)的作者自测数据,尚未见第三方独立复现报告。