GPT-OSS数学评分
3 节点1 篇3 来源
OpenAI 发布的开源模型 GPT-OSS 在数学证明自动评分任务中,展现出与前沿闭源模型相当的能力,但成本大幅降低。2025年8月,OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b,作为其自 GPT-2 以来首批开源权重模型,主打推理能力与低部署成本【背景】。2026年10月,研究论文 arXiv:2608.00004 指出,在 IMO-GradingBench 基准测试中,GPT-OSS-120B 等廉价开源模型在判断人类评分一致性上,统计上不劣于 Claude Opus 4.7 等前沿模型,且成本低 4-100 倍。该研究强调,采用“全票通过”的共识规则可最大化精确率(0.855),适合对误判零容忍的场景。
争议在于:尽管开源模型在纯文本证明评分上表现强劲,但在处理手写数学试卷时,多模态模型(如 GPT-4o)仍显著低于人类评分员准确率,存在视觉解析瓶颈【存疑】。此外,独立评估显示 GPT-OSS-20B 在某些基准上优于 120B 版本,提示稀疏架构的性能增益并非线性。未来需观察该评分方法在 Gradescope 等主流教学平台的大规模落地效果,以及不同共识规则对教育公平性的实际影响。
事情怎么走到这一步
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个开源权重模型,采用混合专家(MoE)架构,声称在推理任务上接近 o4-mini 性能,且支持本地部署。
openai.com ↗独立研究团队发布评估报告,对比 GPT-OSS 与其他开源模型,发现 gpt-oss-20B 在 HumanEval 和 MMLU 等基准上表现优于 gpt-oss-120B,质疑稀疏架构的缩放效应。
arxiv.org ↗研究论文 arXiv:2608.00004 发表,证实 GPT-OSS-120B 和 DeepSeek-V4-Flash 在数学证明评分上与前沿模型无显著差异,成本降低数十倍,并验证了“全票通过”规则的高精确率。
arxiv.org ↗
还没定论的部分
- GPT-OSS 评分系统在 Gradescope 等大规模教学环境中的延迟与吞吐量是否满足实时反馈需求?
- 针对手写数学公式的多模态评分,开源模型能否突破视觉解析瓶颈以匹配人类评分员水平?
- “全票通过”与“多数投票”规则在不同难度题目上的误差分布是否存在系统性偏差?