资讯1 分钟阅读·
莱比锡数学基准:仅1题未解
新模型在100道研究级数学题中仅余1题未解,显示LLM推理能力逼近专家水平。
重要性实质性证据E2 未复现写法快讯
最新一代大语言模型在“莱比锡基准”的100道研究级数学题中,仅未能解决其中1题。
该数据集由49位数学家于2026年4月至5月编制,旨在测试AI处理已知答案的高难度数学问题的能力。此前阶段评估显示,初代尝试有41题完全未解,经过多轮运行和重型思考模型介入后降至2题。
此次更新(第四阶段)引入了具备网络搜索和代码执行能力的下一代模型配置。结果显示,绝大多数题目已被攻克,表明当前前沿模型在特定结构化数学推理任务上已接近人类专家水平。
需注意,这是作者自报结果,且样本量较小(100题),尚未见独立第三方复现验证。