资讯1 分钟阅读·
Eduardo模型大幅降低教学推理成本
新研究提出Eduardo训练法,使27B模型以极低算力匹配前沿AI导师效果并开源数据。
重要性局部证据E2 未复现写法快讯
Eduardo-27B模型在两项教学基准测试中达到Gemini-3.1-Pro和Claude Opus 4.8的水平,但消耗的“思考token”数量仅为前者的1/2.4至1/6.2。
传统强化学习训练的AI导师常因奖励机制缺陷而倾向于直接给出答案,导致学生产生认知依赖。该研究引入“掩码近迁移后测”,强制模型通过引导学生自主解题来提升奖励,从而区分了“教导”与“告知”。
团队已开源包含8,671个问题的近迁移数据集、训练环境及模型权重。目前结果主要基于作者自报基准,尚待社区独立复现以验证其在更广泛场景下的鲁棒性。