新预印本称把奖励拆到每个词元可避免训练崩溃
作者自报在五个推理与工具任务上优于GRPO基线,结果未经独立验证,宜作方法信号跟踪。
原始事件 2026-09-23
预印本VERPO把教师指导拆成词元级(token级)信用分配,作者称可避免GRPO(按整句估计优势的训练方法)整句打分导致的优化崩溃。
作者自报在五个科学推理与工具使用任务上取得最高多任务平均分,小模型提升更明显。这是作者第一方评测,无独立复现。
方法细节含Fisher移动成本控制器与FEC投影,v4版9月23日更新,是否成立待第三方验证。