资讯1 分钟阅读·
无训练提升dLLM推理16%
新框架RFG通过利用现有检查点信号,使扩散大语言模型在推理阶段性能提升最高16.1%,无需额外训练或数据。
重要性实质性证据E2 未复现写法快讯
扩散大语言模型(dLLM)可在推理阶段通过新框架RFG实现自我改进,性能提升最高达16.1%。
此前提升dLLM能力通常依赖昂贵的后训练、额外数据或奖励模型。RFG提出一种免训练方法,直接从模型检查点中提取引导信号,解决了部分掩码中间状态缺乏明确指导的问题。
该研究由斯坦福大学团队完成,理论证明可通过策略与参考模型的对数似然比参数化奖励信号。实验显示,尽管完全无需训练,其增益可媲美甚至超过资源密集的强化学习技术。
目前为预印本结果,尚待社区独立复现验证。