资讯1 分钟阅读·
苹果发布DACA-GRPO:为扩散语言模型强化学习加入去噪步信用分配,自报七项基准一致提升
苹果机器学习研究博客9月16日介绍DACA-GRPO:针对扩散语言模型强化学习去噪步骤无信用分配、均值场似然有偏两个缺陷,提出去噪进度评分与分层掩码似然,即插即用于GRPO类训练器。页面自报,叠加三种GRPO基方法后七项基准一致提升,数学最高5.6、
重要性局部证据E2 未复现
苹果机器学习研究博客9月16日介绍DACA-GRPO:针对扩散语言模型强化学习去噪步骤无信用分配、均值场似然有偏两个缺陷,提出去噪进度评分与分层掩码似然,即插即用于GRPO类训练器。页面自报,叠加三种GRPO基方法后七项基准一致提升,数学最高5.6、代码7.4、约束满足36.3个百分点。论文2026年5月8日已提交arXiv;尚待独立复现。