掩码扩散置信度捷径
4 étapes2 pièces6 Sources
掩码扩散模型(MDM)按置信度决定解码顺序,正在被两项研究指向同一个问题:置信度不是可靠的路标。2026年10月2日的预印本称,按置信度选解码顺序会让模型忽略长程依赖,作者自测还发现训练目标会放大这类算术错误【存疑:结论来自作者自测,尚无第三方复现】。次日苹果研究团队给出更一般的说法:置信度排序下每步并行写入多个 token,分布必然偏离,合成任务实测偏离达噪声底 29 倍,但实际影响待验证。
【背景】置信度早已是掩码扩散解码的常用信号。2025年5月的 A-CFG 用低置信度 token 动态重掩码来构造无条件输入,在 GPQA 上比标准 CFG 高 3.9 个百分点;2025年11月的 EOSER 工作则指出全扩散解码会陷入早期过早生成终止符的陷阱,并观察到置信度曲线前平后陡。
分歧在于置信度该被信任到什么程度。一方认为它只是排序启发式,误用会系统性放大错误;另一方把它当作可用的不确定性信号,只要重掩码或调度得当就能提升质量。能定论的是可复现的对照实验:同一模型、同一任务下,置信度解码与随机或固定顺序解码的错误率差异,以及偏离是否随并行宽度增长。
接下来可查:预印本代码仓库 jinha2536/mdm-arithmetic 是否更新复现结果;苹果论文 arXiv:2609.20581 是否给出真实任务而非合成任务的偏离数据;后续工作是否报告置信度排序与随机排序的对照数字。
Comment on en est arrivé là
香港理工大学与复旦大学等团队发布 A-CFG,用低置信度掩码动态构造无条件输入,GPQA 提升 3.9 个百分点、数独提升 8.0 个百分点。
news.qq.com ↗复旦、上海 AI 实验室、上海交大团队提出 EOSER 与递增步长调度,指出全扩散解码存在早期过早生成终止符的陷阱,置信度曲线前平后陡。
finance.sina.com.cn ↗预印本称掩码扩散模型按置信度解码会走捷径、忽略长程依赖,作者自测称训练目标还会放大算术错误。
arxiv.org ↗苹果研究称置信度排序下每步并行写多个 token 时分布必然偏离,合成任务实测偏离达噪声底 29 倍,实际影响待验证。
machinelearning.apple.com ↗
Ce qui reste non résolu
- 置信度解码的错误放大在真实任务上是否可复现,还是仅限合成任务与作者自测?
- 偏离幅度是否随每步并行 token 数增长,存在可用的安全并行宽度阈值吗?
- 动态重掩码(如 A-CFG)能否抵消捷径效应,还是只是把错误推迟到后续步骤?