预印本称掩码扩散模型按置信度解码会走捷径放大算术错误
掩码扩散模型解码按置信度选顺序会忽略长程依赖,作者自测称训练目标还会放大该错误,方向值得跟踪。
预印本提出「置信度捷径」:掩码扩散模型按置信度选生成顺序,会忽略长程依赖。
掩码扩散模型(MDM)是一类可按任意顺序逐步还原文本的生成模型,理论上能沿逻辑依赖展开中间步骤。作者Dueun Kim与Albert No称,实际解码只优先输出高置信度词元,在多位加法中会先算高位数字而不追踪进位链。
作者自测的受控预训练显示,置信度引导的顺序常选次优序列;与置信度对齐的训练目标会把加法错误率推高一个数量级。实验代码已开源,结论限于作者自己的设置,效果待独立复现。
信息源:https://arxiv.org/abs/2605.29123https://github.com/jinha2536/mdm-arithmetic