资讯1 分钟阅读·
低精度推理需分层舍入策略
研究发现,在6位精度下,对MLP层使用随机舍入、对输出头使用就近舍入,可将DistilGPT-2的困惑度劣化从2.21倍降至1.10倍。
重要性局部证据E2 未复现写法快讯
在6位虚拟精度下,混合舍入策略将DistilGPT-2的困惑度劣化控制在1.10倍以内。
此前低精度推理常统一采用随机舍入(SR)或就近舍入(RN)。该研究指出,不同网络层对舍入误差的敏感度相反:MLP层的噪声主要导致均匀的对数概率偏移,Softmax对其不敏感,因此SR的方差惩罚较小;而语言模型头的噪声非均匀分布,RN更优。
实验显示,纯RN方案使困惑度升至全精度的2.21倍,纯SR为1.15倍。若对MLP应用SR、对Head应用RN,困惑度仅升至1.10倍,比纯RN降低28%。
结果基于DistilGPT-2小模型的仿真测试,尚未在大规模模型或真实硬件上验证。