预印本称免训练剪枝可裁掉MoE一半专家而推理分领先
RAZOR按可替代性而非贡献度给专家打分,作者自测领先,能否复现决定其对部署的实际价值。
预印本RAZOR提出一种免训练的MoE专家剪枝方法,作者自测在四个模型、八组设置中平均分领先同类方法。
混合专家模型每个词只激活少数专家,却要存下整个专家池。作者Mingyang Song与Mao Zheng认为,决定删除损失的不是专家贡献大小,而是幸存计算能否复现被删专家的输出;RAZOR用「共识残差」直接算出删掉一个专家后的输出变化,只做前向传播,不需要梯度或恢复训练。
在GLM-4.7-Flash、Qwen3.6-35B-A3B等四个模型上移除25%和50%的专家时,作者称RAZOR在九项推理任务的平均分上全部领先,对比REAP方法高出2.12至5.59分。论文同时承认,剪后模型在输出多样性、格式和终止行为上仍有变化。
摘要未列出参与对比的剪枝方法全集,领先幅度只相对论文内评估的少数基线成立。