InfiFPO助Phi-4均分升3.4
新融合方法让Phi-4在11项基准测试中平均分从79.95升至83.33。
重要性实质性证据E2 未复现写法快讯
InfiFPO方法将Phi-4在11项基准测试的平均分从79.95提升至83.33。
传统模型融合多聚焦监督微调,常丢弃源模型的概率信息。InfiFPO在直接偏好优化(DPO)中用融合源模型替代参考模型,保留并合成多源概率。
该方法引入概率裁剪与最大边际融合策略,在保持人类偏好对齐的同时有效蒸馏知识。实验显示其在数学、编码及推理任务上表现显著提升。
此为NeurIPS 2025接收论文的作者自测结果,尚待社区独立复现。