InfiFPO融合方法
3 steps1 pieces3 Sources
InfiFPO是一种针对大语言模型偏好对齐阶段的隐式模型融合方法,旨在解决现有融合技术丢弃源模型概率信息的问题。该方法由香港理工大学杨红霞团队提出,被NeurIPS 2025接收为Spotlight论文。
【背景】传统模型融合多集中于监督微调(SFT),而在关键的偏好对齐(PA)阶段,现有方法如WRPO仅使用源模型的响应输出,忽略了其内部概率分布,导致知识蒸馏不完整。InfiFPO通过序列级概率合成替代DPO中的参考模型,避免了复杂的词汇表对齐挑战,同时保留了概率信息。
实验数据显示,当以Phi-4作为枢轴模型时,InfiFPO使其在11项基准测试中的平均分从79.95提升至83.33,尤其在数学、编码和推理任务上表现显著。该方法是“三壁”突破策略的一部分:先通过InfiFusion解决词汇不匹配,再通过InfiGFusion处理结构冲突,最后由InfiFPO完成价值与偏好的安全对齐。
目前GitHub仓库已发布代码框架和Hugging Face模型权重,但核心训练实现文件尚未完全公开,复现需等待官方补充配置。
How it got here
港理工PAAI新闻稿介绍InfiFusion框架,指出大模型融合的三大障碍及对应解决方案,其中InfiFPO负责偏好对齐。
polyu.edu.hk ↗arXiv提交v1版本论文《InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models》。
arxiv.org ↗论文更新至v4版本,确认NeurIPS 2025录用状态,并详细披露Phi-4在11项基准上的性能提升数据(79.95至83.33)。
arxiv.org ↗
What is still unsettled
- GitHub仓库中缺失的`fpo/run.py`和配置文件何时会完整开源?
- InfiFPO在非Phi-4的其他主流开源模型(如Llama系列)上的泛化能力如何?
- 序列级概率合成在极大上下文窗口下的计算开销具体是多少?