跳到正文
热点事件持续更新

提出隐式模型融合偏好优化方法 InfiFPO

1 篇报道1 个报道来源2 小时前更新

先了解这件事

报道摘要

针对现有模型融合研究偏重 SFT、忽略偏好对齐阶段的问题,研究者提出 InfiFPO——一种面向隐式模型融合的偏好优化方法,它用融合源模型替换 DPO 中的参考模型,在序列级别合成多源概率并保留概率信息。在 11 个基准上,以 Phi-4 为枢轴模型时,InfiFPO 将其平均性能从 79.95 提升至 83.33,在数学、代码和推理任务上均有明显提升。该工作已被 NeurIPS 2025 接收。

摘自 arXiv:cs.CL

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    InfiFPO:通过偏好优化实现大语言模型隐式模型融合

    针对现有模型融合研究偏重 SFT、忽略偏好对齐阶段的问题,研究者提出 InfiFPO——一种面向隐式模型融合的偏好优化方法,它用融合源模型替换 DPO 中的参考模型,在序列级别合成多源概率并保留概率信息。在 11 个基准上,以 Phi-4 为枢轴模型时,InfiFPO 将其平均性能从 79.95 提升至 83.33,在数学、代码和推理任务上均有明显提升。该工作已被 NeurIPS 2025 接收。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。