提出隐式模型融合偏好优化方法 InfiFPO
热点事件持续更新
提出隐式模型融合偏好优化方法 InfiFPO
1 篇报道1 个报道来源2 小时前更新
先了解这件事
报道摘要
针对现有模型融合研究偏重 SFT、忽略偏好对齐阶段的问题,研究者提出 InfiFPO——一种面向隐式模型融合的偏好优化方法,它用融合源模型替换 DPO 中的参考模型,在序列级别合成多源概率并保留概率信息。在 11 个基准上,以 Phi-4 为枢轴模型时,InfiFPO 将其平均性能从 79.95 提升至 83.33,在数学、代码和推理任务上均有明显提升。该工作已被 NeurIPS 2025 接收。
摘自 arXiv:cs.CL
最新进展10月9日 12:00
InfiFPO:通过偏好优化实现大语言模型隐式模型融合报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.CLInfiFPO:通过偏好优化实现大语言模型隐式模型融合
针对现有模型融合研究偏重 SFT、忽略偏好对齐阶段的问题,研究者提出 InfiFPO——一种面向隐式模型融合的偏好优化方法,它用融合源模型替换 DPO 中的参考模型,在序列级别合成多源概率并保留概率信息。在 11 个基准上,以 Phi-4 为枢轴模型时,InfiFPO 将其平均性能从 79.95 提升至 83.33,在数学、代码和推理任务上均有明显提升。该工作已被 NeurIPS 2025 接收。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。