跳到正文
arXiv:cs.LG· Muhammad Ahmed Mohsin, Muhammad Umer, Emily Fox·· 4 小时前AI 评分44

CU-DPO:用连续效用替代二元偏好,提升大语言模型推理策略选择

Continuous-Utility Direct Preference Optimization

AI 导读

研究者提出连续效用直接偏好优化(CU-DPO),用连续分数替代二元标签来对齐模型的多策略推理能力。理论证明学习 K 种策略比二元偏好有 Theta(K log K) 的样本复杂度提升,且 DPO 收敛到熵正则化的效用最大化策略。在数学推理基准上,七个基础模型的策略选择准确率从 35-46% 提升至 68-78%,分布内推理最高提升 6.6 分,并在代码生成与因果推理任务上取得一致增益。

正文

View PDF HTML (experimental)

Abstract:Large language model reasoning is often treated as a monolithic capability, relying on binary preference supervision that fails to capture partial progress or fine-grained reasoning quality. We introduce continuous utility direct preference optimization (CU-DPO), a framework that aligns models to a portfolio of prompt-based cognitive strategies by replacing binary labels with continuous scores that capture fine-grained reasoning quality. We prove that learning with K strategies yields a Theta(K log K) improvement in sample complexity over binary preferences and that DPO converges to the entropy-regularized utility-maximizing policy. To exploit this signal, we propose a two-stage pipeline: (i) strategy selection, which optimizes the model to choose the best strategy via best-vs-all comparisons, and (ii) execution refinement, which trains correct execution using margin-stratified pairs. The framework is domain-agnostic: any task admitting cognitively distinct solution strategies and a decomposable continuous utility signal can be incorporated into the portfolio. On mathematical reasoning benchmarks, CU-DPO improves strategy selection accuracy from 35-46% to 68-78% across seven base models, yielding downstream reasoning gains of up to +6.6 points on in-distribution datasets with effective out-of-distribution transfer. CU-DPO demonstrates consistent gains on code generation and causal reasoning benchmarks, confirming generalization beyond the mathematical domain.
Comments: Accepted to EMNLP 2026
Subjects: Machine Learning (cs.LG); Artificial Intelligence (cs.AI)
Cite as: arXiv:2602.00931 [cs.LG]
  (or arXiv:2602.00931v3 [cs.LG] for this version)
  https://doi.org/10.48550/arXiv.2602.00931

arXiv-issued DOI via DataCite

Submission history

From: Muhammad Ahmed Mohsin [view email]
[v1] Sat, 31 Jan 2026 23:15:32 UTC (710 KB)
[v2] Thu, 23 Apr 2026 07:38:14 UTC (709 KB)
[v3] Tue, 6 Oct 2026 20:51:14 UTC (803 KB)

来源:arXiv:cs.LG · arxiv.org