跳到正文
原文
arXiv:cs.AI(全量分类)· Liner Xiang, Wenbo Zhang, Hengrui Cai·· 1 天前AI 评分39

OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models

AI 导读

研究者提出 OTROPE,一种无需似然函数的 LLM 离线策略评估方法,通过最优传输在语义空间做分布校正,将行为策略的标注样本与目标策略的无标注样本对齐。它结合校正后的人类标注残差与代理预测器,无需行为策略建模或密度比估计,即可实现双重鲁棒式评估。实验显示 OTROPE 持续优于基线,并能让较弱 LLM 评估器集成逼近甚至超越更强评估器,代码已开源。

来源:arXiv:cs.AI(全量分类) · arxiv.org