跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 3 小时前AI 评分42

PivotOPD:让多轮智能体从关键错误中恢复的在线策略蒸馏框架

PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

AI 导读

PivotOPD 是一个在线策略蒸馏框架,同时训练学生模型预防关键错误并从其造成的状态中恢复。研究在三个 Qwen3 模型(8B 至 235B)上发现,超过一半的失败轨迹包含一个关键错误,且通常出现在早期,但引导模型在关键轮次后仅几轮即可恢复任务成功。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co