跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Yuhan Guo, Jinming Liu, Liang Xu, Ziqiang Li, Jianguo Huang, Zhicheng Wang, Hu Zhu, Qiuyu Chen, Yuntao Wei, Xin Jin, Wenjun Zeng·· 3 小时前AI 评分42

EVOKE:通过目标多样性激发 LLM 智能体的世界知识以实现可迁移决策

EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

AI 导读

针对 LLM 智能体在多步决策中难以迁移到未见环境的问题,研究者提出后训练方法 EVOKE,通过在固定状态下引入目标多样性,迫使同一状态下候选动作的偏好排序随目标变化,从而激发预训练中已内化的世界知识。EVOKE 在三种骨干模型、多类任务上提升了任务表现、未见环境泛化能力和数据效率。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org