arXiv:cs.CL(计算语言学,全量分类)· Naen Xu, Wanqing Cui, Yibo Hu, Shixin Hong, Hengyu An, Meiguang Jin, Junfeng Ma, Tianyu Du·· 3 小时前AI 评分45
StateTree:用强化学习增强长期对话推理
StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning
AI 导读
StateTree 是一种数据驱动的强化学习方法,通过在多轮对话中嵌入键值记录构建树状路径追踪任务,让模型跨会话检索记录并比较时间戳完成推理。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org