跳到正文
原文
arXiv:cs.LG(机器学习,全量分类)· Tong Zhao, Reed Li, Yuyang Hu, Yutao Zhu, Haijin Liang, Haibo Shi, Yu Lu, Zhicheng Dou·· 1 天前AI 评分40

StepLearn:面向 LLM 智能体的序贯式测试时学习框架

Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents

AI 导读

StepLearn 是一个非参数框架,将即时使用与持久信任分离:把有信息量的状态转移转化为可指导下一步的假设,但需经跨回合的前瞻验证后才允许复用。

来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org