arXiv:cs.LG(机器学习,全量分类)· Tianwei Ni, Vineet Jain, Akash Karthikeyan, Pierre-Luc Bacon·· 1 天前AI 评分33
从静态策略到自适应先验:离线强化学习的 AORL 新视角
From Static Policies to Adaptive Priors in Offline Reinforcement Learning
AI 导读
一篇被 NeurIPS 2026 Position Paper Track 接收的立场论文提出自适应离线强化学习(AORL),主张离线 RL 的目标应从直接部署转向学习自适应策略先验,使策略在后续在线交互中通过记忆、探索和自我纠正持续改进。
来源:arXiv:cs.LG(机器学习,全量分类) · arxiv.org