AMSC方法用于终身强化学习策略复用
热点事件持续更新
AMSC方法用于终身强化学习策略复用
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Saptarshi Nath等作者发表论文,提出自适应掩码选择与组合(AMSC)方法,用于终身强化学习中的策略复用。该方法通过非参数 Wasserstein 任务嵌入,从状态-动作-奖励样本中在线估计任务相似度,并用 z-score 归一化的 sparsemax 生成可变支撑集,周期性选择并加权已有策略,构成新任务的先验。论文称代码已公开。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
如何在终身强化学习中寻找并复用策略以实现持续适应报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LG如何在终身强化学习中寻找并复用策略以实现持续适应
研究提出 Adaptive Mask Selection and Composition(AMSC),通过非参数 Wasserstein 任务嵌入从状态-动作-奖励样本中在线估计任务相似度,并用 z-score 归一化的 sparsemax 生成可变支撑集,周期性选择并加权已有策略构成新任务的先验。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。