跳到正文
热点事件持续更新

AMSC方法用于终身强化学习策略复用

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Saptarshi Nath等作者发表论文,提出自适应掩码选择与组合(AMSC)方法,用于终身强化学习中的策略复用。该方法通过非参数 Wasserstein 任务嵌入,从状态-动作-奖励样本中在线估计任务相似度,并用 z-score 归一化的 sparsemax 生成可变支撑集,周期性选择并加权已有策略,构成新任务的先验。论文称代码已公开。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    如何在终身强化学习中寻找并复用策略以实现持续适应

    研究提出 Adaptive Mask Selection and Composition(AMSC),通过非参数 Wasserstein 任务嵌入从状态-动作-奖励样本中在线估计任务相似度,并用 z-score 归一化的 sparsemax 生成可变支撑集,周期性选择并加权已有策略构成新任务的先验。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。