跳到正文
热点事件持续更新

递归熵风险RL样本复杂度获近优分析

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Amirparsa Bahrami、Oliver Mortensen 和 Mohammad Sadegh Talebi 发表论文,对有限折扣 MDP 中风险参数 β≠0 的递归熵风险偏好下的基于模型风险敏感 Q 值迭代(MB-RS-QVI)给出精细分析,得到了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。 作者称,该样本复杂度界在有效时域 1/(1-γ) 上的指数依赖优于该设定已有的最优保证。MB-RS-QVI 是此前工作中提出的 plug-in 基于模型方法,本次结果是其分析上的改进。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析

    研究在有限折扣 MDP 中、风险参数 β≠0 的递归熵风险偏好下,基于生成模型的价值与策略学习样本复杂度。作者对基于模型的风险敏感 Q 值迭代(MB-RS-QVI)进行精细分析,给出学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证,其界在有效时域 1/(1-γ) 上的指数依赖优于该设定已有最优保证。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。