递归熵风险RL样本复杂度获近优分析
热点事件持续更新
递归熵风险RL样本复杂度获近优分析
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Amirparsa Bahrami、Oliver Mortensen 和 Mohammad Sadegh Talebi 发表论文,对有限折扣 MDP 中风险参数 β≠0 的递归熵风险偏好下的基于模型风险敏感 Q 值迭代(MB-RS-QVI)给出精细分析,得到了学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证。 作者称,该样本复杂度界在有效时域 1/(1-γ) 上的指数依赖优于该设定已有的最优保证。MB-RS-QVI 是此前工作中提出的 plug-in 基于模型方法,本次结果是其分析上的改进。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LG递归熵风险强化学习的近最优样本复杂度:基于生成模型的分析
研究在有限折扣 MDP 中、风险参数 β≠0 的递归熵风险偏好下,基于生成模型的价值与策略学习样本复杂度。作者对基于模型的风险敏感 Q 值迭代(MB-RS-QVI)进行精细分析,给出学习最优 Q 值函数与 ε-最优策略的 (ε,δ)-PAC 保证,其界在有效时域 1/(1-γ) 上的指数依赖优于该设定已有最优保证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。