多链MDP平均奖励RL提出分层分解算法
热点事件持续更新
多链MDP平均奖励RL提出分层分解算法
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究团队提出一种基于异步值迭代的强化学习算法,用于求解平均奖励多链马尔可夫决策过程(MDP)的最优策略。据论文称,该算法只需知道MDP的转移图,无需其他模型知识,并借助Bather分解将状态空间分层划分为通信子系统与瞬态状态。 该工作由Huizhen Yu与Isaiah Heidt完成,论文发布在arXiv的cs.LG分类下。
AI 根据报道生成 · 58 分钟前更新
最新进展10月8日 12:00
面向多链 MDP 的平均奖励强化学习:一种分层分解方法报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LG面向多链 MDP 的平均奖励强化学习:一种分层分解方法
研究团队提出基于异步值迭代的强化学习算法,用于求解平均奖励多链 MDP 的最优策略,仅需知道 MDP 转移图,并借助 Bather 分解将状态空间分层划分为通信子系统与瞬态状态。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。