正则化Q函数补齐对抗性MDP策略优化horizon差距
热点事件持续更新
正则化Q函数补齐对抗性MDP策略优化horizon差距
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Mingyi Li、Taira Tsuchiya 发表论文,用正则化 Q 函数做策略优化,补齐对抗性 MDP 中策略优化算法相对占用度量算法的 horizon 差距。 研究针对带对抗性损失和 bandit 反馈的在线回合制表格 MDP,得到遗憾界:已知转移下为 Õ(√HS(H+A)T),未知转移下为 Õ(HS√AT),消去了既有策略优化界多出的 H 因子,与占用度量算法已知最优界一致。作者称正则化 Q 函数能在所有状态-动作对上联合控制局部更新的稳定性,而非逐状态分别控制。该方法还扩展到对抗性线性混合 MDP,取得相同的 horizon 依赖改进。
AI 根据报道生成 · 46 分钟前更新
最新进展10月9日 12:00
对抗性 MDP 策略优化中的 horizon 差距被补齐报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.LG对抗性 MDP 策略优化中的 horizon 差距被补齐
研究者针对带对抗性损失和 bandit 反馈的在线回合制表格 MDP,用正则化 Q 函数实现策略优化,将已知转移下的遗憾界改进为 Õ(√HS(H+A)T)、未知转移下为 Õ(HS√AT),消除了既有策略优化界相对占用度量算法多出的 H 因子,后者已匹配已知最优界。该方法还扩展到对抗性线性混合 MDP 并取得相同的 horizon 依赖改进。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。