新算法求解松弛随机控制并证明收敛
热点事件持续更新
新算法求解松弛随机控制并证明收敛
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
Qi Feng 与 Gu Wang 提出一种连续策略-价值迭代算法,用 Langevin 型动力学同时更新随机控制问题的价值函数近似与最优控制。该算法针对无限时域、熵正则化的松弛控制问题,在哈密顿量单调性条件下证明了策略改进与收敛到最优控制。 数值实验覆盖非凹奖励的 LQ 模型,以及最优控制服从偏斜拉普拉斯分布的非 LQ 示例。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
面向松弛随机控制问题的连续策略与价值迭代算法及其收敛性报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LG面向松弛随机控制问题的连续策略与价值迭代算法及其收敛性
研究者提出一种连续策略-价值迭代算法,通过 Langevin 型动力学同时更新随机控制问题的价值函数近似与最优控制。该工作针对无限时域、熵正则化的松弛控制问题,在哈密顿量单调性条件下证明了策略改进与收敛到最优控制。数值实验涵盖非凹奖励的 LQ 模型和一个最优控制服从偏斜拉普拉斯分布的非 LQ 示例。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。