跳到正文
热点事件持续更新

新算法求解松弛随机控制并证明收敛

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Qi Feng 与 Gu Wang 提出一种连续策略-价值迭代算法,用 Langevin 型动力学同时更新随机控制问题的价值函数近似与最优控制。该算法针对无限时域、熵正则化的松弛控制问题,在哈密顿量单调性条件下证明了策略改进与收敛到最优控制。 数值实验覆盖非凹奖励的 LQ 模型,以及最优控制服从偏斜拉普拉斯分布的非 LQ 示例。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    面向松弛随机控制问题的连续策略与价值迭代算法及其收敛性

    研究者提出一种连续策略-价值迭代算法,通过 Langevin 型动力学同时更新随机控制问题的价值函数近似与最优控制。该工作针对无限时域、熵正则化的松弛控制问题,在哈密顿量单调性条件下证明了策略改进与收敛到最优控制。数值实验涵盖非凹奖励的 LQ 模型和一个最优控制服从偏斜拉普拉斯分布的非 LQ 示例。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。