跳到正文
热点事件持续更新

统一性能与安全的Bellman算子提出

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Nishanth Arun Rao等研究者提出一种统一性能与安全目标的Bellman算子,将二者整合进联合价值函数,并在双时间尺度随机逼近框架下证明了时序差分学习的收敛性。 该框架在快时间尺度估计学习策略的安全价值,慢时间尺度估计联合价值。研究者称,收敛后的最优策略在最大化任务回报的同时始终保持安全;连续控制任务的神经逼近实验显示收敛稳定,测试时安全违规接近零。

AI 根据报道生成 · 43 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.LG
    面向安全关键强化学习的统一 Bellman 算子

    研究者提出一种统一性能与安全目标的 Bellman 算子,将二者整合进联合价值函数,并在双时间尺度随机逼近框架下证明了时序差分学习的收敛性。该框架在快时间尺度估计学习策略的安全价值、慢时间尺度估计联合价值,收敛后的最优策略在最大化任务回报的同时始终保持安全。连续控制任务的神经逼近实验显示其收敛稳定,测试时安全违规接近零。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。