统一性能与安全的Bellman算子提出
热点事件持续更新
统一性能与安全的Bellman算子提出
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Nishanth Arun Rao等研究者提出一种统一性能与安全目标的Bellman算子,将二者整合进联合价值函数,并在双时间尺度随机逼近框架下证明了时序差分学习的收敛性。 该框架在快时间尺度估计学习策略的安全价值,慢时间尺度估计联合价值。研究者称,收敛后的最优策略在最大化任务回报的同时始终保持安全;连续控制任务的神经逼近实验显示收敛稳定,测试时安全违规接近零。
AI 根据报道生成 · 43 分钟前更新
最新进展10月9日 12:00
面向安全关键强化学习的统一 Bellman 算子报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.LG面向安全关键强化学习的统一 Bellman 算子
研究者提出一种统一性能与安全目标的 Bellman 算子,将二者整合进联合价值函数,并在双时间尺度随机逼近框架下证明了时序差分学习的收敛性。该框架在快时间尺度估计学习策略的安全价值、慢时间尺度估计联合价值,收敛后的最优策略在最大化任务回报的同时始终保持安全。连续控制任务的神经逼近实验显示其收敛稳定,测试时安全违规接近零。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。