新论文用CVaR衡量安全RL尾部成本
热点事件持续更新
新论文用CVaR衡量安全RL尾部成本
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Samuel Tetteh 和 Cody Fleming 提交论文,提出用 CVaR_0.1(最差 10% 情景的平均成本)衡量安全强化学习中的情景成本尾部,并在三个 Safety-Gymnasium 导航任务上评估五种标准算法,识别出平均安全但尾部不安全的策略。 两人随后在密集危险导航中考察四类约束,并在四个导航与四个运动任务上评估尾部控制能否在保持回报的同时实现。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
平均安全、尾部不安全:情景成本尾部何时可控?报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LG平均安全、尾部不安全:情景成本尾部何时可控?
安全强化学习通常只约束期望情景成本,而忽略成本在情景间的分布,导致策略可能平均安全却仍存在不安全的最坏情景。该研究用 CVaR_0.1(最差 10% 情景的平均成本)衡量情景成本尾部,并在三个 Safety-Gymnasium 导航任务上评估五种标准算法,识别出平均安全但尾部不安全的策略。随后在密集危险导航中考察四类约束,并在四个导航与四个运动任务上评估尾部控制能否在保持回报的同时实现。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。