跳到正文
热点事件持续更新

交错投影梯度下降用于安全模仿学习

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者 Shengfan Cao 与 Francesco Borrelli 提出一种面向状态与输入约束下神经网络控制策略的模仿学习方案:训练时在标准模仿梯度步之间交替执行 k 步安全步骤,将网络动作拉向其安全集投影,运行时仅使用训练好的网络,无需安全滤波器。 在非线性自动驾驶赛车任务中,该方法将违规回合占比从 15% 降至 1%,约为最优权重惩罚方法违规率的六分之一,圈速与无约束模仿相当,代价是额外训练计算量。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    交错投影梯度下降:安全模仿学习的新方法

    研究者提出一种面向状态与输入约束下神经网络控制策略的模仿学习方案,训练时在标准模仿梯度步之间交替进行 k 步安全步骤,将网络动作拉向其安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法将违规回合占比从 15% 降至 1%,约为最优权重惩罚方法违规率的六分之一,圈速与无约束模仿相当,但代价是额外训练计算量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。