跳到正文
热点事件持续更新

提出带风险控制的策略更新调度方法

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Wenbin Zhou 等作者提交论文,提出一种离线元策略方法,在训练未来候选模型之前规划策略更新时机,以在提升收益与控制性能退化风险之间取得平衡。方法把更新计划建模为有向无环图中的路径,并用动态规划在“更新次数劣于被替换策略”的期望预算约束下最大化期望累积价值,切换的价值与风险从历史学习轨迹估计。 作者称,一阶分析表明策略改进的信噪比是决定更新频率、等待时间与风险分配的关键因素;在合成数据与临床试验数据上的实验展示了性能与风险之间的权衡,并与基线方法进行了对比。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    Safe Meta-Policy Design with Risk Control:带风险控制的策略更新调度方法

    研究提出一种离线元策略方法,在训练未来候选模型之前规划策略更新时机,在提升收益与控制性能退化风险之间取得平衡。方法将更新计划建模为有向无环图中的路径,并用动态规划在"更新次数劣于被替换策略"的期望预算约束下最大化期望累积价值,从历史学习轨迹估计切换的价值与风险。一阶分析表明策略改进的信噪比是决定更新频率、等待时间与风险分配的关键因素,合成数据与临床试验数据实验展示了性能—风险权衡并对比了基线方法。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。