提出带风险控制的策略更新调度方法
热点事件持续更新
提出带风险控制的策略更新调度方法
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
Wenbin Zhou 等作者提交论文,提出一种离线元策略方法,在训练未来候选模型之前规划策略更新时机,以在提升收益与控制性能退化风险之间取得平衡。方法把更新计划建模为有向无环图中的路径,并用动态规划在“更新次数劣于被替换策略”的期望预算约束下最大化期望累积价值,切换的价值与风险从历史学习轨迹估计。 作者称,一阶分析表明策略改进的信噪比是决定更新频率、等待时间与风险分配的关键因素;在合成数据与临床试验数据上的实验展示了性能与风险之间的权衡,并与基线方法进行了对比。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
Safe Meta-Policy Design with Risk Control:带风险控制的策略更新调度方法报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.LGSafe Meta-Policy Design with Risk Control:带风险控制的策略更新调度方法
研究提出一种离线元策略方法,在训练未来候选模型之前规划策略更新时机,在提升收益与控制性能退化风险之间取得平衡。方法将更新计划建模为有向无环图中的路径,并用动态规划在"更新次数劣于被替换策略"的期望预算约束下最大化期望累积价值,从历史学习轨迹估计切换的价值与风险。一阶分析表明策略改进的信噪比是决定更新频率、等待时间与风险分配的关键因素,合成数据与临床试验数据实验展示了性能—风险权衡并对比了基线方法。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。