跳到正文
热点事件持续更新

arXiv 论文提出用随机基线衡量 ProcGen 泛化差距

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

arXiv 论文作者 Abhisek Keshari 提出,强化学习的泛化差距应参照随机策略在同一评测环境下的随机基线来解读。在 8 个 ProcGen 环境用 PPO 以 8M 步预算训练时,miner 中采样策略在留出关卡得分为基线的 5.1 倍,而 argmax 策略每次运行都低于基线。 作者审计 12 个 ProcGen 代码库发现,其中 9 个在评测时采样动作却未显式声明这一选择。作者建议报告差距时说明动作规则、随机种子,并给出两个关卡集上的基线。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    ProcGen 泛化差距衡量的是什么?动作规则、残余熵与缺失的随机基线

    研究指出强化学习的泛化差距应参照随机策略在同一评测环境下的随机基线来解读。在 8 个 ProcGen 环境用 PPO 以 8M 步预算训练时,miner 中采样策略在留出关卡得分为基线的 5.1 倍,而 argmax 策略每次运行都低于基线。审计 12 个 ProcGen 代码库发现 9 个在评测时采样动作却未显式声明选择,作者建议报告差距时说明动作规则、随机种子并给出两个关卡集上的基线。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。