跳到正文
热点事件持续更新

VAN-Flow离线强化学习框架提出

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Guhyeon Kang 与 Minhae Kwon 提出 VAN-Flow——一种面向生成式离线强化学习、旨在促进可靠动作选择的框架,由类别分布式评论家、方差规避期望算子和流匹配生成演员三部分构成。 据作者称,该框架在 D4RL 和 OGBench 的 40 多个任务上持续超越强基线,长时程与高方差场景增益最大。其期望算子对类别回报分布的概率质量做平滑重加权,偏好高回报且低离散度的动作,无需硬截断或辅助惩罚项。论文已被 NeurIPS 2026 接收。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    VAN-Flow:面向稀疏长时程环境的方差规避 n 步离线强化学习

    VAN-Flow 是一个面向生成式离线强化学习的框架,通过类别分布式评论家、方差规避期望算子和流匹配生成演员三部分,在 D4RL 和 OGBench 的 40 多个任务上持续超越强基线,长时程与高方差场景增益最大。该期望算子对类别回报分布的概率质量进行平滑重加权,偏好高回报且低离散度的动作,无需硬截断或辅助惩罚项。论文已被 NeurIPS 2026 接收。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。