跳到正文
热点事件持续更新

DriftOPD:一步式 VLA 策略序列级蒸馏框架

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年10月3日,arXiv cs.LG 分类发布论文提出 DriftOPD,一个面向一步式 VLA 策略的序列级反向 KL 蒸馏框架。该方法无需教师模型、无需 rollout,用于对连续 VLA 动作专家进行序列级 on-policy 蒸馏。其核心是将序列级反向 KL 散度分解为 chunk 级反向 KL 项与未来势能项,分别用一步式 drifting 目标和从离线演示学习的 Q 函数 critic 优化。据该报道,仅靠离线数据和一步动作生成即可实现序列级优化。目前事件仅有这一篇报道,尚无后续进展或不同说法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. arXiv:cs.LG(机器学习,全量分类)
    DriftOPD:面向一步式 VLA 策略的序列级反向 KL 蒸馏

    DriftOPD 是一个无需教师模型、无需 rollout 的框架,用于对连续 VLA 动作专家进行序列级 on-policy 蒸馏。该方法将序列级反向 KL 散度分解为 chunk 级反向 KL 项与未来势能项,分别用一步式 drifting 目标和从离线演示学习的 Q 函数 critic 优化,仅靠离线数据和一步动作生成即可实现序列级优化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。