ActionCodec动作分词器:无机器人预训练VLA刷新SOTA
热点事件持续更新
ActionCodec动作分词器:无机器人预训练VLA刷新SOTA
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Zibin Dong等作者提出动作分词器 ActionCodec,并给出面向 VLA 优化的设计原则:最大化时间 token 重叠、最小化词表冗余、增强多模态互信息与 token 独立性。 作者称,在 LIBERO 上,经 ActionCodec 微调的 SmolVLM2-2.2B 在完全不做机器人预训练的情况下达到 95.5% 成功率;加入架构增强后升至 97.4%,为无机器人预训练 VLA 模型的新 SOTA。该结果目前来自论文自述。 作者还称,该分词器在多项仿真与真实世界基准上同时提升了训练效率和 VLA 性能。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
ActionCodec:什么造就了好的动作 tokenizer报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AIActionCodec:什么造就了好的动作 tokenizer
论文提出 ActionCodec 动作 tokenizer,从 VLA 优化视角给出设计原则:最大化时间 token 重叠、最小化词表冗余、增强多模态互信息与 token 独立性。在 LIBERO 上,经 ActionCodec 微调的 SmolVLM2-2.2B 无需机器人预训练即达 95.5% 成功率,架构增强后升至 97.4%,创下无机器人预训练 VLA 模型的新 SOTA。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。