跳到正文
热点事件持续更新

Miles RL框架新增AMD ROCm支持

2 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年9月30日,LMSYS 旗下 Chatbot Arena 团队发布博客称,Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。报道指出,Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器;团队在单节点 8 卡 MI300X 上用 GRPO 训练了 Qwen3-30B-A3B。同日后续报道进一步称,DeepSeek-V4 Flash 的 RL 训练已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 获得支持,并完成四节点端到端验证。目前进展为官方确认 Miles 对 AMD Instinct GPU 的原生支持,并给出 Qwen3-30B-A3B 单节点训练与 DeepSeek-V4 Flash 四节点验证两项实例。

AI 根据报道生成 · 11 小时前更新

事件进展

2 个进展
  1. 9月30日 23:28 · 1 篇报道
    Miles RL框架支持AMD ROCm平台
    LMSYS:Blog(Chatbot Arena 团队):AMD Instinct GPU 迎来 Miles 强化学习框架 ROCm 支持
  2. 9月30日 23:28 · 1 篇报道
    Miles支持在AMD MI355X上训练DeepSeek-V4 Flash RL
    LMSYS:Blog(Chatbot Arena 团队):DeepSeek-V4 Flash RL 训练在 AMD Instinct MI355X GPU 上通过 Miles 获得支持

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. LMSYS:Blog(Chatbot Arena 团队)
    AMD Instinct GPU 迎来 Miles 强化学习框架 ROCm 支持

    Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。在单节点 8 卡 MI300X 上,团队用 GRPO 训练了 Qwen3-30B-A3B。

  2. LMSYS:Blog(Chatbot Arena 团队)
    DeepSeek-V4 Flash RL 训练在 AMD Instinct MI355X GPU 上通过 Miles 获得支持

    DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 支持,完成四节点端到端验证。

本事件热度走势

当前热度 7·可比范围峰值 10(10月1日 01:00)·近 24 小时可比范围变化 –

02.557.51010月1日01:0010月1日04:0010月1日08:0010月1日11:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。