跳到正文
原文
vLLM 官方博客(RSS)· RL-Kernel Team, vime Team, and AMD Team·· 17 天前AI 评分46

vime × RL-Kernel × AMD:在 ROCm 上实现训练与 Rollout 的逐位一致性

vime × RL-Kernel × AMD: Bitwise Train–Rollout Consistency on ROCm

AI 导读

vime 联合 RL-Kernel 在 AMD Instinct MI300X 上实现训练与 rollout 的逐位数值一致性,8× MI300X 跑 Qwen3-8B GRPO 实验连续 200 步 mismatch_count = 0、max_abs_diff = 0。

来源:vLLM 官方博客(RSS) · vllm.ai