跳到正文
Hugging Face· @huggingface · X·· 6 天前精选AI 评分63
AI 导读

Hugging Face 团队与 @adithya_s_k 发布多 harness RL 完整指南,全部开源。

推荐理由

原文给出多 harness RL 的具体做法和完整开源资源,读者可以照此让同一个模型在多个 Agent 框架中同时提升。

正文 · AI 翻译

同一个模型,相同的权重,在一个 agent harness 中得分 62%,在另一个中只有 33%。

@adithya_s_k 和 @huggingface 团队刚刚发布了多 harness RL 的终极指南,这是今年最实用的 RL 文章之一,而且全部开源!

诀窍很简单。不要动 harness。把它指向一个代理,而不是模型。这个代理能说编码 agent 使用的全部四种 API 格式(OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini)。它记录 vLLM 采样出的精确 token id 和 logprobs,然后你在这些数据上训练。你不需要改动 Claude Code、Codex 或 OpenCode 的任何一行代码。

结果:
🔹 同时在 4 个 harness 上训练,@liquidai 的 LFM2.5-2.6B 从 42% 提升到 54%
🔹 工具调用减少了 31%,这得益于对用更少步骤完成任务的少量奖励
🔹 仅在 OpenCode 中训练就让 OpenCode 从 34% 提升到 58%,但多 harness 模型在所有方面都有提升

他们还尝试了所有人都会想到的捷径:在来自 Qwen3.8-27B 的 3,189 条成功 rollout 上做微调。模仿学习在 47.5% 就停滞了,低于两次 RL 运行。复制一个更大的模型并不能让你达到目标。练习才行。

最棒的是,一切都是开源的:OpenEnv 中的捕获代理、TRL 中的训练器、任务、SFT 数据、训练代码以及全部七个训练好的模型。
Agents 将在数十个 harness 中运行。

现在,任何人都可以为每一个 harness 训练开源模型。

在这里阅读 👇
https://huggingface.co/spaces/FineEnvs/multi-harness-rl

来源:Hugging Face · x.com