OpenRouter 推出 Exacto 端点,按工具调用准确率筛选供应商路由
Provider Variance: Introducing Exacto
OpenRouter 发布 exacto 端点,将请求路由到工具调用准确率更高的供应商子集,首批覆盖 Kimi K2、DeepSeek v3.1 Terminus、GLM 4.6、GPT-OSS 120b、Qwen3 Coder 五个模型,用法为 model_slug:exacto。
OpenRouter 基于自家的工具调用遥测和用户偏好数据推出 Exacto 端点,并公开了不同供应商间质量差异的实测依据。
今天,我们推出了一组新的端点——exacto——它们专注于通过路由到一组可测量地具有更高工具使用成功率的提供商,来提供更高的工具调用准确性(文档)。
关于 LLM 提供商的准确性,一直有很多猜测;不同提供商在运行同一模型时是否表现相同。理论上,当然,相同的模型权重(具有相同的量化)应该产生相同的结果。但在实践中,将模型实现为生产级推理是复杂而微妙的,差异就会出现。
OpenRouter 每月看到来自世界各地的数十亿次请求,因此拥有独特的视角来观察这些差异,准确确定发生了什么,并为我们的用户提供高质量且无意外的体验。
提供商生态系统
在 OpenRouter,我们与提供商有着长期、稳定的合作关系。我们定期与他们交流,在 Slack 频道中交谈,拜访他们的办公室,并定期分享反馈。这些都是积极、亲身实践、真实世界的关系。
我们不相信我们的任何提供商曾经故意损害模型质量。他们是否努力降低成本?绝对如此。他们是否深入研究 VLLM 和 SGLang 以榨取性能?是的。我们偶尔也看到在调整推理堆栈时质量下降。但我们所有的提供商都非常重视质量。当我们报告问题时,我们会得到高水平的参与,来自聪明、专注的专业人士。我们的激励是一致的:我们是一个中立的平台,致力于为推理消费者提供最佳体验,我们的提供商也是如此。
话虽如此,大规模运行推理是困难的,有些模型比其他模型更难托管,错误也会发生。我们看到行业专家的报告,查看我们自己的数据,并听到我们自己的客户关于提供商输出质量定性差异的轶事:很明显,我们需要做更多工作来确保 OpenRouter 上的最佳体验。
基准测试
Artificial Analysis 在 gpt-oss-120b 发布后不久发布了一套很棒的基准测试,显示提供商在特定基准上存在显著差异:
性能差异显著。但重要的是,这个模型于 2025 年 8 月 5 日发布,而 Artificial Analysis 的这些数据来自 8 月 11 日。我们 firsthand 知道提供商需要一些时间来‘磨合’模型,并让它在他们的硬件和推理堆栈上真正顺畅运行。我们已经看到过很多次;对于像 R1、Kimi K2 这样的模型——随着提供商完善他们的推理引擎,性能会提高。我们的直觉是这种差距会缩小,事实上截至 2025 年 9 月,我们有这个:
差距已经大幅收紧,OpenRouter 上可用的大多数提供商具有相似的基准性能。
我们与 Artificial Analysis 合作,对 Deepseek 3.1 进行基准测试——这是一个已经发布数月的模型。我们再次看到一个紧密的性能带:
值得注意的是,即使是 Deepinfra,这是唯一将模型量化为 fp4 的提供商,也相当有竞争力。
展望未来,我们将致力于:
- 在新开放权重模型可用后不久对提供商进行基准测试
- 与提供商(私下)分享结果
- 将任何超出可接受范围的提供商从轮换中移除
- 在性能问题解决后将其重新加入
工具调用数据
2025 年 8 月,我们开始推出额外的质量遥测数据,重点关注工具调用和结构化输出。具体来说,对于整个 OpenRouter 上每一个 tool_call 响应,我们都会检查三种可能的失败模式:
- LLM 返回的
tool_call是有效的 json 吗? tool_call中的工具名称是否存在于原始工具输入中?tool_call的 schema 是否与所提供工具的 schema 匹配?
这使我们能够针对同一模型比较不同提供商之间的工具调用准确率和工具调用倾向。由于某些提供商的使用方式可能存在偏差,我们对大客户进行降采样,比较同一应用在不同提供商之间的准确率,并检查 schema 复杂度是否可比。总体而言,我们已测量了数十亿次 LLM 工具调用的准确率。
例如,以下是排名前 5 的 DeepSeek Terminus 提供商的工具调用准确率(都相当不错!)。
此外,在输入中提供了工具的前提下,我们测量模型和提供商请求工具的频繁程度。我们目前不发布完整数据集,因为我们希望先与提供商合作,更好地理解差异的来源,但以下是 Kimi K2 提供商样本中工具调用倾向差异的一个示例。这与 Moonshot 发布的内容类似——但基于真实使用情况,而非基准测试。
虽然我们在此只分享了部分数据,但完整数据集清楚地表明,LLM 使用工具的倾向以及这些工具调用的准确率在不同提供商之间的差异,远比标准基准测试所显示的更为显著。
实时用户偏好
除了测量得到的工具调用数据外,我们还可以获取另一个数据来源:提供商偏好。
OpenRouter 支持忽略提供商,我们可以将其解读为对该提供商未满足该客户需求的一种投票。
curl https://openrouter.ai/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-d '{
"model": "meta-llama/llama-3.3-70b-instruct",
"messages": [
{"role": "user", "content": "What is the capital of France?"}
],
"provider": {
"ignore": ["omega"]
}
}'总体而言,我们针对每个模型都有数千条提供商偏好,我们还可以进一步将其限定为提供了工具的 LLM 生成。这是一个强有力的指标,可以说明哪些提供商表现良好、哪些表现不佳。
推出 Exacto
利用我们的工具调用数据、客户提供商偏好数据,以及在 Groq OpenBench 上运行的工具调用基准测试,我们创建了新的、精心策划的端点,专门聚焦于工具调用准确率。这些端点今天已经可用,我们将其称为 exacto。
我们首先为以下模型推出 exacto 端点
- Kimi K2(
moonshotai/kimi-k2-0905:exacto) - DeepSeek v3.1 Terminus(
deepseek/deepseek-v3.1-terminus:exacto) - GLM 4.6(
z-ai/glm-4.6:exacto) - GPT-OSS 120b(
openai/gpt-oss-120b:exacto) - Qwen3 Coder(
qwen/qwen3-coder:exacto)
你可以通过 model_slug:exacto. 使用这些新端点。例如:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-d '{
"model": "moonshotai/kimi-k2:exacto",
"messages": [
{"role": "user", "content": "What is the capital of France?"}
]
}'你将被路由到满足以下所有条件的提供商之一:
- 在工具调用准确率方面是顶级提供商
- 处于工具调用倾向的正常范围内
- 在进行工具调用时,不会被 OpenRouter 用户频繁忽略或列入黑名单
运行我们的内部工具调用评估套件,以及像 tau2-Bench 和 LiveMCPBench 这样的开源基准测试,我们观察到工具调用失败的发生频率明显降低,并且模型更可靠地利用提供给它的工具。基准测试(在此示例中,针对 Kimi K2 0905)显示,通过 exacto 进行工具调用的成功率有实质性提升:
我们预计这些端点将在许多智能体工作流中广受欢迎,并预期将与目前未纳入 Exacto 路由池的提供商合作,帮助他们改进并最终达到纳入标准。请注意,exacto 端点专门聚焦于工具调用,不应被视为对端点或提供商质量的更广泛评价。
最后,我们正在努力公开更多数据;预计在今年年底前会公开部分底层数据,以帮助用户做出更明智的决策。由于这些是新发现,我们希望在发布完整数据集之前,给某些提供商改进的机会(或对我们的方法论提出反馈)。
结语
虽然我们希望一些疑问已得到解答,但我们也预计这项分析会引发更多问题。我们期待听到反馈,并预计会有大量后续讨论。请通过 X 或 Discord 联系我们参与讨论。如果您对 exacto 下的某个提供商有具体反馈,请填写此表单
我们希望用户觉得 Exacto 端点有帮助,并期待分享更多数据(包括基准数据和实证数据),并在今年剩余时间内将其构建到我们的产品中。
来源:OpenRouter:Announcements(RSS) · openrouter.ai