OpenRouter 发布 Ori Eval:为你的应用找到最合适的模型
OpenRouter 发布 Ori Eval,帮助开发者在超过 500 个可选模型中为自己的应用选出最合适的模型。它会扫描代码库中所有调用模型的位置,通过访谈确认用户关心的成本、速度、准确率等指标,选出 5 个候选模型并行运行评测,并生成 *.eval.ts 评测文件,用 bun test 运行,检查智能体调用的工具、避免的工具和开放式回答质量(由 LLM judge 评分)。
推荐理由:原文说明了 Ori Eval 如何在用户自己的代码和提示词上运行评测,并支持 CI 阻断回归和新模型自动对比。