跳到正文
原文
Sierra:Blog(RSS)· Ben Shi, Keshav Dhandhania·· 22 天前AI 评分53

Sierra 开源 hyper-𝜏-bench 基准,评测模型构建智能体的能力

Hyper-𝜏-bench: Evaluating agents that build agents

AI 导读

Sierra 发布并开源 hyper-𝜏-bench(论文名 𝜏^𝜏-bench),一个衡量模型自主构建客服智能体能力的长程评测。最佳配置 Claude Opus 5(max reasoning)在 Claude Code 中独立通过 23.9% 的保留评测任务,与深度上下文的工程师协作时达 82.2%。

来源:Sierra:Blog(RSS) · sierra.ai