Sierra:Blog(RSS)· Ben Shi, Keshav Dhandhania·· 22 天前AI 评分53
Sierra 开源 hyper-𝜏-bench 基准,评测模型构建智能体的能力
Hyper-𝜏-bench: Evaluating agents that build agents
AI 导读
Sierra 发布并开源 hyper-𝜏-bench(论文名 𝜏^𝜏-bench),一个衡量模型自主构建客服智能体能力的长程评测。最佳配置 Claude Opus 5(max reasoning)在 Claude Code 中独立通过 23.9% 的保留评测任务,与深度上下文的工程师协作时达 82.2%。
来源:Sierra:Blog(RSS) · sierra.ai