跳到正文
原文
AI as Normal Technology(RSS)· Sayash Kapoor·· 2026-02-24AI 评分67

Towards a Science of AI Agent Reliability:新论文提出智能体可靠性测量框架

New Paper: Towards a science of AI agent reliability

AI 导读

Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。

来源:AI as Normal Technology(RSS) · normaltech.ai