AI as Normal Technology(RSS)· Sayash Kapoor·· 2026-02-24AI 评分67
Towards a Science of AI Agent Reliability:新论文提出智能体可靠性测量框架
New Paper: Towards a science of AI agent reliability
AI 导读
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
来源:AI as Normal Technology(RSS) · normaltech.ai