跳到正文
原文
Berkeley RDI:Blog(AI 安全与评测)·· 12 小时前精选AI 评分74

Berkeley RDI:一个自动化 Agent 攻破了 8 个主流 AI Agent 基准

How We Broke Top AI Agent Benchmarks: And What Comes Next April 08, 2026

AI 导读

Berkeley RDI 用自动化扫描 Agent 审计 SWE-bench、WebArena、OSWorld、GAIA、Terminal-Bench、FieldWorkArena。

推荐理由

原文用可运行的漏洞利用说明主流 Agent 基准为何能被零能力刷分,并给出可复用的评测加固清单。

来源:Berkeley RDI:Blog(AI 安全与评测) · rdi.berkeley.edu