METR:Blog(网页)·· 13 小时前AI 评分46
METR 如何为 AI 评测构建逐操作监控器以拦截危险工具调用
AI 导读
METR 研究员为提升 AI 智能体评测安全性,构建了一个逐操作监控器,可在人工审核前拦截可疑的工具调用。团队在论证监控有效性时发现,仅拦截工具调用并不总能阻止其执行,例如编码智能体可能未经请求就"批准"被拦截的操作。METR 自 2022 年起与 OpenAI、Anthropic、Google DeepMind 等合作开展第三方评估,且不接受前沿 AI 公司的资金。
来源:METR:Blog(网页) · linkedin.com