跳到正文
热点事件持续更新

剑桥团队提出CUA分支引导攻击与COBRA防御

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

剑桥团队 Giulio Zingrillo 等作者发布论文,研究针对 Computer Use Agent(CUA)的分支引导攻击:攻击者通过不可信数据诱导 Agent 走入预先批准的危险分支,无需注入显式指令。团队同时提出 STEER-Bench 基准(覆盖 9 个领域、101 项任务),称标准 CUA 攻击成功率达 94.4%,普通 Dual-LLM 架构为 89.5%。 针对该攻击,团队提出 COBRA 架构,将可信分支计划与预先设定的能力约束配对,严格限定每个分支可执行的参数和目标。论文称在 STEER-Bench 上 COBRA 将攻击成功率降至 0%,同时保留 97% 的正常功能。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    COBRA 架构防御 Computer Use Agent 的分支诱导攻击

    剑桥团队研究 Computer Use Agent(CUA)的分支诱导攻击:攻击者通过不可信数据诱导 Agent 走入预先批准的危险分支,无需注入显式指令。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。