跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 81–90 条 · 共 90 条
5月7日周四
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 调查 RL 训练中意外评分 CoT 的后果

    OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。

5月4日周一
5月1日周五
3月2日周一
  1. Answer.AI 官方研发博客(RSS)69

    Answer.AI 创始人分析 OpenAI 与战争部合同的"合法用途"条款为何难以冻结法律

    Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。

    推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。

2月18日周三
  1. Answer.AI 官方研发博客(RSS)70

    Answer.AI 发现未经授权的工具调用问题:模型可幻觉调用未授予的工具且 API 不拦截

    Answer.AI 的 Piotr Czapla 报告,Claude Opus 4.6、Sonnet 4.5、Haiku 4.5 会幻觉调用未被授予的工具(如 read_secret、GitHub MCP 的 get_me),且 API 不拦截;在 Gemini、Grok 上也能复现类似行为。

    推荐理由:作者实测多家模型会调用未授权工具且 API 不拦截,指出这会瓦解能力分离防御,并给出客户端校验的简单修复。

12月2日周二
10月28日周二
  1. Johann Rehberger / Embrace The Red(RSS)78

    Claude Pirate:利用 Anthropic File API 实现数据外泄的攻击链分析

    安全研究员 Johann Rehberger 发布对 Claude Code Interpreter 网络访问功能的数据外泄攻击分析。攻击者通过间接提示词注入让 Claude 抓取用户数据(如最近的聊天记录)写入 sandbox 文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API,将最多 30MB 的文件上传到攻击者账户。

    推荐理由:作者独立复现了利用默认网络白名单中 api.anthropic.com 和攻击者 API key 的数据外泄链,并给出缓解建议。

8月20日周三
  1. Johann Rehberger / Embrace The Red(RSS)79

    Amazon Q Developer VS Code 扩展存在提示词注入导致远程代码执行漏洞

    安全研究者 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在间接提示词注入漏洞:executeBash 将 find 归类为 readonly 并跳过人工确认。

    推荐理由:作者亲测复现了 Amazon Q Developer 的间接提示词注入到任意命令执行路径,读者可借此理解 Agent 权限模型的风险。

8月19日周二
  1. Johann Rehberger / Embrace The Red(RSS)77

    Amazon Q Developer 提示词注入可经 DNS 请求泄露开发者密钥

    安全研究人员 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在高危漏洞:处理不可信数据时可被提示词注入劫持,通过 ping 等 readOnly 命令将开发者 .env 文件内容经 DNS 请求外泄。

    推荐理由:作者第一手复现了 Amazon Q Developer 通过 DNS 请求泄露 .env 密钥的提示词注入漏洞,并披露 AWS 已静默修复但未发公告或 CVE。

8月13日周三
  1. Johann Rehberger / Embrace The Red(RSS)84

    GitHub Copilot 提示词注入可致远程代码执行(CVE-2025-53773)

    Johann Rehberger 披露 GitHub Copilot 的提示词注入漏洞 CVE-2025-53773:注入内容可让 Copilot 写入 .vscode/settings. 并添加 "chat.tools.autoApprove"。

    推荐理由:作者亲测复现了从提示词注入到本机代码执行的完整链条,并给出缓解建议,适合评估 Agent 自改配置的安全风险。