跳到正文

#安全/对齐

今日 67 条
6月19日周五
  1. OpenAI:Alignment 研究博客(RSS)53

    OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化

    OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。

6月17日周三
6月16日周二
  1. Google DeepMind:Blog(RSS)65

    Google DeepMind 发布 AI Control Roadmap 框架,防御可能未对齐的内部 AI 智能体

    Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。

    推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。

6月15日周一
6月11日周四
6月8日周一
6月1日周一
5月28日周四
  1. Google Research43

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。

5月18日周一
5月17日周日
  1. Dwarkesh Patel:Podcast & Blog(RSS)48

    Dwarkesh Patel:将智能与权力混为一谈的错误

    Dwarkesh Patel 指出,把智能定义为"跨领域达成目标的能力"实际上等同于把智能等同于权力,按此定义斯大林将是史上最智能的人。他认为当前 AI 通过训练在编程等具体经济任务上变强,与获取权力并非强相关,现实中的权力更多来自权威与信任带来的大规模协作,而非个体谋略。他判断未来是自动化公司以正常资本主义方式胜过其他竞争者,而非单一 AI 在智力上碾压所有人。

5月7日周四
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 调查 RL 训练中意外评分 CoT 的后果

    OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。

5月4日周一
5月1日周五
4月30日周四
  1. Together AI 研究与产品博客(RSS)61

    Together AI 复盘处置 Linux 内核漏洞 Copy Fail(CVE-2026-31431)的生产应急响应

    Together AI 在生产环境中处置了 Linux 内核 crypto 子系统漏洞 Copy Fail(CVE-2026-31431),该漏洞位于 algif_aead AF_ALG 接口,允许任意非特权本地用户向系统上任意可读文件的 page cache 做精确 4 字节写入,且不改变磁盘文件、不标记脏页,可绕过传统文件完整性检查并借此提权到 root。

4月24日周五
4月23日周四
4月18日周六
4月11日周六
  1. Sam Altman:Blog(RSS)65

    Sam Altman 发文回应住宅遭燃烧瓶袭击,谈 AI 信念与行业反思

    Sam Altman 发文称前夜凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他公开家庭照片希望劝阻下次袭击。文章阐述他对 AI 的信念,包括 AI 需民主化、权力不应过度集中于少数 AI 实验室、需要全社会层面的安全应对;回顾在 OpenAI 十年中的失误与对与 Elon 诉讼前拒绝其单方控制权的坚持,并称业内戏剧化冲突源于'看见 AGI 后无法忽视'的掌控欲,呼吁降降温、在民主程序内辩论。

4月8日周三
  1. Dario Amodei50

    Dario Amodei 表示众多全球领先公司已加入 Project Glasswing,直面能力日益增强的 AI 系统带来的网络威胁。该倡议由 Anthropic 发起,其引用的官方推文称项目由最新前沿模型 Claude Mythos Preview 驱动,称其查找软件漏洞的能力超过绝大多数人类专家,详情见 https://anthropic.com/glasswing。

    引用Anthropic@AnthropicAI

    Introducing Project Glasswing: an urgent initiative to help secure the world’s most critical software. It’s powered by our newest frontier model, Claude Mythos Preview, which can find software vulnerabilities better than all but the most skilled humans. https://anthropic.com/glasswing

4月6日周一
  1. OpenAI:Alignment 研究博客(RSS)41

    OpenAI 推出 Safety Fellowship,资助外部独立安全与对齐研究

    OpenAI 开放 Safety Fellowship 申请,面向外部研究者、工程师和从业者,资助其开展高级 AI 系统安全与对齐研究。项目周期为 2026 年 9 月 14 日至 2027 年 2 月 5 日,优先方向包括安全评估、伦理、鲁棒性、可扩展缓解措施、隐私保护安全方法、智能体监督和高危滥用领域。

4月3日周五
3月28日周六
3月26日周四
3月22日周日
3月17日周二
3月13日周五
  1. BAIR:Berkeley AI Research Blog34

    伯克利提出 SPEX 与 ProxySPEX:大规模识别 LLM 特征交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。

3月12日周四
3月2日周一
  1. Answer.AI 官方研发博客(RSS)69

    Answer.AI 创始人分析 OpenAI 与战争部合同的"合法用途"条款为何难以冻结法律

    Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。

    推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。

2月28日周六
2月18日周三
  1. Answer.AI 官方研发博客(RSS)70

    Answer.AI 发现未经授权的工具调用问题:模型可幻觉调用未授予的工具且 API 不拦截

    Answer.AI 的 Piotr Czapla 报告,Claude Opus 4.6、Sonnet 4.5、Haiku 4.5 会幻觉调用未被授予的工具(如 read_secret、GitHub MCP 的 get_me),且 API 不拦截;在 Gemini、Grok 上也能复现类似行为。

    推荐理由:作者实测多家模型会调用未授权工具且 API 不拦截,指出这会瓦解能力分离防御,并给出客户端校验的简单修复。

2月11日周三
2月7日周六
2月5日周四
1月27日周二
1月15日周四
  1. OpenAI:Alignment 研究博客(RSS)50

    OpenAI 发布 CoVal:从众包中学习价值观感知评分标准

    OpenAI 发布实验性数据集 CoVal,将价值观敏感的提示词与众包撰写的可审计评分标准配对,记录人们偏好某个模型回复的具体理由而非仅选择结果。CoVal 含保留多元甚至冲突标准的 CoVal-full 和每提示词保留 4 条高评分兼容标准的 CoVal-core 两种形式,其评分可预测样本外人类排名,并揭示 GPT-5 系列模型的行为差异。

1月13日周二
  1. OpenAI:Alignment 研究博客(RSS)47

    OpenAI 为何看好"confessions":让模型自我坦白以提升诚实性

    OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。

12月31日周三