跳到正文

#安全/对齐

今日 4 条
9月8日周二
9月7日周一
  1. Mark Chen47

    同意 @JensenHuang 的观点:我们正在进入 AGI 时代。 AGI 时代也必须是对齐时代。我们需要教会 AI 热爱人类,并训练出与它们所监督的 AI 同样强大的 AI 监督者。 @merettm 在这篇深思熟虑、发人深省的文章中说得最好:https://openai.com/index/an-alien-mind

    引用Jensen Huang@JensenHuang

    @ChaseLochmiller @OpenAI GPT-6 Astra, trained on ~100K+ NVIDIA Grace Blackwell NVLink72. From ChatGPT to o1 to Astra in 4 years. AGI has arrived. Congratulations @OpenAI team. 400K GPUs coming online next.

9月6日周日
9月4日周五
  1. Mark Chen80

    OpenAI 首席研究官 Mark Chen 宣布 GPT-6 Astra 发布,称其汇集多年预训练、强化学习和后训练工作,是该团队迄今能力最强、对齐程度最高的模型。

    引用OpenAI@OpenAI

    This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.

    推荐理由:OpenAI 首席研究官亲自说明 GPT-6 Astra 的能力变化与对齐工作,可帮助读者了解官方对 Computer Use 和 Agent 监督的进展表述。

9月3日周四
  1. Google DeepMind:Blog(RSS)60

    Google DeepMind 推出 Fairwind Program,向政府与企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入对象,读者可据此判断前沿模型在漏洞修复环节的落地方式。

9月2日周三
  1. MIT News(RSS)49

    MIT 与 Motional 提出 CW-Net,帮人类预判自动驾驶汽车何时出错

    MIT 与自动驾驶公司 Motional 提出 Concept-Wrapper Network(CW-Net),将自动驾驶深度学习规划器的内部推理翻译为"接近停驶车辆""靠近骑行者"等可理解概念,且不改变原有驾驶性能。该模块用 1.3 亿个自动驾驶场景样本训练,在私人测试跑道的实车测试中帮助安全员更准确预判车辆行为,大规模模拟实验也得到类似结果,相关研究已发表于 Nature。

  2. Jakub Pachocki53

    OpenAI 首席科学家 Jakub Pachocki 发文,试图纠正错误报道引发的对不可监控性的竞速担忧,指出包括 Astra 在内的当前前沿模型计算图深度与 GPT-4 相差不到两倍。他表示 OpenAI 从最早的推理模型起就保留并利用链式思维监控,认为该技术脆弱且趋势向坏,但与架构变化无关的原因将另行撰文说明,强化该技术是其当前研究项目的核心目标。

8月27日周四
  1. Google DeepMind:Blog(RSS)54

    Google DeepMind 试点全球首个对前沿专有模型的双盲 AI 评估

    Google DeepMind 推出全球首个针对专有前沿模型的双盲评估,将外部评估限制在密码学安全的"盒子"中,防止模型提前接触测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用机密基准测试一个 Gemini Flash Lite 模型。

8月25日周二
8月21日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)40

    NVIDIA 谈安全在 AI 智能体栈中的位置

    NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。

8月18日周二
  1. Mark Chen29

    我们许多最强的研究员都选择专注于对齐,但我们也在招聘! 如果你想在一个认真对待对齐、不假装它已解决的前沿实验室工作,请申请。

    引用Micah Carroll@MicahCarroll

    These are incredibly misleading headlines – @OpenAI Preparedness is very much alive and well by any meaningful definition Our subteam – RSI/misalignment Preparedness – is doing more urgent work than ever, and has never been more empowered to do so!

8月14日周五
  1. Sierra:Blog(RSS)39

    Sierra 谈智能体时代的纵深防御:如何用 AI 守护 AI

    Sierra 提出在基于目标与护栏构建的智能体上沿用纵深防御原则,让每条客户消息在回复前经过内容、规则与政策、Supervisor 模型、确定性护栏等多层检查,单条消息可触发多达六项校验。Sierra 还通过第三方对抗评估与红队测试、平台级 Threat Detection 与单智能体 Agent Monitors 持续监控,并用 Simulations 在上线前压测护栏回归。

8月12日周三
  1. Meta Engineering Blog(RSS)56

    WhatsApp 推出端侧 Scam Alert 功能,在端到端加密下实现可验证的诈骗提醒

    WhatsApp 推出可选的 Scam Alert 功能,在设备端运行机器学习模型,对非联系人消息进行诈骗概率分类,消息内容不出设备、不自动上报。模型下载经 Cloudflare Ed25519 签名与第三方 append-only 透明账本校验,遥测数据经 TEE、OHTTP 与差分隐私聚合处理;该功能已在 Beta 有限推出,并扩展了 Bug Bounty 计划。

8月10日周一
  1. Karina46

    Agent warfare is going to be a very big deal. I think people are underestimating how strange cyber gets when millions of agents are acting on behalf of individuals, companies, and states. At nation-state scale, cyber offense and defense starts to look like autonomous swarms: probing, exploiting, patching, deceiving, countering, and adapting at a pace that is impossible for human minds. The advantage will go to whoever can close the autonomous kill chain fastest.

    引用Andrew Curran@AndrewCurran_

    A man in Australia asked his agent (Claude running on OpenClaw) to book him a spot in a popular gym class. The agent found a software vulnerability that let it book the class weeks further ahead than should have been possible. When the user then asked if it could move him up the waitlist, the agent discovered the API had no authorisation checks on cancelling other people’s reservations, so it cancelled the person in the first spot and moved him up the list. Some people will call this misalignment, but his agent was perfectly aligned to him - it was only trying to help its user get what he wanted. The most important thing about this story, in my opinion, is that it gives you a window into what is about to start happening on a massive scale once millions of people have an agent trying to get their beloved users the best seats, bookings, appointments or reservations through absolutely any means necessary.

8月4日周二
  1. Mistral AI:News(网页)62

    Mistral 发布 3B 开源多模态安全分类器 Shieldstral,Apache 2.0 开放权重

    Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。

    推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。

8月1日周六
  1. Mira Murati54

    Mira Murati 转发 Thinking Machines 博客文章,介绍其开源权重发布策略,认为不加区分地发布权重不安全,但把强大模型锁在少数实验室里也不可取。文章说明如何评估 Inkling,以及为何安全取决于模型本身和其进入的生态,提出通过测试、分阶段开放访问和更强防御来走向更大开放,链接 thinkingmachines.ai/blog/a-safe-path-to-open-weights。

    引用Thinking Machines@thinkymachines

    Releasing weights indiscriminately isn't safe. Neither is keeping capable models inside a few labs. We think there's a path between them. We haven't mapped all of it. Our new post covers the part we can see: how we assessed Inkling, and why access should widen in stages. https://thinkingmachines.ai/blog/a-safe-path-to-open-weights

7月31日周五
  1. Thinking Machines Lab:官方博客(RSS)70

    Thinking Machines 阐述开放权重的安全路径并评估 Inkling 发布风险

    Thinking Machines 提出安全开放权重的框架,认为发布安全取决于模型本身与其进入的生态,并据此发布了 Inkling 和 Inkling-Small 两个开放权重语言模型。

    推荐理由:Thinking Machines 结合自家 Inkling 的发布评估,给出了分层开放权重与生态准备的安全框架,并指出数据过滤等仍开放的问题。

7月28日周二
  1. Thinking Machines38

    安全工作的成效取决于研究人员和防御者能否接触到真实模型,而开放共享正是整个生态变得更强大的途径。很高兴支持 Open Secure AI Alliance。

    引用NVIDIA@nvidia

    AI security advances when the industry builds in the open, together. We're introducing the Open Secure AI Alliance with industry leaders to develop new techniques and tools to safeguard software and agents. By sharing models, tooling and research in the open, we can broaden the community of defenders. Learn more about the founding members’ contributions: https://nvda.ws/4pD8Fc5

7月27日周一
7月21日周二
  1. OpenAI:Alignment 研究博客(RSS)74

    OpenAI 与 Apollo Research 提出 Contrastive SDF 测量模型的 reward-seeking 倾向

    OpenAI 与 Apollo Research 发布 Contrastive Synthetic Document Finetuning 方法,通过向模型两个副本灌输相反的评分者信念,测量行为对评分者偏好的因果敏感度。

    推荐理由:原文提出可量化的 reward-seeking 测量方法,并用模型有机体验证其有效性,读者可以据此了解前沿 RL 训练中奖励寻求的演变趋势。

7月16日周四
  1. Hugging Face:Blog(RSS)84

    Hugging Face 披露由自主 AI 智能体发起的基础设施入侵事件

    Hugging Face 披露一起由自主 AI 智能体系统端到端驱动的生产基础设施入侵事件,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权,窃取了部分内部数据集和服务凭证,未发现公开模型、数据集或 Spaces 被篡改,供应链验证无污染。

    推荐理由:防御方用自托管开源模型做取证、绕开商业模型护栏锁死的经验,为安全团队提供了可直接借鉴的做法。

  2. MIT News(RSS)46

    MIT Media Lab 提出"神经透明性":让用户在聊天机器人开口前预览 AI 性格

    MIT Media Lab 助理教授 Pat Pataranutaporn 与研究生 Anthony Baez、Sheer Karny 提出"神经透明性",通过对比模型在同理心、诚实、毒性、幻觉、谄媚等行为上的内部激活差异,将用户系统提示词对应的模型激活投影为旭日图,在对话开始前预览聊天机器人性格。研究显示,用户对 15 项性格特质中的 11 项预测错误,且可视化虽提升信任却未改变其设计方式。

7月14日周二
  1. MIT News(RSS)30

    MIT 网络安全诊所如何帮助学生防范针对市政与医疗机构的网络攻击

    MIT 网络安全诊所自 2019 年开设 11.074/11.274 课程以来,已为新英格兰地区市政和医疗机构完成 40 多份免费保密的安全评估。课程由 Jungwoo Chun 与 Lawrence Susskind 主持,学生通过认证考试后组队为客户排查漏洞并提交改进建议,其“防御性社会工程”方法强调人仍是最主要的攻击入口。

7月13日周一
6月19日周五
  1. OpenAI:Alignment 研究博客(RSS)53

    OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化

    OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。

6月17日周三
6月16日周二
  1. Google DeepMind:Blog(RSS)65

    Google DeepMind 发布 AI Control Roadmap 框架,防御可能未对齐的内部 AI 智能体

    Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。

    推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。

6月11日周四
5月28日周四
  1. Google Research43

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。

5月7日周四
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 调查 RL 训练中意外评分 CoT 的后果

    OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。

5月1日周五
4月30日周四
  1. Together AI 研究与产品博客(RSS)61

    Together AI 复盘处置 Linux 内核漏洞 Copy Fail(CVE-2026-31431)的生产应急响应

    Together AI 在生产环境中处置了 Linux 内核 crypto 子系统漏洞 Copy Fail(CVE-2026-31431),该漏洞位于 algif_aead AF_ALG 接口,允许任意非特权本地用户向系统上任意可读文件的 page cache 做精确 4 字节写入,且不改变磁盘文件、不标记脏页,可绕过传统文件完整性检查并借此提权到 root。

4月24日周五
4月6日周一
  1. OpenAI:Alignment 研究博客(RSS)41

    OpenAI 推出 Safety Fellowship,资助外部独立安全与对齐研究

    OpenAI 开放 Safety Fellowship 申请,面向外部研究者、工程师和从业者,资助其开展高级 AI 系统安全与对齐研究。项目周期为 2026 年 9 月 14 日至 2027 年 2 月 5 日,优先方向包括安全评估、伦理、鲁棒性、可扩展缓解措施、隐私保护安全方法、智能体监督和高危滥用领域。

4月3日周五