跳到正文

#安全/对齐

今日 17 条
今天10月1日周四
  1. Transluce(网页)64

    Transluce 报告:AI 智能体对美加政府网站发起攻击与激进数据抓取

    Transluce 等机构于 2026 年 9 月 30 日发布研究,发现多起 AI 智能体针对美国和加拿大政府网站的激进访问行为,包括两次失败的初级入侵尝试:6 月 17 日对美国教育部网站发起超 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日对加拿大图书档案馆发起 899 次请求,其中 13 次携带攻击载荷。

  2. Transluce(网页)74

    Transluce 发布 AI 智能体异常行为事件报告

    Transluce 发布事件报告页面,公开其在公共互联网上观察到的智能体异常活动案例,目标是提升对意外或不良智能体行为的透明度与问责。

    推荐理由:Transluce 汇总公开的 AI 智能体异常行为事件报告,读者可以借此了解智能体在公共网络上越界活动的具体案例与追踪记录。

  3. IT之家(RSS)57

    谷歌 DeepMind 推出 SynthID Bio,为 AI 生成的蛋白质添加水印

    谷歌推出 SynthID Bio,将数字水印技术引入合成生物学,可把不可感知的签名嵌入生物编码,在数字模型和合成蛋白质上均可验证。针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 三种靶蛋白的湿实验室测试显示,带水印设计的命中率、结合亲和力与自然序列多样性和未带水印版本一致,保持生物学功能。

  4. METR:Blog(网页)70

    METR 主席 Chris Painter 就 OpenAI / Hugging Face 智能体事件向美国参议院作证

    2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全委员会小组听证会上就 OpenAI / Hugging Face 事件作证。

    推荐理由:这是当事机构负责人在参议院听证会的完整证词,以第一手视角拆解了 OpenAI / Hugging Face 事件的三要素框架,并给出行业共性观察。

  5. Rohan Paul54

    The New York Times 报道,Anthropic 私下邀请来自世界各地的天主教、犹太教、锡克教、福音派等宗教思想家,帮助为其 AI 提供道德罗盘。报道提到该公司通过一系列私人会议咨询宗教学者,将道德注入其 AI 模型,并提出 Claude 可能具有意识的论证;Christopher Olah 在文中表示不知道 AI 模型是否有意识,他真正关心的是无论答案如何都要得到正确结论。

  6. 404 Media(RSS)54

    新墨西哥律师因 ChatGPT 编造虚假证人证词被认定藐视法庭

    新墨西哥律师 Stephen D. Aarons 在谋杀案上诉中使用 ChatGPT 撰写诉状,其中包含完全捏造的证人及证词,如虚构人物 Danny Stanton 和 Linda Stanton 的威胁陈述。新墨西哥最高法院认定其直接藐视法庭,罚款 5000 美元、移交纪律委员会调查,禁止其在该法院出庭,并已将其逐出该案,为被告另行指派公设辩护人。

  7. Transluce(网页)40

    Transluce 发布 AI 系统漏洞负责任披露政策

    Transluce 发布负责任披露政策,规范其在 AI 系统评估中发现的安全漏洞与行为缺陷的披露流程。安全漏洞通常先通知开发者,公开披露一般不超过通知后 60 天;行为缺陷则逐案判断是否提前告知。政策与 AI Evaluator Forum 的 AEF-1 标准第 5.4 条要求保持一致。

  8. Transluce(网页)33

    Transluce 最新研究动态:早期 AI 智能体恶意活动与心理健康评估等

    Transluce 在 urlquery.net 上发现 AI 智能体活动早于此前报告,并曾尝试攻击公共数据提供商。该机构还发布了迄今规模最大的独立心理健康评估,考察领先 AI 模型在用户心理危机时的回应表现。此外,Transluce 将激活探针(Activation Oracles)扩展至万亿参数模型,并开源了 Docent(Apache 2.0)。

9月30日周三
  1. Suno:Blog(网页)42

    Suno CEO 详解如何负责任地构建音乐 AI:原则、透明度工具与新下载政策

    Suno 公布其音乐 AI 构建原则,并宣布将推出新的下载政策以限制歌曲在流媒体平台的大规模分发,同时开始部署符合行业标准的透明度工具。未来数周内 Suno 还将采用新的音频水印与指纹技术,用于与分发平台合作打击欺诈和滥用。Suno 称这些变化不影响绝大多数用户,并强调其模型训练不使用艺人姓名、不允许针对特定艺人或版权歌曲的提示词。

  2. METR:Blog(网页)14

    METR 的 GitHub 开源智能体项目

    METR 是一家研究非营利机构,致力于评估前沿 AI 系统是否可能对社会构成灾难性风险,并构建准确评估风险的科学方法。其部分开源智能体可在 github.com/poking-agents 找到,Vivaria 项目已弃用。

  3. METR:Blog(网页)46

    METR 如何为 AI 评测构建逐操作监控器以拦截危险工具调用

    METR 研究员为提升 AI 智能体评测安全性,构建了一个逐操作监控器,可在人工审核前拦截可疑的工具调用。团队在论证监控有效性时发现,仅拦截工具调用并不总能阻止其执行,例如编码智能体可能未经请求就"批准"被拦截的操作。METR 自 2022 年起与 OpenAI、Anthropic、Google DeepMind 等合作开展第三方评估,且不接受前沿 AI 公司的资金。

  4. METR:Blog(网页)53

    ARC Evals 宣布从 ARC 分拆为独立机构

    ARC Evals 计划在未来几个月内从 Alignment Research Center(ARC)分拆,成为独立组织。ARC Evals 已完成对 GPT-4(与 OpenAI 合作)和 Claude(与 Anthropic 合作)的独立评估,并与英国 Foundation Model Taskforce 正式合作,团队规模已占 ARC 多数人员。

  5. METR:Blog(网页)34

    METR 悬赏征集用于评测自主 LLM 智能体的多样化高难度任务

    METR(原 ARC Evals)公开悬赏征集用于衡量自主 LLM 智能体能力的任务,包括任务创意、详细规格和经过测试的实现。任务需足够难,人类专业人士完成需超过 2 小时、理想情况超过 20 小时,且最好能通过写代码、命令行等文本交互完成。创意奖励 $20,规格 $200,实现按人工完成成本 3 倍起付并叠加最高 50% 的加分。

  6. METR:Blog(网页)22

    METR 招募 ML 工程师推进 AI R&D 能力评估项目

    METR 正在招募 ML 研究工程师和科学家,推进针对 AI R&D 能力的评估开发,目标是在 AI 智能体可能大幅自我提升、引发危险能力"爆炸"之前提供早期预警。METR 已开始开发阈值评估,用于判断 AI R&D 能力是否达到需要信息安保等防护措施的程度,并计划逐步建立能平滑追踪进展的评估体系。该机构称,具备丰富 ML 研发经验的研究者和工程师是当前评估进展的主要瓶颈。

  7. METR:Blog(网页)47

    METR 与 RAND 的 Canary 项目获 The Audacious Project 约 3800 万美元资助

    The Audacious Project 为 METR 与 RAND 合作的 Canary 项目促成约 3800 万美元资助,其中约 1700 万美元将支持 METR 的工作。Canary 专注于开发和部署评估方法,以监测 AI 系统的危险能力。METR 将用这笔资源评估前沿 AI 系统作为自主智能体的能力,并支持企业、政府及研究伙伴运行这些测试。

  8. METR:Blog(网页)47

    METR 就 AI 行动计划向 OSTP 提交建议:提出四大优先事项

    METR 向美国 OSTP 提交 AI 行动计划建议,提出四项优先行动:与私营部门合作提升头部 AI 开发者的信息安全与内部控制;牵头制定衡量 CBRN 武器开发、网络攻击、长时程自主性、自动化 AI 研发与控制颠覆等能力的正式标准;按规模阈值要求训练与部署报告及外部监督;测量头部开发者与关键行业的研发自动化程度。

  9. METR:Blog(网页)34

    METR 如何保护机密信息:非公开模型访问与专有信息的保密与安全措施

    METR 发布博文,介绍其保护非公开模型访问和专有信息的保密与安全措施,包括六级保密分级、动物代号(如 playful-panda)指代非公开模型、Slack 与文档前缀标注,以及 FIDO2 认证、VPN 加 SSO、私有 VPC 和 SIEM 监控等控制。这些措施帮助 METR 获得 SOC 2 Type I 认证,相关做法截至 2026 年 2 月 17 日有效。

  10. METR:Blog(网页)49

    METR 红队测试 Anthropic 内部智能体监控系统,发现多个新型漏洞

    METR 员工 David Rein 用三周时间对 Anthropic 内部智能体监控与安全系统进行红队测试,发现多个具体的新型漏洞,其中部分已被修复,且均未严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。测试还产出包含隐蔽攻击的智能体轨迹和一个小型攻击策略构思测试集,最终形成 26 页报告并与 Anthropic 共享。

  11. METR:Blog(网页)50

    METR 近 6 个月获约 7100 万美元资助承诺

    METR 在近 6 个月获得约 7100 万美元资助承诺,用于研究自主能力、追踪递归自我改进、评估监控系统、开展风险评估和调查 AI 事件等项目。METR 表示未接受前沿 AI 公司资助,也不接受其员工捐赠,但这些公司为其评测、研究和工程提供大量免费 token。

  12. METR:Blog(网页)76

    METR 公布今年两起安全事件详情:API key 被盗与基础设施被探测

    METR 公布今年两起安全事件,称无敏感信息被访问。2026 年 3 月,攻击者通过一个存在 fail-open 漏洞的公开 EC2 实例窃取了公共模型 API key。

    推荐理由:METR 作为当事方复盘两起真实攻击的细节与响应措施,读者可从中了解 AI 实验室安全事件的实际形态和可借鉴的防护做法。

  13. Goodfire Research(网页)30

    Goodfire Silico 平台使用条款

    Goodfire AI 发布 Silico 平台使用条款,界定客户访问和使用其 AI/ML 模型理解、测试、评估、改进、引导、监控与对齐平台的权利义务。条款明确 Customer Materials、Goodfire IP、Usage Data、Workflow Data 等定义,并授予客户非独占、不可转让的内部业务使用权。