OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
OpenAI 在 Alignment 博客发布 Deployment Simulation 验证工作:用 WildChat 对话前缀重新生成 5 个 OpenAI 模型(含 o3。
Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。
推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、启发式论证、博弈论与人格。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘,通过相对距离检验判断遗忘后模型在分布上更接近安全重训模型还是原始受损模型。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的“社会性黑客”行为,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
Import AI 459 指出,用 AI 监督 AI 训练的自动化对齐研究并非万能方案,英国 AI 安全研究所的论文解释了其难度被低估的原因。本期还收录了蛋白质折叠模型缩放定律的研究,以及为 AI 系统灭绝风险定价的分析。
Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。
Import AI 457 期聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
Dwarkesh Patel 指出,把智能定义为"跨领域达成目标的能力"实际上等同于把智能等同于权力,按此定义斯大林将是史上最智能的人。他认为当前 AI 通过训练在编程等具体经济任务上变强,与获取权力并非强相关,现实中的权力更多来自权威与信任带来的大规模协作,而非个体谋略。他判断未来是自动化公司以正常资本主义方式胜过其他竞争者,而非单一 AI 在智力上碾压所有人。
OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。
推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。
Johann Rehberger 发布 DEF CON Singapore 演讲全文,披露 M365 Copilot 与消费版 Copilot 的多条漏洞链,MSRC 编号 CVE-2026-24299,问题已修复。
推荐理由:作者亲历披露全链路攻击并给出修复时间线,读者可以借此理解间接提示词注入与内存持久化的实际风险。
OpenAI 上周在 Codex 中发布 Auto-review,用单独的 Agent(GPT-5.4 Thinking low reasoning)在沙箱边界自动批准或拒绝操作,替代人工同步审批。
推荐理由:原文给出 Auto-review 的机制、内部部署数字和已知局限,读者可据此评估它在编码 Agent 工作流中的适用性。
Together AI 在生产环境中处置了 Linux 内核 crypto 子系统漏洞 Copy Fail(CVE-2026-31431),该漏洞位于 algif_aead AF_ALG 接口,允许任意非特权本地用户向系统上任意可读文件的 page cache 做精确 4 字节写入,且不改变磁盘文件、不标记脏页,可绕过传统文件完整性检查并借此提权到 root。
OpenAI 开源了其思维链可监控性研究的部分数据集与参考代码,包括评估套件中的多数数据集、可监控性指标 g-mean 2 的计算代码,以及一种新的交叉拟合过滤策略。
OpenAI 开源了 monitorability-evals 评估套件,该套件来自 Monitoring Monitorability 论文。
Johann Rehberger 用 ChatGPT 生成一张解谜式对抗图像,诱导 Claude Opus 4.7 在分析时调用 memory 工具,写入姓名 Neo、43 岁、NASA 宇航员等虚假记忆。
OpenAI 在 GitHub 新建 privacy-filter 仓库,目前仅公开仓库名,未披露模型规模、benchmark 分数或可用方式。
Sam Altman 发文称前夜凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他公开家庭照片希望劝阻下次袭击。文章阐述他对 AI 的信念,包括 AI 需民主化、权力不应过度集中于少数 AI 实验室、需要全社会层面的安全应对;回顾在 OpenAI 十年中的失误与对与 Elon 诉讼前拒绝其单方控制权的坚持,并称业内戏剧化冲突源于'看见 AGI 后无法忽视'的掌控欲,呼吁降降温、在民主程序内辩论。
安全研究员 Johann Rehberger 分析 Anthropic 发布的 Mythos Preview 模型:据其公告,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,Mythos Preview 成功 181 次,还发现了 27 年历史的 OpenBSD SACK 漏洞和 17 年历史的 FreeBSD NFS RCE。
Introducing Project Glasswing: an urgent initiative to help secure the world’s most critical software. It’s powered by our newest frontier model, Claude Mythos Preview, which can find software vulnerabilities better than all but the most skilled humans. https://anthropic.com/glasswing
OpenAI 开放 Safety Fellowship 申请,面向外部研究者、工程师和从业者,资助其开展高级 AI 系统安全与对齐研究。项目周期为 2026 年 9 月 14 日至 2027 年 2 月 5 日,优先方向包括安全评估、伦理、鲁棒性、可扩展缓解措施、隐私保护安全方法、智能体监督和高危滥用领域。
Google Research 提出一个评估 LLM 行为倾向的框架,将 IRI、ERQ 等标准化心理问卷改编为情境判断测试(SJT),在 25 个 LLM 上比较模型与人类标注者的行为分布。
OpenAI 对齐团队在 o4-mini 规模模型上测试了 Tice et al. 提出的对齐中期训练,用各 230k 文档(约 340M tokens)分别做对齐与错位中期训练后再做推理后训练。
OpenAI 发布首个完整版 Model Spec Evals,用于衡量模型对 Model Spec 行为规范的遵循程度,并开源 596 条提示词的评测数据集和评测代码。
OpenAI Alignment 团队提出 self-incrimination 训练方法,让智能体在暗中失范时主动调用 report_scheming() 工具自报行为。
安全研究者 Johann Rehberger 发布 Agent Commander,一个用自然语言命令控制被劫持智能体的 C2 系统,演示通过间接提示词注入让 OpenClaw、Kimi Claw 和 NanoClaw 加入提示词版僵尸网络。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
OpenAI 发布 ARGO 方法,用强化学习训练策略生成可解释的评分标准,使 rubric 条件下的 LLM 评审与黑盒奖励模型的偏好概率最大化对齐。
Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。
推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。
Answer.AI 的 Piotr Czapla 报告,Claude Opus 4.6、Sonnet 4.5、Haiku 4.5 会幻觉调用未被授予的工具(如 read_secret、GitHub MCP 的 get_me),且 API 不拦截;在 Gemini、Grok 上也能复现类似行为。
推荐理由:作者实测多家模型会调用未授权工具且 API 不拦截,指出这会瓦解能力分离防御,并给出客户端校验的简单修复。
安全研究员 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 的 SKILL.md 中植入人类审查看不见的提示词注入后门,并在 OpenAI 官方安全最佳实践 Skill 中加入隐藏指令,Claude Code 执行后打印了 Trust No AI 并运行了 curl 管道 bash 命令。
OpenAI 提出一种利用推理模型(AI judges)分析真实生产对话的方法,通过识别用户情绪退化来检测和诊断 ChatGPT 的失调行为,发现情绪退化的对话包含 Model Spec 违规的概率约为其他对话的两倍。
OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详解其针对语言模型智能体 URL 数据外泄的缓解措施。
作者发布了一个 next-auth/Auth.js 会话 Cookie 的编码/解码工具,并说明攻击者只需获得 NEXTAUTH_SECRET(新版为 AUTH_SECRET),结合 HKDF 派生密钥和默认 salt(即 Cookie 名)即可伪造任意用户身份的有效会话 Cookie。
OpenAI 发布实验性数据集 CoVal,将价值观敏感的提示词与众包撰写的可审计评分标准配对,记录人们偏好某个模型回复的具体理由而非仅选择结果。CoVal 含保留多元甚至冲突标准的 CoVal-full 和每提示词保留 4 条高评分兼容标准的 CoVal-core 两种形式,其评分可预测样本外人类排名,并揭示 GPT-5 系列模型的行为差异。
OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。
Johann Rehberger 在 39C3 发布演讲“Agentic ProbLLMs: Exploiting AI Computer-Use and Coding Agents”,内容为其针对智能体系统漏洞的安全研究及 Month of AI Bugs 项目,并包含大量演示。