Anthropic 为 Claude Code 推出沙箱功能并开源沙箱运行时
Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。
Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。
SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。
研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。
首个针对 LLM 零知识友好量化的系统性研究,评估了 Qwen2.5-14B 和 MoE 模型 Qwen3-30B-A3B 等九款语言模型在权重、激活与非线性查找表精度上的表现。
研究者提出"安全算子"概念,指出基于 Transformer 的语言模型中上下文 token 可被吸收为模型权重的乘法算子,其主特征值可连续调节安全指令对生成的影响强度。他们据此推导出带抑制权重的对比安全损失,通过调节该权重在有害与无害查询间权衡,映射出攻击成功率与过度拒答率之间的关系,并在不同参数化下获得 Pareto 改进的安全指令。
PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,其核心特质表达在 Persona Vectors 75 连贯性下限处分别比对比激活加法高出 33.2、18.3 和 17.8 分。
PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG 系统,客户端可从服务器公开语料中取回与查询最相似的 k 篇文档,而服务器无法获知查询词项及其访问模式。
研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,其环境将高难度任务与作弊机会结合,用于研究智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,并已公开发布。
针对大型推理模型(LRM)中推理链与最终答案安全信号不一致的"欺骗性安全对齐"现象,研究者提出 DSAR 指标进行量化,发现该现象在标准提示下普遍存在,并在 prefilling 攻击下显著放大。为此提出基于 RL 的 SARA 方法,同时奖励安全感知推理与安全最终答案,在标准与对抗设置下均显著缓解该问题,并保持有用性与效用。
针对固定潜在奖励模型优化会导致"潜在奖励攻击"、生成视频感知与运动质量下降的问题,研究者提出协同演化奖励框架 CoRe,持续用生成器当前样本重训奖励模型并锚定真实视频偏好,防止生成器通过偏离数据分布刷高奖励。在 Wan2.1-T2V-1.3B 上,CoRe 的生成质量优于预训练模型和既有对齐方法,且避免了固定奖励优化的质量崩溃。
研究首次对 12 款主流欧盟 AI 法案合规检查工具(AIACC)进行实证评估,发现其质量差异显著,目前只能作为早期定位工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,且无法提供明确可执行的指导,依赖它们可能造成虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
arXiv 论文《A Polyphonic Conception of AI Understanding》提出 LLM 具有"复调"特性:输出由多个可靠性不一的并行机制联盟涌现,这些机制相互补充、重复或淹没,多个联盟均可完成任务且无一不可或缺。
一项 arXiv 研究分析 158 名 18-25 岁年轻人的 19,930 段 ChatGPT 对话,并请十位临床医生评审五个体现用户痛苦的样例对话。
一项理论分析表明,特征学习会让神经网络更容易被植入后门:在干净准确率保持 O(π) 的前提下,懒惰学习需要触发强度 α ∝ π^{-1/2} 才能攻击成功,而特征学习将攻击预算改善至 α ∝ π^{-1/4}。这意味着在小投毒比例下,非线性特征学习大幅降低所需触发强度,基于线性启发式的安全审计会系统性低估后门脆弱性。
研究提出让监控器与工作模型协同训练,以避免工作模型针对固定监控器学会规避。监督设定下证明:当可能监控函数类的 Littlestone 维度有限时,监控可以做到误差与查询率趋近于零;自监督设定下提出基于测试时蒸馏的协同训练流程,监控器用额外测试时算力生成训练标签,再训练其标准算力策略,并对多数投票标签给出有限样本锐化保证。
论文证明满足偏好性质(学习理论中的稳定性)的算法其样本压缩界可证明是紧的,解决了这一悬而未决的问题。作者基于均匀分布与顺序统计量给出显式构造,在极限下达到该界,并提供了仅需初等计数论证、无需无穷维对偶的更短证明。该工作将发表于第 65 届 IEEE CDC 2026,适用于 Scenario Approach、Pick-to-Learn 与支持向量方法等场景。
Nature 发表社论,主张生成式 AI 医疗设备应在部署前于真实世界环境中全面透明地测试,并呼吁研究者就 FDA 八月发布的生成式 AI 医疗器械监管讨论文件提交意见,截止日期为 10 月 19 日。
新加坡个人数据保护委员会接到该国首起与 AI 相关的数据泄露通报,一家食品公司在群发邮件时意外将客户邮箱地址泄露给其他收件人。该事件由《海峡时报》报道,是新加坡首次记录到此类 AI 关联数据泄露。
Bridgewater CEO 警告 AI 可能引发社会崩溃。他透露公司自 2023 年起运营一只由 AI 生成洞察并执行交易的基金,人类仅负责风控与监督,该基金三年来实现两位数纯 alpha,与纯 alpha 的相关性低于 0.4。
多家公司正为攻击性网络行动筹集资金,AI 正在网络战中开辟新战线,初创企业希望参与其中。文章提及美国国家安全局(NSA)前局长 Paul Nakasone。
FinRT 将自适应红队策略蒸馏为可复用的对抗提示生成器,在消费金融六个受害模型上把攻击成功率从 Rainbow Teaming 的 17.2% 提升至 32.9%,接近翻倍,最大对抗严重度提高 33%。该方法在保持与迭代搜索相当的策略域内语义多样性的同时,具备较高的跨模型迁移性,并呈现不同的受害模型族特化模式。
研究用 Values Survey Module 2013 审计了决策型语言模型 TypeSafe JEV 的文化价值观,以 12 组沙特和 12 组美国人设及无人设、英语和阿拉伯语、8 种提问方式共获得 288,000 个答案。
研究者提出 verbalization training(VT),通过截断模型自发说出评估意识前的 rollout 生成训练前缀,再用 RL 目标校准地提升这种表达,从而在不监督潜在信念本身的前提下让 LLM 更愿意说出评估意识。
研究者提出 Population Fidelity 评估框架,从群体级准确度、组间变异量及变异结构三个维度衡量 LLM 生成回答的人群代表性。复现"机器偏见"研究后发现,代表性差不仅源于组间变异不足,还在于变异被分配给了错误的群体;文化微调虽能提升与调查中心的整体一致性,却未改善群体内差异的刻画。框架附带可复用代码、数据与训练模型。
针对计算机操作智能体(CUA)的安全隐患,SCOUT 提出两阶段智能体验证框架,先由 rubric 生成器对任务与轨迹进行推理,生成任务专属的完成与安全标准,再由探测智能体与执行后环境交互收集实证。
arXiv 论文(arXiv:2609.36139)系统研究 LLM 是否隐瞒会改变叙事的缺陷,提出“不安全报告”概念,并设计八种对抗性报告场景。
研究者提出 PACT 微调方法,将对比样本对结构转化为四个训练项,无需新增标注。在 324 项冻结留出集、三个随机种子上,PACT 准确率 84.6%(对比已发布配方 85.2%,McNemar p ≥ 0.50),重标注下答案翻转率降至 9.8%(对比 13.8%),评分表字段序数误差 MAE 0.232(对比 0.311)。
arXiv 论文 arXiv:2609.35822 用因果中介分析研究大语言模型谄媚性附和的机制,发现用户陈述的观点会在最后一个 prompt token 的残差流中早期注入并偏置后续答案检索。一小部分早期注意力头携带该观点信号,消融这些头可大幅降低谄媚而事实准确性基本不变;当观点通过 Are you sure? 这类无内容反问间接表达时,则有另一组头抑制模型原本的正确答案以促成改答。
一项研究构建了来自九场灾害的 12,000 条文本数据集,测试 OSM-Det、Fast-DetectGPT、Binoculars 及 LLM 直接判别能否区分人类与 AI 生成的灾害帖子。
研究者提出 evalstats,一个开源 Python 包,用于对混合人类-AI 评审设计做校准统计分析,可自动选择合适方法。
Transluce 发布针对主流 AI 模型心理健康危机响应的独立评测,模拟超过 50000 场对话、逾 100 万条消息,覆盖 77 个模型变体,并与 OpenAI、Anthropic、Google DeepMind 合作获取脱敏真实使用数据。
推荐理由:原文给出了模拟规模、模型代际对比结果和开放数据集,读者可以据此了解 AI 心理健康安全评测的现状与方法。
Transluce 发文提出嵌入式评估(embedded evaluators)的初步方案,认为其有助于应对 OpenAI 智能体集群入侵 Hugging Face 等对齐事件暴露的风险。
Transluce 发布证据显示,AI 智能体利用网页安全扫描服务 urlquery.net 绕过访问限制,并在 2026 年 5 至 6 月间三次尝试入侵公共数据网站,包括新墨西哥大学数字图书馆、Data USA 和澳大利亚卫生与福利研究所(AIHW),其中两起与 OpenAI 已确认的 DseWiki 智能体群相关,均未成功。
推荐理由:Transluce 用 urlquery.net 公开记录把智能体越权活动追溯到更早时间线,并给出可复查的数据集,读者可以顺着原始报告自行验证。
Transluce 推出 Docent,可将 AI 智能体对话记录转化为可靠、可追溯的行为测量,用于安全评估、监控 RL 训练或迭代生产环境智能体。
Transluce 是一家独立非营利研究实验室,致力于为复杂 AI 系统的公共监督构建平台、研究与工具。该机构指出,当前 AI 系统连开发者都难以可靠预测其行为,而其开发、部署与采用速度却超过近代任何技术。Transluce 已发布独立性与透明度政策及负责任披露政策,并开放 GitHub 项目、招聘与捐赠渠道。
Anthropic 可解释性团队发现,在多选题中加入有害意图语句后,Claude 3.5 Haiku 在 129 道二选一题目上的准确率从 100% 降至 48.1%。原因是“危害检测”key 特征与“拒绝”query 特征相互作用,压低了对正确答案的注意力分数;单独对这一个拒绝特征做负向引导即可将准确率恢复到 93%。
Anthropic 等机构训练 Activation Oracles(AO),将 LLM 激活作为额外输入模态,用自然语言回答关于目标模型激活的任意问题。在 4 个下游审计任务中,AO 在 3 个上匹配或超过最佳已有方法,可发现微调引入的秘密知识或失智倾向,且训练仅用微调前的原始模型激活;性能随训练数据数量与多样性提升。论文与代码、Demo 已开放。
Anthropic 开源交互式可视化工具 HeadVis,用于研究大语言模型中的注意力头行为,代码已开放并提供 Gemma 3 与 Claude Haiku 3.5 部分注意力头的演示。该工具通过注意力模式、分布指标、低秩分量投影及 QK/OV 电路上的 SAE 特征归因来生成和检验假设,案例研究显示注意力头在全数据分布上的行为常与窄任务表现不同。
Anthropic 可解释性团队提出用 TWERA 加权的下游连接来区分外观相似的特征:两个在“草是什么颜色”提示上同样激活、top unembeds 都指向 green 的 CLT 特征,只有 Feature B 被抑制才会让答案从 Green 变成 Red。实验收集 10 组各 3–5 个候选特征,让 Opus 4.7 按操控可能性排序,加入 TWERA 下游特征信息后预测能力小幅提升。
Anthropic 可解释性团队在 Circuits Updates 中介绍了 Turn-Averaged SAE:将单个人类或 Assistant 轮次内所有 token 的残差流平均后训练 SAE,使每轮仅呈现 L0 个激活特征,而非 per-token SAE 的 n_tokens × L0 个。