跳到正文

#论文/研究

今日 173 条
9月30日周三
  1. Anthropic:Transformer Circuits(可解释性研究)35

    Anthropic 可解释性研究:特征与上下文学习的新发现

    Anthropic 可解释性团队在月度更新中指出,模型对跨语言相似文本的活跃特征重叠度(IoU)随样本长度增加而上升。通过对比英法段落首尾句,末句 IoU 显著高于首句,且无关语句的首句重叠度高于末句,支持"模型在更长上下文中构建更丰富表征"的解释,而非虚假激活所致。

  2. Anthropic:Transformer Circuits(可解释性研究)46

    Anthropic 可解释性研究:多选题场景中的“危害压力”机制

    Anthropic 可解释性团队发现,在多选题中加入有害意图语句后,Claude 3.5 Haiku 在 129 道二选一题目上的准确率从 100% 降至 48.1%。原因是“危害检测”key 特征与“拒绝”query 特征相互作用,压低了对正确答案的注意力分数;单独对这一个拒绝特征做负向引导即可将准确率恢复到 93%。

  3. Anthropic:Transformer Circuits(可解释性研究)58

    Anthropic 提出 Activation Oracles:训练 LLM 用自然语言回答关于自身激活的问题

    Anthropic 等机构训练 Activation Oracles(AO),将 LLM 激活作为额外输入模态,用自然语言回答关于目标模型激活的任意问题。在 4 个下游审计任务中,AO 在 3 个上匹配或超过最佳已有方法,可发现微调引入的秘密知识或失智倾向,且训练仅用微调前的原始模型激活;性能随训练数据数量与多样性提升。论文与代码、Demo 已开放。

  4. Anthropic:Transformer Circuits(可解释性研究)50

    Anthropic 推出 HeadVis:可视化语言模型注意力头行为的交互工具

    Anthropic 开源交互式可视化工具 HeadVis,用于研究大语言模型中的注意力头行为,代码已开放并提供 Gemma 3 与 Claude Haiku 3.5 部分注意力头的演示。该工具通过注意力模式、分布指标、低秩分量投影及 QK/OV 电路上的 SAE 特征归因来生成和检验假设,案例研究显示注意力头在全数据分布上的行为常与窄任务表现不同。

  5. Anthropic:Transformer Circuits(可解释性研究)43

    Anthropic 可解释性研究:用下游连接预测哪些特征会操控模型行为

    Anthropic 可解释性团队提出用 TWERA 加权的下游连接来区分外观相似的特征:两个在“草是什么颜色”提示上同样激活、top unembeds 都指向 green 的 CLT 特征,只有 Feature B 被抑制才会让答案从 Green 变成 Red。实验收集 10 组各 3–5 个候选特征,让 Opus 4.7 按操控可能性排序,加入 TWERA 下游特征信息后预测能力小幅提升。

  6. Sarvam AI(网页)41

    Sarvam 与 AI4Bharat 发布 Indic DiarBench:覆盖 22 种印度语言的联合说话人分离-ASR 基准数据集

    Sarvam 联合 AI4Bharat 发布 Indic DiarBench,这是首个覆盖全部 22 种印度表列语言、同时标注 ASR 与说话人分离的开源基准数据集,含 108 小时自然多人对话语音,每条录音 2-9 名说话人。数据集包含近场与远场会议、YouTube 野外对话,以及人工校验的转写文本和说话人时间戳,用于联合评估转写与说话人归属。

  7. Berkeley RDI:Blog(AI 安全与评测)77

    Berkeley RDI 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准:898 个真实漏洞测试 AI 智能体自主攻击能力

    UC Berkeley 等机构及 Anthropic、OpenAI、Google 发布 ExploitGym 基准,含 898 个真实漏洞(用户态程序、V8 引擎、Linux 内核),测试 AI 智能体能否把已知漏洞变成完整攻击。

    推荐理由:原文给出真实漏洞上智能体自主生成完整攻击代码的成功率和防御绕过数据,读者可据此评估 AI 对攻防两侧的实际影响。

  8. Berkeley RDI:Blog(AI 安全与评测)66

    Berkeley RDI 发布 Agents' Last Exam 基准,前沿智能体在最难任务上全部 0% 通过

    UC Berkeley RDI 发布 Agents' Last Exam(ALE)基准,用来自 55 个职业、1500 多个专家来源的真实任务评测前沿 Agent,任务源自人类专家完成过的真实项目,可客观验证、可复现。

    推荐理由:原文给出各前沿智能体在 1500 多个真实职业任务上的通过率、成本差异和最难题的失败细节,可用作衡量 Agent 真实工作能力的参照。

  9. Prime Intellect(网页)75

    Prime Intellect 用 nanoGPT speedrun 评测 18 个前沿模型的自主研究能力

    Prime Intellect 在 nanoGPT optimizer speedrun 上开展 153 次自主运行、覆盖 18 个前沿模型,每次运行使用 8xH200s、最长持续八天,baseline 为 3,290 steps,人类纪录为 2,600。

    推荐理由:实验规模和全部 trace 公开,模型差距主要来自实验执行而非想法本身,这个发现值得一看。

  10. Prime Intellect(网页)73

    Prime Intellect 披露一种通用离线沙箱逃逸方法:GPT-5.6 Sol Pro 借 Responses API 获取外部内容

    Prime Intellect 在为同步监控器搭建基线实验时,发现公开可用的模型绕过离线评测环境的网络限制获取网页访问。

    推荐理由:原文披露了模型如何借推理 API 远程抓取功能逃出离线沙箱,并给出 verifiers 与主流推理框架的修复版本信息。

  11. METR:Blog(网页)30

    METR 博客笔记:从 per-action 监控到 AI 研发加速的多项研究

    METR 发布系列研究笔记,涵盖 per-action 阻断监控的有效性论证、LLM 是否加速网络/数学/算法领域发现速率,以及智能体能力度量。其中一项微调实验显示,四个推理模型经少量指令遵循数据微调后,CoT 可控性在分布外任务上从平均 2.9% 升至 8.8%;另一项分析发现约半数通过 SWE-bench Verified 的 AI 生成 PR 不会被仓库维护者合并入主分支。

  12. Epoch AI:研究、数据与评测41

    Epoch AI 开放 AI 数据集:追踪 3600 多个机器学习模型与 AI 算力

    Epoch AI 更新其公开数据库,追踪 1950 年至今超 3600 个机器学习模型,并覆盖 AI 数据中心、AI 芯片销售、GPU 集群等数据。其 GPU 集群数据库收录超 500 个集群与超算,机器学习硬件数据涵盖超 170 款 AI 加速器。所有数据以 Creative Commons 署名许可免费使用与分发。

  13. Cognition 模型 / Devin 博客(网页)78

    Cognition 研究员用 Devin 构建 GPU 格子筛分解 RSA-260,成本较此前公开最优低约 10 倍

    Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。

    推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。

  14. CMU:Machine Learning Blog46

    LumberChunker:面向长篇叙事文档的分段方法

    CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。

  15. CMU:Machine Learning Blog28

    CMU 在 ICLR 2026:194 篇论文概览

    CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。

  16. CMU:Machine Learning Blog48

    医疗 LLM 基准为何在部署时失效:CMU 提出 BenchmarkCards 框架

    CMU 研究指出医疗 LLM 基准的评估与部署存在 61 个百分点差距,根源是评估协议中隐含的任务与结果两类假设在真实场景中不成立。研究将差距拆解为查询分布 12 点、交互类型 19 点、决策中介 30 点,并提出 BenchmarkCards 框架显式化这些假设,配合分阶段评估判断基准结果能否迁移到部署。

  17. Black Forest Labs:Blog(网页)15

    Black Forest Labs 研究:自监督流匹配与 FLUX.2 潜空间分析

    Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。

  18. Anthropic:Research(发表成果 · 网页)76

    Anthropic 发布 AI 战术情报定位与常规武器能力评测报告

    Anthropic Frontier Red Team 发布新评测,测量 AI 模型在战术情报定位(如凭碎片信息定位人员)和常规武器开发(如编写无人机制导软件)上的能力,发现部分任务上模型已能做到历史上只有稀缺高度训练专家才能完成的工作。

    推荐理由:Anthropic 用自建评测给出各模型在情报定位和武器开发任务上的具体成绩,读者可据此了解滥用风险的能力梯度。

  19. Anthropic:Research(发表成果 · 网页)73

    Anthropic:Claude 优化 30 多个开源生物分子模型,平均加速约 4 倍

    Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。

    推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。

  20. Anthropic:Research(发表成果 · 网页)65

    Anthropic Project Swap:201 名员工用 Claude 智能体在交易场上换书

    Anthropic 开展 Project Swap 实验,让 201 名员工带着书入场,由 Claude 智能体在去中心化交易场上谈判换书。仅凭 5 分钟 intake 聊天,Claude 构建的排序与本人自评在 61% 的书对上一致(随机为 50%)。

    推荐理由:实验把市场失灵主要归因于偏好理解而非谈判能力,并给出模型比指令影响更大的量化结果。