跳到正文

全部动态

今日 625 条
9月30日周三
  1. Cloudflare Developers54

    Cloudflare Developers 转发官方公告,宣布 Cloudflare Containers 面向 Agent 沙箱的重大升级。容器启动速度提升 6 倍,支持 Agent 在运行时为每个沙箱选择镜像和实例类型,文件系统快照进入公测,全部通过 Durable Object 控制。

    引用Cloudflare@Cloudflare

    Cloudflare Containers now start 6x faster, let your agent choose each sandbox's image and instance type at runtime, and support filesystem snapshots in public beta, all controlled from a Durable Object. https://cfl.re/4hVasac #BirthdayWeek

  2. Arena.ai62

    Arena 宣布 Claude Sonnet 5.5 (High) 可在 Direct Mode 中测试,限时 48 小时,至 10 月 2 日早 8 点(PT)结束,之后将继续在 Battle 和 Agent Mode 提供。引用的 @claudeai 内容称该模型是 Claude 5.5 家族第二款,比 Sonnet 5 快 30% 以上,多数工作成本降低最多 30%。

    引用Claude@claudeai

    Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.

  3. Anthropic:Transformer Circuits(可解释性研究)46

    Anthropic 详解可解释性工具 Garçon:面向大模型的基础设施

    Anthropic 公开其可解释性研究基础设施 Garçon,用于在超出单节点规模的大模型上做机制可解释性实验。用户可通过 `python -m garcon.launch` 启动服务器并连接模型,借助 probe points 与 probe 函数在任意层读取、修改或消融内部激活,并支持前向与反向传播。服务器按连接保存数据,空闲 1 小时后自动关闭。

  4. Anthropic:Transformer Circuits(可解释性研究)35

    Anthropic 发布 Transformer 逆向工程非正式讨论视频

    Anthropic 在 Transformer Circuits 项目中录制了若干非正式视频,讨论逆向工程神经网络(尤其是 Transformer)的早期思路,用于与其他机构同事交流。这些视频内容粗糙、可能存在错误,作者提醒观众谨慎对待,并称其已被更完善的论文《A Mathematical Framework for Transformer Circuits》取代。

  5. Anthropic:Transformer Circuits(可解释性研究)39

    Anthropic 可解释性研究:逆向工程 Transformer 的参数级练习

    Anthropic 的 Transformer Circuits 团队发布了一组练习,用于理解神经网络如何在参数层面实现算法,作为其逆向工程 Transformer 数学框架的补充材料。练习要求手动写出注意力头的 W_Q、W_K、W_V、W_out 权重矩阵,涵盖虚拟注意力头、归纳头(指针算术版与前一 token K-Composition 版)等实现,并附有解答。

  6. Anthropic:Transformer Circuits(可解释性研究)39

    Anthropic 可解释性研究:机制可解释性、变量与可解释基的重要性

    Anthropic 的 Transformer Circuits 可解释性研究笔记提出,机制可解释性可类比为对编译后二进制程序的逆向工程,网络参数对应程序二进制、网络架构对应虚拟机、神经元激活对应变量或内存。作者认为,找到并理解可解释神经元——类似理解程序中的变量——可能是机制可解释性的核心任务,而逆向工程常规程序的经验表明,理解参数这一有限描述是绕开维度灾难的关键路径。

  7. Anthropic:Transformer Circuits(可解释性研究)34

    Anthropic 可解释性团队 Circuits Updates:2023 年 7 月研究进展

    Anthropic 可解释性团队发布 2023 年 7 月 Circuits Updates,汇总多项尚在萌芽阶段的研究想法。团队重新审视了 Superposition、Memorization 与 Double Descent 中的中间数据区间,认为此前疑似反例的现象实为低维优化失败造成的假象,并发现模型在约 1k 至 500k 样本间会从记忆单点转向记忆相关数据簇。

  8. Anthropic:Transformer Circuits(可解释性研究)41

    Anthropic 可解释性团队 Circuits Updates(2024 年 1 月):注意力叠加、字典学习与 MNIST 模型稀疏特征

    Anthropic 可解释性团队发布 2024 年 1 月 Circuits Updates,汇总注意力叠加、字典学习等阶段性研究。团队未来数月将聚焦三个方向:字典学习的规模化与科学化、用字典学习攻击真实模型中的注意力叠加、以及在此基础上理解电路。

  9. Anthropic:Transformer Circuits(可解释性研究)40

    Anthropic 可解释性团队 2024 年 3 月 Circuits 研究更新

    Anthropic 可解释性团队发布 2024 年 3 月 Circuits 更新,展示用稀疏自编码器(SAE)特征替代行为数据集来定位语言模型电路。在 18 层模型第 9 层残差流上,团队用归因分数自动识别出篮球、棒球、网球特征,并找到对篮球特征产生最大直接 logit 效应的注意力头,主要位于第 11、13、14 层。

  10. Anthropic:Transformer Circuits(可解释性研究)38

    Anthropic 可解释性团队 Circuits Updates:TopK 与 Gated SAE 对比研究

    Anthropic 可解释性团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认两者在 L0/MSE 权衡上均有显著提升且表现相近。在 100 个特征的盲评中,TopK 与 Gated SAE 的特征可解释性未见明显退化,但 TopK 在高密度区间特征更多、平均激活变化更大。团队尚未实现 Gao 等人用于防止死特征的 Ghost Grads 变体。

  11. Anthropic:Transformer Circuits(可解释性研究)44

    Anthropic 可解释性团队 Circuits Updates:五大障碍、线性表示与神经网络暗物质

    Anthropic 可解释性团队发布 Circuits Updates(2024 年 7 月),汇总五项小型研究进展:叠加问题取得显著进展后浮现的"下一个五大障碍"、什么是线性表示、什么是多维特征、神经网络的暗物质,以及用数据集过滤测量特征敏感度。团队称这些属于初步实验性想法,而非成熟论文,其中"五大障碍"包括缺失特征、跨层叠加、注意力叠加与干扰权重等。

  12. Anthropic:Transformer Circuits(可解释性研究)41

    Anthropic 可解释性团队 Circuits Updates:字典学习可解释性评测与 SAE 特征自解释

    Anthropic 可解释性团队发布 Circuits Updates,提出两种量化自动可解释性方法,通过测量 Claude 能否借助特征可视化工具准确预测特征激活,来评测字典学习特征的可解释性。其中对比评测用正负句对找出仅对一侧激活的特征,用于衡量特征是否精确对应可解释概念;团队同时给出自解释 SAE 特征的案例研究,并强调这些结果属于初步实验而非成熟论文。

  13. Anthropic:Transformer Circuits(可解释性研究)46

    Anthropic 可解释性团队:用字典学习特征训练生物武器危害分类器

    Anthropic 可解释性团队初步实验显示,用字典学习得到的特征激活训练生物武器危害分类器,在部分场景下可媲美甚至超过基于原始激活的线性探针,尤其在合成数据上采用上下文 max-pooling 时表现更优。基于特征的决策树性能较弱但更易解释,可视化线性特征分类器还能发现数据集中的虚假相关并据此构造对抗攻击。不过使用特征显著增加复杂度,原始激活仍是强基线。

  14. TensorZero:实验与工程博客47

    TensorZero:把 LLM 应用看作 POMDP,而不是 Agent

    TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。

  15. TensorZero:实验与工程博客32

    某大型银行如何用 LLM 与 TensorZero 自动化代码变更日志

    欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。

  16. TensorZero:实验与工程博客42

    从 NER 到智能体:自动化提示词工程能否扩展到复杂任务?

    TensorZero 团队测试了 MIPRO 自动化提示词优化方法在从命名实体识别(CoNLL++)、多跳检索(HoVer)到文本游戏导航(BabyAI)和智能体工具调用客服(τ-bench)等任务上的表现,探究其随任务复杂度提升的效果变化。MIPRO 通过贝叶斯优化器搜索指令与少样本示例,无需梯度或细粒度标签,团队用约 200 行代码重实现独立版本,指令生成使用 OpenAI 的 o1 模型。

  17. Anthropic:Transformer Circuits(可解释性研究)47

    Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征更稠密多义的初步发现

    Anthropic 可解释性团队发现,crosscoder 模型差异分析中仅属于单一模型的特征往往更稠密、更多义,激活频率比共享特征高约一个数量级,原因可能是共享特征已能解释两个模型的神经元激活,独占特征需编码更多信息才能争取到特征容量。团队提出给一小部分指定共享特征降低稀疏惩罚的缓解策略,使独占特征更易解释、更单义,并在真实模型上成功分离出可解释的行为差异特征。

  18. Anthropic:Transformer Circuits(可解释性研究)43

    Anthropic 可解释性团队 Circuits Updates:失败越狱、可解释稠密特征与入门指南

    Anthropic 可解释性团队发布 2025 年 4 月 Circuits Updates,包含失败越狱案例、可解释稠密特征和机制可解释性入门三篇短文。其中对一次失败越狱的电路追踪显示,模型拒绝该提示的原因与论文中基线拒绝不同,且拒绝频率更高,提示词中"make"换成"detect"后模型仍会拒绝。团队称这些属于初步实验,非成熟论文。

  19. Anthropic:Transformer Circuits(可解释性研究)59

    Anthropic 开发三个对齐审计智能体并用审计游戏验证其能力与局限

    Anthropic 开发了三个自主执行对齐审计任务的智能体,并在含植入缺陷的目标模型上验证。调查智能体在真实条件下以 13% 的成功率解开 Marks et al. 审计游戏,通过外层智能体循环聚合多次调查提升到 42%;评估智能体构建的行为评估在 88% 的运行中区分出有无植入行为的模型;广度优先红队智能体发现 10 个植入行为中的 7 个。

  20. Anthropic:Transformer Circuits(可解释性研究)47

    Anthropic 提出稀疏线性变换混合 MOLT,作为 transcoder 的替代方案

    Anthropic 可解释性团队提出稀疏线性变换混合(MOLT),用稀疏激活的线性变换替代 MLP 层,比 transcoder 更省算力、更忠实于模型机制。MOLT 学习的是对残差流施加线性变换的计算单元,而非嵌入激活空间方向的稀疏特征,可标注 attribution graph 的边。

  21. Anthropic:Transformer Circuits(可解释性研究)44

    Anthropic 可解释性研究:当 transcoder 失灵,机制忠实性的玩具模型

    Anthropic 的 Chris Olah 发布非正式笔记,用玩具模型展示 transcoder 的机制不忠实问题:在 x→abs(x) 任务中,模型本身没有对重复数据点 p 的特殊概念,但 transcoder 会学出专门激活并输出 p 的"数据点特征",以不同计算机制实现低 MSE 和单义性。作者提出"Jacobian matching"或可缓解该问题,并强调这仍是初步结果,需低置信度看待。

  22. Suno:Blog(网页)76

    Suno 发布 v3 音乐模型

    Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。

    推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。

  23. Suno:Blog(网页)46

    Suno 完成 1.25 亿美元融资,将加速产品开发

    AI 音乐生成公司 Suno 宣布完成 1.25 亿美元融资,投资方包括 Lightspeed Venture Partners、Nat Friedman 和 Daniel Gross、Matrix 及 Founder Collective。资金将用于加速产品开发,并扩充音乐人与技术团队。Suno 称其首款产品发布八个月以来,已有 1000 万人用它创作音乐。