全部AI 动态
全部动态
今日 625 条
OpenRouter@OpenRouterAI 评分2222
OpenRouter@OpenRouterAI 评分4343新 API:/tools 让智能体从 Server Tools Marketplace 获取数据,包括市场上最优价格,并以编程方式使用
Replit ⠕@ReplitAI 评分2525
Nathan Lambert@natolambertAI 评分2727如果 X 允许使用该应用的人将他们的回复标记为人类撰写,或者你可以将回复限制为经过验证为人类的用户,整个体验会好上 10 倍。 我不想不得不将回复限制在我关注网络中的账户。所有机器人也都是经过验证的。
Cloudflare Developers@CloudflareDevAI 评分5454引用Cloudflare@CloudflareCloudflare Containers now start 6x faster, let your agent choose each sandbox's image and instance type at runtime, and support filesystem snapshots in public beta, all controlled from a Durable Object. https://cfl.re/4hVasac #BirthdayWeek
Tripo@tripoaiAI 评分2424
Arena.ai@arenaAI 评分6262引用Claude@claudeaiIntroducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
DogeDesigner@cb_dogeAI 评分1010Anthropic:Transformer Circuits(可解释性研究)AI 评分4646 Anthropic 详解可解释性工具 Garçon:面向大模型的基础设施
Anthropic 公开其可解释性研究基础设施 Garçon,用于在超出单节点规模的大模型上做机制可解释性实验。用户可通过 `python -m garcon.launch` 启动服务器并连接模型,借助 probe points 与 probe 函数在任意层读取、修改或消融内部激活,并支持前向与反向传播。服务器按连接保存数据,空闲 1 小时后自动关闭。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4040 Anthropic 发布 PySvelte:连接 Python 与 Svelte 的可解释性可视化库
Anthropic 开源 PySvelte,用于在 Python 中调用 Svelte 组件构建神经网络可解释性可视化。该库让 src/ 下的 Svelte 组件自动暴露为 pysvelte.Hello() 等 Python 接口,支持 NumPy 数组传入、Jupyter/Colab 内联显示及 .publish() 发布到 GCS/S3/AZ 并分享至 Slack。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3535 Anthropic 发布 Transformer 逆向工程非正式讨论视频
Anthropic 在 Transformer Circuits 项目中录制了若干非正式视频,讨论逆向工程神经网络(尤其是 Transformer)的早期思路,用于与其他机构同事交流。这些视频内容粗糙、可能存在错误,作者提醒观众谨慎对待,并称其已被更完善的论文《A Mathematical Framework for Transformer Circuits》取代。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3939 Anthropic 可解释性研究:逆向工程 Transformer 的参数级练习
Anthropic 的 Transformer Circuits 团队发布了一组练习,用于理解神经网络如何在参数层面实现算法,作为其逆向工程 Transformer 数学框架的补充材料。练习要求手动写出注意力头的 W_Q、W_K、W_V、W_out 权重矩阵,涵盖虚拟注意力头、归纳头(指针算术版与前一 token K-Composition 版)等实现,并附有解答。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3939 Anthropic 可解释性研究:机制可解释性、变量与可解释基的重要性
Anthropic 的 Transformer Circuits 可解释性研究笔记提出,机制可解释性可类比为对编译后二进制程序的逆向工程,网络参数对应程序二进制、网络架构对应虚拟机、神经元激活对应变量或内存。作者认为,找到并理解可解释神经元——类似理解程序中的变量——可能是机制可解释性的核心任务,而逆向工程常规程序的经验表明,理解参数这一有限描述是绕开维度灾难的关键路径。
Anthropic:Transformer Circuits(可解释性研究)AI 评分5454 Anthropic 提出 SoLU 激活函数,提升 Transformer 神经元可解释性
Anthropic 在 Transformer Circuits 发表研究,提出用 SoLU(softmax 线性单元)替代 GeLU 激活函数,在盲测实验中将 MLP 神经元可快速解释的比例从约 35% 提升到约 60%,且测试损失和下游 NLP 评测与基线模型大致相当。
Anthropic:Transformer Circuits(可解释性研究)AI 评分5050 Anthropic 研究探究 Transformer 残差流中的特权基现象,初步指向 Adam 优化器
Anthropic Transformer Circuits 团队研究 Transformer 残差流中为什么会出现与标准基对齐的极端离群值(单个坐标可达其他坐标 20 倍以上),理论上残差流各坐标本不应有特殊意义。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4242 Anthropic 解读分布式表征:组合与叠加是两种相互竞争的策略
Anthropic 的可解释性研究笔记指出,"分布式表征"实际包含"组合"与"叠加"两种不同且相互竞争的策略,二者在泛化能力和可线性计算的函数上性质迥异,且存在根本性权衡。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3434 Anthropic 可解释性团队 Circuits Updates:2023 年 7 月研究进展
Anthropic 可解释性团队发布 2023 年 7 月 Circuits Updates,汇总多项尚在萌芽阶段的研究想法。团队重新审视了 Superposition、Memorization 与 Double Descent 中的中间数据区间,认为此前疑似反例的现象实为低维优化失败造成的假象,并发现模型在约 1k 至 500k 样本间会从记忆单点转向记忆相关数据簇。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4141 Anthropic 可解释性团队 Circuits Updates(2024 年 1 月):注意力叠加、字典学习与 MNIST 模型稀疏特征
Anthropic 可解释性团队发布 2024 年 1 月 Circuits Updates,汇总注意力叠加、字典学习等阶段性研究。团队未来数月将聚焦三个方向:字典学习的规模化与科学化、用字典学习攻击真实模型中的注意力叠加、以及在此基础上理解电路。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3939 Anthropic 可解释性团队 Circuits Updates(2024 年 2 月):字典学习中的死亡特征与改进
Anthropic 可解释性团队发布 2024 年 2 月 Circuits Updates,聚焦稀疏自编码器字典学习中的"超低密度特征"问题,认为这类特征因 L1 正则惩罚在找到有用方向前就被杀死。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4040 Anthropic 可解释性团队 2024 年 3 月 Circuits 研究更新
Anthropic 可解释性团队发布 2024 年 3 月 Circuits 更新,展示用稀疏自编码器(SAE)特征替代行为数据集来定位语言模型电路。在 18 层模型第 9 层残差流上,团队用归因分数自动识别出篮球、棒球、网球特征,并找到对篮球特征产生最大直接 logit 效应的注意力头,主要位于第 11、13、14 层。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3838 Anthropic 可解释性团队 Circuits Updates:TopK 与 Gated SAE 对比研究
Anthropic 可解释性团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认两者在 L0/MSE 权衡上均有显著提升且表现相近。在 100 个特征的盲评中,TopK 与 Gated SAE 的特征可解释性未见明显退化,但 TopK 在高密度区间特征更多、平均激活变化更大。团队尚未实现 Gao 等人用于防止死特征的 Ghost Grads 变体。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4444 Anthropic 可解释性团队 Circuits Updates:五大障碍、线性表示与神经网络暗物质
Anthropic 可解释性团队发布 Circuits Updates(2024 年 7 月),汇总五项小型研究进展:叠加问题取得显著进展后浮现的"下一个五大障碍"、什么是线性表示、什么是多维特征、神经网络的暗物质,以及用数据集过滤测量特征敏感度。团队称这些属于初步实验性想法,而非成熟论文,其中"五大障碍"包括缺失特征、跨层叠加、注意力叠加与干扰权重等。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4141 Anthropic 可解释性团队 Circuits Updates:字典学习可解释性评测与 SAE 特征自解释
Anthropic 可解释性团队发布 Circuits Updates,提出两种量化自动可解释性方法,通过测量 Claude 能否借助特征可视化工具准确预测特征激活,来评测字典学习特征的可解释性。其中对比评测用正负句对找出仅对一侧激活的特征,用于衡量特征是否精确对应可解释概念;团队同时给出自解释 SAE 特征的案例研究,并强调这些结果属于初步实验而非成熟论文。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4646 Anthropic 可解释性团队:用字典学习特征训练生物武器危害分类器
Anthropic 可解释性团队初步实验显示,用字典学习得到的特征激活训练生物武器危害分类器,在部分场景下可媲美甚至超过基于原始激活的线性探针,尤其在合成数据上采用上下文 max-pooling 时表现更优。基于特征的决策树性能较弱但更易解释,可视化线性特征分类器还能发现数据集中的虚假相关并据此构造对抗攻击。不过使用特征显著增加复杂度,原始激活仍是强基线。
TensorZero:实验与工程博客AI 评分4747 TensorZero:把 LLM 应用看作 POMDP,而不是 Agent
TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。
TensorZero:实验与工程博客AI 评分3232 某大型银行如何用 LLM 与 TensorZero 自动化代码变更日志
欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4040 Anthropic 可解释性团队 Circuits Updates:稀疏自编码器与 crosscoder 的字典学习优化技巧
Anthropic 可解释性团队分享了训练稀疏自编码器和 crosscoder 的字典学习优化设置,包括 JumpReLU 激活、tanh 稀疏惩罚和 pre-act loss 等技巧。
TensorZero:实验与工程博客AI 评分4242 从 NER 到智能体:自动化提示词工程能否扩展到复杂任务?
TensorZero 团队测试了 MIPRO 自动化提示词优化方法在从命名实体识别(CoNLL++)、多跳检索(HoVer)到文本游戏导航(BabyAI)和智能体工具调用客服(τ-bench)等任务上的表现,探究其随任务复杂度提升的效果变化。MIPRO 通过贝叶斯优化器搜索指令与少样本示例,无需梯度或细粒度标签,团队用约 200 行代码重实现独立版本,指令生成使用 OpenAI 的 o1 模型。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4747 Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征更稠密多义的初步发现
Anthropic 可解释性团队发现,crosscoder 模型差异分析中仅属于单一模型的特征往往更稠密、更多义,激活频率比共享特征高约一个数量级,原因可能是共享特征已能解释两个模型的神经元激活,独占特征需编码更多信息才能争取到特征容量。团队提出给一小部分指定共享特征降低稀疏惩罚的缓解策略,使独占特征更易解释、更单义,并在真实模型上成功分离出可解释的行为差异特征。
TensorZero:实验与工程博客精选AI 评分6969 TensorZero 团队逆向 Cursor 的 LLM 客户端,公开其系统提示词
TensorZero 团队将自研开源网关部署为 Cursor 与 LLM 提供商之间的自托管代理,成功观察并替换 Cursor 的模型调用。
推荐理由:作者以第一手实验给出自建代理查看 Cursor 提示词的完整路径,还分享了系统提示词和模型分层等可复核的细节。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4545 Anthropic 可解释性团队发布注意力机制研究进展:发现注意力叠加与跨层表示证据
Anthropic 可解释性团队报告在真实语言模型中发现注意力叠加(attention superposition)与跨层注意力表示的显著证据,并提出 Multi-Token Transcoders 作为研究 QK 与 OV 条件耦合的实用方法。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4343 Anthropic 可解释性团队 Circuits Updates:失败越狱、可解释稠密特征与入门指南
Anthropic 可解释性团队发布 2025 年 4 月 Circuits Updates,包含失败越狱案例、可解释稠密特征和机制可解释性入门三篇短文。其中对一次失败越狱的电路追踪显示,模型拒绝该提示的原因与论文中基线拒绝不同,且拒绝频率更高,提示词中"make"换成"detect"后模型仍会拒绝。团队称这些属于初步实验,非成熟论文。
Anthropic:Transformer Circuits(可解释性研究)AI 评分5959 Anthropic 开发三个对齐审计智能体并用审计游戏验证其能力与局限
Anthropic 开发了三个自主执行对齐审计任务的智能体,并在含植入缺陷的目标模型上验证。调查智能体在真实条件下以 13% 的成功率解开 Marks et al. 审计游戏,通过外层智能体循环聚合多次调查提升到 42%;评估智能体构建的行为评估在 88% 的运行中区分出有无植入行为的模型;广度优先红队智能体发现 10 个植入行为中的 7 个。
Anthropic:Transformer Circuits(可解释性研究)AI 评分3232 Anthropic 可解释性研究更新:用特征语言重访 Transformer 数学框架,并将可解释性应用于生物学
Anthropic 可解释性团队发布 7 月研究更新,用特征语言重访《A Mathematical Framework for Transformer Circuits》,重新解释 copy head、previous token head 和 induction head 的 OV 与 QK 电路。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4747 Anthropic 提出稀疏线性变换混合 MOLT,作为 transcoder 的替代方案
Anthropic 可解释性团队提出稀疏线性变换混合(MOLT),用稀疏激活的线性变换替代 MLP 层,比 transcoder 更省算力、更忠实于模型机制。MOLT 学习的是对残差流施加线性变换的计算单元,而非嵌入激活空间方向的稀疏特征,可标注 attribution graph 的边。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4444 Anthropic 可解释性研究:当 transcoder 失灵,机制忠实性的玩具模型
Anthropic 的 Chris Olah 发布非正式笔记,用玩具模型展示 transcoder 的机制不忠实问题:在 x→abs(x) 任务中,模型本身没有对重复数据点 p 的特殊概念,但 transcoder 会学出专门激活并输出 p 的"数据点特征",以不同计算机制实现低 MSE 和单义性。作者提出"Jacobian matching"或可缓解该问题,并强调这仍是初步结果,需低置信度看待。
Anthropic:Transformer Circuits(可解释性研究)AI 评分4242 Anthropic 可解释性研究:persona 如何改变 Claude 的回答
Anthropic 可解释性团队用 attribution graph 分析了 Claude Haiku 3.5 在“你是幼儿园学生”系统提示下答错 27 的平方根这一现象,定位到一条把“preschool student”逐步映射为“扮演儿童”并激活“我不知道”的子电路。
Suno:Blog(网页)AI 评分2929 Suno 推出情人节体验:回答三个问题即可为爱人生成歌曲
Suno 上线情人节体验,用户回答三个关于对方的问题后,Suno 会生成三首歌,可在 vdaysong.com 免费试用。该体验灵感来自制作混音带(mixtape)的传统,用户还能在社交媒体分享收到的歌曲,带 @suno_ai_ 标签有机会赢取一束花和三个月 Premier 订阅。
Suno:Blog(网页)精选AI 评分7676 Suno 发布 v3 音乐模型
Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。
推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。
Suno:Blog(网页)AI 评分4646 Suno 完成 1.25 亿美元融资,将加速产品开发
AI 音乐生成公司 Suno 宣布完成 1.25 亿美元融资,投资方包括 Lightspeed Venture Partners、Nat Friedman 和 Daniel Gross、Matrix 及 Founder Collective。资金将用于加速产品开发,并扩充音乐人与技术团队。Suno 称其首款产品发布八个月以来,已有 1000 万人用它创作音乐。