OpenAI 用稀疏自编码器潜在归因调试模型失准补全
OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。
OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。
上海人工智能实验室 InternLM 团队发布 ARM-Thinker,通过智能体工具调用与视觉推理强化多模态生成式奖励模型,论文已被 CVPR 2026 收录,官方代码同步开源。
上海人工智能实验室 InternLM 团队开源 ARC-VL,为 CVPR 2026 论文《Think Visually, Reason Textually: Vision-Language Synergy in ARC》的官方实现。该方法在 ARC 任务中让视觉与语言协同工作,以视觉方式进行思考、以文本方式进行推理。
伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。
上海人工智能实验室 InternLM 团队发布 Spatial-SSRL,通过自监督强化学习提升模型的空间理解能力,相关论文已被 CVPR 2026 收录。该项目为官方开源发布。
FireRedTeam 提出 IVC-Prune,通过揭示 LVLM 中的隐式视觉坐标来剪枝视觉 token。该方法针对大视觉语言模型(LVLM)中视觉 token 冗余问题,利用模型内部隐含的坐标信息判断 token 重要性。
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
上海人工智能实验室 InternLM 团队提出 JanusCoder,目标是构建面向代码智能的基础视觉-程序化接口,该工作已被 ICLR 2026 接收。
OpenBMB(清华 NLP)发布 DeepThinkVLA,用于增强视觉-语言-动作(VLA)模型的推理能力。该仓库已在 GitHub 上线,具体模型规模、benchmark 分数与可用方式尚未在现有信息中披露。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
FireRedTeam 开源了论文《InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention》的官方实现,该论文已被 NeurIPS 2025 收录。方法通过实例组装注意力机制实现布局感知的图像生成。
上海人工智能实验室 InternLM 项目发布 StarBench,用于探测音频 4D 智能中的深度时空推理能力,相关论文已被 ICLR 2026 接收。该工作以官方实现形式开源,聚焦音频场景下的时空推理评测。
Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。
上海人工智能实验室 InternLM 项目开源了 Spark,这是论文《SPARK: Synergistic Policy And Reward Co-Evolving Framework》的官方实现,将策略与奖励的协同演化整合进同一框架。
上海人工智能实验室 InternLM 团队开源 CapRL 官方实现,通过强化学习提升模型的密集图像描述能力,论文已被 ICLR 2026 接收。
上海人工智能实验室 InternLM 团队开源了 SIM-CoT(Supervised Implicit Chain-of-Thought)的官方实现,该工作已被 ICLR 2026 接收。SIM-CoT 通过监督方式实现隐式思维链推理,代码已在 GitHub 公开。
BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。
安全研究员 Johann Rehberger 在 Month of AI Bugs 期间发布 AgentHopper,一个利用 GitHub Copilot、Amp Code、Amazon Q Developer 和 AWS Kiro 间接提示词注入远程代码执行漏洞实现跨智能体传播的 AI 病毒概念验证。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
FireRedTeam 提出 CQ-DINO,通过类别查询缓解广词表目标检测中的梯度稀释问题。该方法针对词表规模庞大时检测性能下降的痛点,用类别查询机制改善梯度传播。
DeepSeek 在 GitHub 开源双向流水线并行算法 DualPipe,用于 DeepSeek V3/R1 训练中的计算与通信重叠。该算法通过双向流水线调度实现计算与通信的 overlap,仓库路径为 deepseek-ai/DualPipe。
FireRedTeam 开源 Target-Driven-Distillation 项目,用目标时间步选择与解耦引导改进一致性蒸馏。该方法面向扩散模型蒸馏场景,通过挑选目标时间步并解耦引导信号来提升生成一致性。项目已公开,具体效果与评测数据未在原文中给出。