OpenAI 提出 ARGO 方法,将黑盒奖励模型蒸馏为可解释评分标准
OpenAI 发布 ARGO 方法,用强化学习训练策略生成可解释的评分标准,使 rubric 条件下的 LLM 评审与黑盒奖励模型的偏好概率最大化对齐。
OpenAI 发布 ARGO 方法,用强化学习训练策略生成可解释的评分标准,使 rubric 条件下的 LLM 评审与黑盒奖励模型的偏好概率最大化对齐。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。
推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。
上海人工智能实验室 InternLM 团队发布 Visual-ERM,一个面向视觉等价性的奖励模型,论文被 NeurIPS 2026 收录,官方实现已开源。该模型用于对视觉等价性进行奖励建模,代码已在 InternLM 项目下公开。
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。
Together AI 等团队发布 FlashAttention-4,通过算法与内核协同设计在 Blackwell B200 上最大化 matmul 与其他资源瓶颈的重叠。
Together AI 发布 SF Streets 和 US Streets 两个语音识别基准,测试 15 个模型在街名转写上的表现,平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
上海人工智能实验室 InternLM 团队开源了 ICLR 2026 论文 "Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing" 的官方代码库 InternLM/VSR,提出以像素引导的视觉自精炼范式提升图表解析准确率。该工作聚焦图表解析任务,通过像素级引导实现自我修正。
Jakub Pachocki 表示看好 First Proof 挑战,认为前沿新研究可能是评估下一代 AI 模型能力最重要的方式。
蚂蚁 inclusionAI 公开 ZwZ(Zooming-without-Zooming)模型家族,在细粒度感知任务上取得 SOTA 表现,相关论文已被 ICML 2026 收录。同时发布 ZoomBench,一个面向细粒度感知的新挑战性评测基准。
Together AI 研究团队通过近无约束生成实验(如 "Actually"、"Let's think step by step" 等中性种子提示,移除聊天模板和系统提示)研究 LLM 的默认行为,发现各模型家族具有稳定且可解释的知识先验。
上海人工智能实验室 InternLM 推出 EMemBench,一个面向 VLM 智能体的情景记忆交互式基准,论文已被 EMNLP 2026 Findings 收录。该基准以交互方式评测智能体的情景记忆能力,官方仓库已同步开放。
OpenAI 发布实验性数据集 CoVal,将价值观敏感的提示词与众包撰写的可审计评分标准配对,记录人们偏好某个模型回复的具体理由而非仅选择结果。CoVal 含保留多元甚至冲突标准的 CoVal-full 和每提示词保留 4 条高评分兼容标准的 CoVal-core 两种形式,其评分可预测样本外人类排名,并揭示 GPT-5 系列模型的行为差异。
OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了信息估计与下游解码性能的一致性,优化后的设计达到 SOTA 端到端方法水平,同时所需内存和算力更少,且无需任务专用解码器设计。
OpenAI 发现,在 GPT-4o base 上对 2M 潜变量 SAE 做激活引导,可让经不良建议微调而涌现性失准的模型重新对齐。这些在微调后激活下降的底部潜变量多与"有帮助的助手"人设相关,且只能单向抑制失准,与既能驱动也能消除失准的失准人设潜变量形成不对称。
OpenAI Alignment 团队发布生产评测(production evaluations)方法,用去标识的 ChatGPT 生产流量剥离最终回复后重采样新模型输出,再用 LLM 监测器发现新的未对齐行为并估计其发生率。
推荐理由:OpenAI 团队详述了用去标识生产流量构建对齐评测的完整流程、验证数据和局限,读者可以据此理解生产评测如何降低评估感知。
OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。
上海人工智能实验室 InternLM 团队发布 ARM-Thinker,通过智能体工具调用与视觉推理强化多模态生成式奖励模型,论文已被 CVPR 2026 收录,官方代码同步开源。
上海人工智能实验室 InternLM 团队开源 ARC-VL,为 CVPR 2026 论文《Think Visually, Reason Textually: Vision-Language Synergy in ARC》的官方实现。该方法在 ARC 任务中让视觉与语言协同工作,以视觉方式进行思考、以文本方式进行推理。
伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。
上海人工智能实验室 InternLM 团队发布 Spatial-SSRL,通过自监督强化学习提升模型的空间理解能力,相关论文已被 CVPR 2026 收录。该项目为官方开源发布。
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
上海人工智能实验室 InternLM 团队提出 JanusCoder,目标是构建面向代码智能的基础视觉-程序化接口,该工作已被 ICLR 2026 接收。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
上海人工智能实验室 InternLM 项目发布 StarBench,用于探测音频 4D 智能中的深度时空推理能力,相关论文已被 ICLR 2026 接收。该工作以官方实现形式开源,聚焦音频场景下的时空推理评测。
Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。
上海人工智能实验室 InternLM 项目开源了 Spark,这是论文《SPARK: Synergistic Policy And Reward Co-Evolving Framework》的官方实现,将策略与奖励的协同演化整合进同一框架。
上海人工智能实验室 InternLM 团队开源 CapRL 官方实现,通过强化学习提升模型的密集图像描述能力,论文已被 ICLR 2026 接收。
上海人工智能实验室 InternLM 团队开源了 SIM-CoT(Supervised Implicit Chain-of-Thought)的官方实现,该工作已被 ICLR 2026 接收。SIM-CoT 通过监督方式实现隐式思维链推理,代码已在 GitHub 公开。
Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。
推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。
BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),并经 Resilio 和 Hubblo 同行评审。
推荐理由:原文给出了 Mistral Large 2 全生命周期的具体碳、水和资源消耗数字,并说明其对选型与采购的意义。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
Answer.AI 发布 ModernBERT-Large-Instruct,一个在 ModernBERT-Large(395M 参数)上用 FLAN 指令微调的编码器模型,直接用 MLM 头做分类和选择题,无需架构改动。