OpenAI 为何看好"confessions":让模型自我坦白以提升诚实性
OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。
OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。
OpenBMB(清华 NLP)公开 MetaMem 代码仓库,对应其 ACL '26 Findings 论文《MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization》。该方法通过自反思符号优化演化元记忆,以提升知识利用能力。
DeepSeek 在 GitHub 新仓库 Engram 中提出「条件记忆」——通过可扩展查找为大型语言模型开辟稀疏性的新维度。该工作将记忆与稀疏激活结合,作为独立于 MoE 的稀疏轴。
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了信息估计与下游解码性能的一致性,优化后的设计达到 SOTA 端到端方法水平,同时所需内存和算力更少,且无需任务专用解码器设计。
Ahead of AI 作者发布了 2025 年 7 月至 12 月的 LLM 研究论文书签清单,按推理模型、强化学习、推理时扩展、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态与视觉语言模型、数据与预训练等类别整理。
OpenAI 发现,在 GPT-4o base 上对 2M 潜变量 SAE 做激活引导,可让经不良建议微调而涌现性失准的模型重新对齐。这些在微调后激活下降的底部潜变量多与"有帮助的助手"人设相关,且只能单向抑制失准,与既能驱动也能消除失准的失准人设潜变量形成不对称。
OpenAI Alignment 团队发布生产评测(production evaluations)方法,用去标识的 ChatGPT 生产流量剥离最终回复后重采样新模型输出,再用 LLM 监测器发现新的未对齐行为并估计其发生率。
推荐理由:OpenAI 团队详述了用去标识生产流量构建对齐评测的完整流程、验证数据和局限,读者可以据此理解生产评测如何降低评估感知。
OpenBMB(清华 NLP)在 GitHub 开源 SciCore-Mol,通过可插拔的分子认知模块增强大语言模型的分子理解能力。该工作将分子认知能力以模块化方式接入 LLM,而非改造模型本身。
OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。
上海人工智能实验室 InternLM 团队发布 ARM-Thinker,通过智能体工具调用与视觉推理强化多模态生成式奖励模型,论文已被 CVPR 2026 收录,官方代码同步开源。
上海人工智能实验室 InternLM 团队开源 ARC-VL,为 CVPR 2026 论文《Think Visually, Reason Textually: Vision-Language Synergy in ARC》的官方实现。该方法在 ARC 任务中让视觉与语言协同工作,以视觉方式进行思考、以文本方式进行推理。
伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。
上海人工智能实验室 InternLM 团队发布 Spatial-SSRL,通过自监督强化学习提升模型的空间理解能力,相关论文已被 CVPR 2026 收录。该项目为官方开源发布。
FireRedTeam 提出 IVC-Prune,通过揭示 LVLM 中的隐式视觉坐标来剪枝视觉 token。该方法针对大视觉语言模型(LVLM)中视觉 token 冗余问题,利用模型内部隐含的坐标信息判断 token 重要性。
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
上海人工智能实验室 InternLM 团队提出 JanusCoder,目标是构建面向代码智能的基础视觉-程序化接口,该工作已被 ICLR 2026 接收。
OpenBMB(清华 NLP)发布 DeepThinkVLA,用于增强视觉-语言-动作(VLA)模型的推理能力。该仓库已在 GitHub 上线,具体模型规模、benchmark 分数与可用方式尚未在现有信息中披露。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
FireRedTeam 开源了论文《InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention》的官方实现,该论文已被 NeurIPS 2025 收录。方法通过实例组装注意力机制实现布局感知的图像生成。
上海人工智能实验室 InternLM 项目发布 StarBench,用于探测音频 4D 智能中的深度时空推理能力,相关论文已被 ICLR 2026 接收。该工作以官方实现形式开源,聚焦音频场景下的时空推理评测。
Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。
上海人工智能实验室 InternLM 项目开源了 Spark,这是论文《SPARK: Synergistic Policy And Reward Co-Evolving Framework》的官方实现,将策略与奖励的协同演化整合进同一框架。
上海人工智能实验室 InternLM 团队开源 CapRL 官方实现,通过强化学习提升模型的密集图像描述能力,论文已被 ICLR 2026 接收。
上海人工智能实验室 InternLM 团队开源了 SIM-CoT(Supervised Implicit Chain-of-Thought)的官方实现,该工作已被 ICLR 2026 接收。SIM-CoT 通过监督方式实现隐式思维链推理,代码已在 GitHub 公开。
BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。
安全研究员 Johann Rehberger 在 Month of AI Bugs 期间发布 AgentHopper,一个利用 GitHub Copilot、Amp Code、Amazon Q Developer 和 AWS Kiro 间接提示词注入远程代码执行漏洞实现跨智能体传播的 AI 病毒概念验证。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
FireRedTeam 提出 CQ-DINO,通过类别查询缓解广词表目标检测中的梯度稀释问题。该方法针对词表规模庞大时检测性能下降的痛点,用类别查询机制改善梯度传播。
DeepSeek 在 GitHub 开源双向流水线并行算法 DualPipe,用于 DeepSeek V3/R1 训练中的计算与通信重叠。该算法通过双向流水线调度实现计算与通信的 overlap,仓库路径为 deepseek-ai/DualPipe。
FireRedTeam 开源 Target-Driven-Distillation 项目,用目标时间步选择与解耦引导改进一致性蒸馏。该方法面向扩散模型蒸馏场景,通过挑选目标时间步并解耦引导信号来提升生成一致性。项目已公开,具体效果与评测数据未在原文中给出。