跳到正文

全部动态

今日 172 条
1月13日周二
  1. OpenAI:Alignment 研究博客(RSS)47

    OpenAI 为何看好"confessions":让模型自我坦白以提升诚实性

    OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。

1月12日周一
1月10日周六
  1. BAIR:Berkeley AI Research Blog28

    伯克利提出信息驱动成像系统设计框架,无需任务专用解码器

    伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了信息估计与下游解码性能的一致性,优化后的设计达到 SOTA 端到端方法水平,同时所需内存和算力更少,且无需任务专用解码器设计。

12月30日周二
12月23日周二
12月19日周五
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 发布生产评测方法,用去标识 ChatGPT 流量规避评估感知并预测模型未对齐行为

    OpenAI Alignment 团队发布生产评测(production evaluations)方法,用去标识的 ChatGPT 生产流量剥离最终回复后重采样新模型输出,再用 LLM 监测器发现新的未对齐行为并估计其发生率。

    推荐理由:OpenAI 团队详述了用去标识生产流量构建对齐评测的完整流程、验证数据和局限,读者可以据此理解生产评测如何降低评估感知。

12月12日周五
12月2日周二
  1. OpenAI:Alignment 研究博客(RSS)42

    OpenAI 用稀疏自编码器潜在归因调试模型失准补全

    OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。

11月24日周一
11月20日周四
11月1日周六
  1. BAIR:Berkeley AI Research Blog47

    无需 TD 学习的强化学习:用分治法扩展 off-policy RL

    伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。

10月29日周三
10月27日周一
  1. Thinking Machines Lab:官方博客(RSS)64

    Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果

    Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。

    推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。

10月20日周一
10月13日周一
9月29日周一
9月28日周日
9月26日周五
  1. Thinking Machines Lab:官方博客(RSS)45

    Thinking Machines Lab 提出模块化流形与流形版 Muon 优化器

    Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。

9月23日周二
9月1日周一
  1. BAIR:Berkeley AI Research Blog50

    word2vec 究竟学到了什么?BAIR 给出闭式学习理论

    BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。

8月30日周六
6月5日周四
3月24日周一
2月26日周三
8月21日周三