跳到正文

#论文/研究

今日 45 条
12月23日周二
12月19日周五
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 发布生产评测方法,用去标识 ChatGPT 流量规避评估感知并预测模型未对齐行为

    OpenAI Alignment 团队发布生产评测(production evaluations)方法,用去标识的 ChatGPT 生产流量剥离最终回复后重采样新模型输出,再用 LLM 监测器发现新的未对齐行为并估计其发生率。

    推荐理由:OpenAI 团队详述了用去标识生产流量构建对齐评测的完整流程、验证数据和局限,读者可以据此理解生产评测如何降低评估感知。

12月12日周五
12月2日周二
  1. OpenAI:Alignment 研究博客(RSS)42

    OpenAI 用稀疏自编码器潜在归因调试模型失准补全

    OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。

11月24日周一
11月20日周四
11月1日周六
  1. BAIR:Berkeley AI Research Blog47

    无需 TD 学习的强化学习:用分治法扩展 off-policy RL

    伯克利 AI 研究博客提出一种不依赖时序差分(TD)学习的 off-policy RL 新范式——分治法,通过将轨迹对半切分并组合子段价值来更新价值函数,理论上把 Bellman 递归次数从线性降为对数级。该工作与 Aditya 合作,首次将分治价值学习扩展到目标条件 RL 中的高复杂度任务,且无需像 n-step TD 那样调节超参数 n。目前仍待解决的是如何选取最优子目标 w。

10月29日周三
10月27日周一
  1. Thinking Machines Lab:官方博客(RSS)64

    Thinking Machines Lab 发布 On-Policy Distillation 方法:以更低成本逼近 RL 训练效果

    Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。

    推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。

10月20日周一
10月13日周一
9月29日周一
9月28日周日
9月26日周五
  1. Thinking Machines Lab:官方博客(RSS)45

    Thinking Machines Lab 提出模块化流形与流形版 Muon 优化器

    Thinking Machines Lab 提出将神经网络各层权重约束在子流形上的思路,并给出权重约束在 Stiefel 流形(条件数为 1 的矩阵流形)上的流形版 Muon 优化器,该工作基于 Jianlin Su 与 Franz Louis Cesista 的研究。文章还提出"模块化流形"概念,即一种可组合流形,目标是让大型网络的扩展与训练更容易,并希望社区在文末列出的方向上继续推进。

9月23日周二
9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)66

    Thinking Machines Lab 解析 LLM 推理非确定性的真正成因并发布批不变 kernel

    Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。

    推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。

9月1日周一
  1. BAIR:Berkeley AI Research Blog50

    word2vec 究竟学到了什么?BAIR 给出闭式学习理论

    BAIR 新论文证明,在若干温和近似下 word2vec 的学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示就是 PCA。从小初始化训练时,word2vec 按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即目标矩阵 M* 的顶部特征向量,可由语料统计与超参数预先算出。

7月23日周三
6月5日周四
4月15日周二
3月24日周一
2月26日周三
2月10日周一
1月7日周二
11月28日周四
8月21日周三
6月26日周二
  1. Sam Altman:Blog(RSS)75

    Sam Altman 谈 OpenAI 强化学习进展:5 个智能体击败 Dota 半职业选手

    OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。