并非每个 Token 都值得蒸馏:Direct-OPD 的选择性监督方法 S²D-OPD
针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。
针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。
研究者提出 Agentic Idea Manager(AIM)框架,把研究想法的管理作为自动化研究的核心环节,将想法组织成语义聚类、用实验证据评估其潜力,并自适应分配实验预算。
研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 以原子断言方式评估物理描述。在 Wan 与 Cosmos 骨干上的四项物理视频基准实验中,物理合理性均有提升;基于开源 Cosmos3-Nano 的增强模型超过了闭源 Veo 3.1。
DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整个回答。在 Qwen3 和 Llama 上,其平均宏准确率超越全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等任务混合上领先。消融显示,联合结果设计贡献了主要增益。
研究分析 JEV 1.13 与三个开源 KEV 模型,发现直接决策模型存在"序数尺度利用偏差":在 36 个序数数据集上,最终决策仅使用 67–76% 的有效 gold 支持,而四个名义任务为 87–102%。
RSIGame 是一个带递归自我改进的自主智能体游戏开发框架,通过局部“探索-诊断-改进”循环与全局质量跟踪循环,在 140 个 GameCraft-Bench 任务、两个游戏引擎和五种生成器上以相同开发预算稳定提升游戏质量。
研究者提出 RoboCoach,一个由世界模型引导的教练框架,通过 Route-Imagine-Diagnose-Improve(RIDI)循环在共享世界模型 COACHWORLD 中执行可复用技能专家,并用进度评判器定位首个失败子任务,从而决定采集哪些演示、更新哪些专家适配器。
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。
论文提出对 LLM 涌现性失对齐(EM)的动态二阶几何研究:训练轨迹显示方向性 Hessian 曲率集中在语义关键 token 上,Grassmannian 投影表明有害-安全差距扩大主要源于安全梯度重叠下降。
‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
研究揭示在线策略蒸馏(OPD)在弱到强、同基座和强到弱师生设置下的缩放规律:早期训练中,留出准确率(gold score)随学生初始化 token 级反向 KL 散度的平方根近似线性上升。
论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
FinnGen 研究团队构建了人群规模的免疫多组学图谱,通过单核 caQTL、eQTL 与 peak–gene link 分析揭示调控性疾病的遗传机制。相关汇总统计数据已公开并可交互浏览,个体级单核计数矩阵等数据需经审批后向研究者开放。研究还整合了 BBJ、日本 COVID-19 工作组及 eQTL Catalogue、TenK10K、SingleBrain 等数据集进行再分析。
Anthropic 在 Transformer Circuits 发表研究,提出用 SoLU(softmax 线性单元)替代 GeLU 激活函数,在盲测实验中将 MLP 神经元可快速解释的比例从约 35% 提升到约 60%,且测试损失和下游 NLP 评测与基线模型大致相当。
Anthropic Transformer Circuits 团队研究 Transformer 残差流中为什么会出现与标准基对齐的极端离群值(单个坐标可达其他坐标 20 倍以上),理论上残差流各坐标本不应有特殊意义。
Anthropic 可解释性团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认两者在 L0/MSE 权衡上均有显著提升且表现相近。在 100 个特征的盲评中,TopK 与 Gated SAE 的特征可解释性未见明显退化,但 TopK 在高密度区间特征更多、平均激活变化更大。团队尚未实现 Gao 等人用于防止死特征的 Ghost Grads 变体。
UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。
Prime Intellect 发布 OpenDiLoCo,一个对 DeepMind DiLoCo 方法的开源实现与扩展,代码见 https://github.com/PrimeIntellect-ai/OpenDiLoCo,论文见 https://arxiv.org/abs/2407.07852。
Prime Intellect 通过对合成推理轨迹做微调来改进在线强化学习的策略初始化,训练出 7B 数学推理模型 INTELLECT-MATH,在多个数学推理基准上超过 Eurus-2-7B-PRIME,并以 10 倍更少的 GPU 小时达到同等性能(47 步 RL 对比 592 步)。
Prime Intellect 推出 SYNTHETIC-1,基于 DeepSeek-R1 生成 140 万条覆盖数学、编程、软件工程、STEM 和合成代码理解的任务与验证器,目标是构建最大的开源验证推理数据集。
Prime Intellect 发布 SYNTHETIC-1,一个由全球算力贡献者协作生成、基于 DeepSeek-R1 的 200 万条推理轨迹开放数据集,覆盖数学、编码和科学任务,并用任务专属验证器确认正确性。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布研究文章,提出在 RL 训练中同时用 SFT(正恒定优势、无额外前向开销)让模型预测工具输出,即 ECHO 方法。
METR 研究人员对 NanoGPT speedrun 的 77 条记录分类,2024 年 5 月至 2026 年 3 月间 36 名贡献者将训练时间从 45 分钟降到 1.43 分钟,共 31x 提速。
Liquid AI 提出基于进化算法的 STAR 方法,可自动合成定制化神经网络架构,并已用其生成数百种设计,在质量上超过强 Transformer 与混合架构基线,同时缓存和参数量更小。
Epoch AI 的 AI chip sales 数据页追踪并估算主要 AI 芯片的销量与出货量,以及估算的总算力、成本和功耗。数据主要来自公司财报评论、分析师估算和媒体报道,提供按芯片类型、组织和按芯片时间线的 CSV 及 ZIP 打包下载,更新至 Aug. 27, 2026,并附 H100e 算力口径等常见问题说明。
Epoch AI 通过标注知名 AI 模型训练所用的芯片来识别 ML 硬件,并补充了虽未见于这些系统训练记录、但依据描述、支持的数值格式或同族关系可判定为 ML 用途的硬件。该数据集为每块芯片记录数据手册信息,涵盖算力、裸片面积等,并借助新闻报道或硬件价格档案补充发布时价格;并非所有硬件都有完整或适用的信息,因此部分字段常为空。
Epoch AI 的 Epoch Capabilities Index(ECI)是一个综合指标,用超过 50 个基准的分数生成单一通用能力量表,模型在更难基准上表现越好,ECI 分数越高。其领域版 ECI 沿用通用 ECI 的基准难度与斜率、仅重新拟合 LLM 能力参数,Cyber ECI 因纳入通用 ECI 之外的网络安全基准而更新频率更低。ECI 代码已在公开仓库发布。
Epoch AI 与 Ipsos 合作在 KnowledgePanel 上开展 AI 使用民调,于 2026 年 7 月 10-19 日访问 1,103 名在职美国成年人,并新增个体级微观数据下载(SPSS .sav 与 CSV)。
Epoch AI 上线"AI companies"数据集,追踪处于 AI 前沿的基座模型公司的营收、融资、员工数、算力支出和使用量数据,来源为公司披露、高管表态与媒体报道。数据集于 2026 年 9 月 29 日更新,提供全量 ZIP 及算力支出、融资轮次、员工、营收、使用量等分项 CSV,可通过 Python 直接读取。
Epoch AI 上线 AI 模型数据集,收录文献综述、Papers With Code、高被引论文及顶会论文等来源的模型,覆盖发布时达到 SOTA、引用超 1000 次或月活超百万的模型。数据集提供 notable、large-scale、frontier 及全量模型四类 CSV 下载,最新更新于 2026 年 9 月 30 日,并附参数规模、数据集大小与训练算力的测算文档。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
EasyPPO 通过仅对 actor 做过长过滤、按采样回报标准差倒数对 critic 回归加权、以及适度缩小 critic mini-batch,解决了 PPO 训练大语言模型时 critic 的两类失稳问题。
ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
SAKI(Supervision Allocation with KL-constrained Interpolation)通过 KL 约束的教师引导 rollout 与最大耦合,将 token 级监督路由到接受与纠正两类位置,纠正概率恰为 TV(p_t, q_t)。
研究提出关系型上下文学习(ICL)中的"支持集目标泄漏"问题:带标签支持集含目标衍生(leaker)列而查询集干净,与数据集构建、时序切分或表示学习阶段的泄漏不同。
HyperZip 是一个基于扩散 LLM(dLLM)与 Multi-Token Prediction 的 LLM 数据压缩框架,通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据。它针对扩散压缩中解码吞吐量提升会降低压缩率的权衡,实现了低压缩率与高吞吐的兼顾,在压缩率与速度的权衡上优于现有 SOTA 基线。