生成式行为克隆中的多模态性研究:确定性回归为何在仿真基准上依然有效
一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。
一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。
论文提出对 LLM 涌现性失对齐(EM)的动态二阶几何研究:训练轨迹显示方向性 Hessian 曲率集中在语义关键 token 上,Grassmannian 投影表明有害-安全差距扩大主要源于安全梯度重叠下降。
受 HBM4 基片 4nm 工艺需求增长带动,三星晶圆代工与 System LSI 业务 2026 年合并营业亏损预计同比收窄 41.8%,从 6.74 万亿韩元降至 3.92 万亿韩元。三星今年 2 月启动 HBM4 量产出货,第三季度 HBM4 收入预计环比增长三倍以上,并已于 7 月上调 4nm 新订单价格,部分先进节点涨幅达 10% 至 15%。
Databricks 宣布 IP Functions 正式 GA,将 IP 地址分析变为 Lakehouse 上原生高性能 SQL 工作负载,可统一处理 IPv4 与 IPv6、原生支持 CIDR 表示法并由 Photon 加速。
受全球 AI 需求持续拉动半导体出货,韩国 9 月出口延续强劲增长,经工作日调整后同比增长 104.9%。韩国海关称,2026 年前九个月出口额达创纪录的 8145 亿美元,首次突破 8000 亿美元。
‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
Bloomberg《The Close》节目播出“September Market Recap & Micron’s AI Boom”,聚焦 Micron 在 AI 热潮中的表现与 9 月市场收官行情。
Micron 给出的本季度销售指引大幅超出市场预期,AI 建设热潮推动内存需求达到前所未有的水平。Gabelli 分析师 Hendi Susanto 指出,投资者要求 Micron 下一财年营收和利润翻倍,超大规模云厂商正提前锁定多年内存供应并附带定价窗口,他认为本轮周期与以往内存行业繁荣萧条有所不同。
Databricks 发布新的 AI Function ai_decide,由 TypeSafe AI 的决策模型 Jev 驱动,对文本评估一个问题或多个问题,在不到一秒内返回概率、命名选项中的选择或有序量表上的分数,延迟和成本低于用 LLM 做同类任务。
研究揭示在线策略蒸馏(OPD)在弱到强、同基座和强到弱师生设置下的缩放规律:早期训练中,留出准确率(gold score)随学生初始化 token 级反向 KL 散度的平方根近似线性上升。
美光(Micron)给出的本财季(截至 11 月)营收指引约为 615 亿美元,高于分析师平均预期的 568 亿美元;剔除部分项目后每股利润预计约 38.15 美元,超过 36.02 美元的预期。公司称 AI 建设带来前所未有的需求,推动需求超过供给,但标题同时提到加薪压缩了利润率。
NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。
作者用 PyTorch 从零实现并训练了一个 124M 参数的 GPT-2 风格 decoder-only Transformer,配置为 768 维嵌入、12 头注意力、12 层、词表 50,257、最大序列长度 512。
Cyclone Impact Forecaster 用 61 条 EM-DAT 历史气旋记录训练出一个 2 参数对数线性模型,为北印度洋气旋影响半径内的每个地区输出受灾人口排名及 10-90% 预测区间,并叠加 XGBoost 的 6 小时风速强度预测,在 MapLibre GL 3D 卫星地球上可视化。
论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。
Reddit 为打击爬虫和自动化流量进一步限制 Old Reddit,未来几个月内用户需已登录且在过去六个月内使用过 Old Reddit 才能继续使用,版主可豁免近期使用要求。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
FinnGen 研究团队构建了人群规模的免疫多组学图谱,通过单核 caQTL、eQTL 与 peak–gene link 分析揭示调控性疾病的遗传机制。相关汇总统计数据已公开并可交互浏览,个体级单核计数矩阵等数据需经审批后向研究者开放。研究还整合了 BBJ、日本 COVID-19 工作组及 eQTL Catalogue、TenK10K、SingleBrain 等数据集进行再分析。
This is Kled V3. We've solved data collection for artificial general intelligence. Any consumer dataset that can exist, can now be collected from physical reality in under 72 hours. All powered by the largest and most comprehensive data application layer on the planet. (Thread)
Anthropic 在 Transformer Circuits 发表研究,提出用 SoLU(softmax 线性单元)替代 GeLU 激活函数,在盲测实验中将 MLP 神经元可快速解释的比例从约 35% 提升到约 60%,且测试损失和下游 NLP 评测与基线模型大致相当。
Anthropic Transformer Circuits 团队研究 Transformer 残差流中为什么会出现与标准基对齐的极端离群值(单个坐标可达其他坐标 20 倍以上),理论上残差流各坐标本不应有特殊意义。
Anthropic 可解释性团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认两者在 L0/MSE 权衡上均有显著提升且表现相近。在 100 个特征的盲评中,TopK 与 Gated SAE 的特征可解释性未见明显退化,但 TopK 在高密度区间特征更多、平均激活变化更大。团队尚未实现 Gao 等人用于防止死特征的 Ghost Grads 变体。
Sarvam AI 发布开源模型 Sarvam-M,基于 24B 的 Apache 2.0 模型 Mistral Small,经 SFT 和 RLVR 后训练而成,支持 think 与 non-think 两种模式。
UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。
Prime Intellect 发布文章,梳理全球分布式训练的前沿方法,以应对开源社区难以匹敌闭源厂商大规模 H100 集群的困境。
Prime Intellect 发布 OpenDiLoCo,一个对 DeepMind DiLoCo 方法的开源实现与扩展,代码见 https://github.com/PrimeIntellect-ai/OpenDiLoCo,论文见 https://arxiv.org/abs/2407.07852。
Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。
推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。
Prime Intellect 发布 INTELLECT-1,一个在五大国家、三大洲用最多 112 张 H100 协作训练的 10B 参数语言模型,训练 1T tokens 历时 42 天,基于 Llama-3 架构。
推荐理由:原文给出分布式训练的关键数字与方法细节,读者可以了解社区协作训练大模型的可行路径。
Prime Intellect 通过对合成推理轨迹做微调来改进在线强化学习的策略初始化,训练出 7B 数学推理模型 INTELLECT-MATH,在多个数学推理基准上超过 Eurus-2-7B-PRIME,并以 10 倍更少的 GPU 小时达到同等性能(47 步 RL 对比 592 步)。
Prime Intellect 推出 SYNTHETIC-1,基于 DeepSeek-R1 生成 140 万条覆盖数学、编程、软件工程、STEM 和合成代码理解的任务与验证器,目标是构建最大的开源验证推理数据集。
Prime Intellect 发布 SYNTHETIC-1,一个由全球算力贡献者协作生成、基于 DeepSeek-R1 的 200 万条推理轨迹开放数据集,覆盖数学、编码和科学任务,并用任务专属验证器确认正确性。
Prime Intellect 发布 INTELLECT-2,以 QwQ-32B 为基座,用 GRPO 和可验证奖励进行全球首个 32B 参数的无许可分布式强化学习训练,任何人可贡献异构算力。
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect 发布 PCCL(Prime Collective Communications Library),一个为跨全球分布式训练构建的容错集合通信库。
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。
推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。
Prime Intellect 宣布其自我改进智能体训练平台 Lab 结束 beta,正式全面开放。平台以环境为核心抽象,提供托管训练、托管评估、Environments Hub、adapter 部署和 Prime Inference 等组件,覆盖评估、训练、检查、部署的完整循环;beta 期间数百名用户已运行超 10,000 个训练任务。