vime 支持 ROCm:在 AMD Instinct GPU 上端到端运行 RL 后训练
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。
Google Research 发布 SensorFM,一个大传感器基础模型,用来自 500 万名同意参与研究者的超过一万亿分钟无标签多模态可穿戴数据进行自监督预训练,覆盖 100 多个国家、20 多种 Fitbit 和 Pixel Watch 设备。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
研究者提出 DiScoFormer(Density and Score Transformer),给定一组数据点即可在单次前向传播中同时估计分布的密度与 score,无需针对新分布重新训练。
蚂蚁 inclusionAI 在 GitHub 开源 AReno,一个易用且快速的工具包,用于在单节点上扩展强化学习后训练。该工具定位为轻量级 RL post-training 方案,具体性能数据与支持模型尚未在仓库说明中披露。
vLLM 社区发布开源 RL 后训练框架 vime(Apache 2.0),基于 slime 的训练栈和数据生成设计,将 Megatron 训练与 vLLM 推理接入同一条解耦管线。
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。
推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。
Nous Research 在 GitHub 上线 Automodel,这是一个基于 PyTorch 原生分布式、面向 LLM 与 VLM 的训练库,开箱即支持 Hugging Face。
Nous Research 在 GitHub 新建 Megatron-LM 仓库,用于持续开展大规模 Transformer 模型训练研究。该仓库定位为规模化训练 Transformer 的持续性研究项目,目前公开信息仅包含这一句描述,未披露模型规模、参数或具体训练细节。
Nous Research 推出 Megatron-Bridge,一个面向 Megatron 系列模型的训练库,支持与 Hugging Face 的双向转换。该库同时提供模型训练能力与 Hugging Face 格式互转功能。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等实体产业的物理 AI 基础研究。其成果包括 AB-UPT 物理 Transformer,可在单张 GPU 上处理 9M 表面与 140M 体积网格的原始几何数据而无需重新划分网格;NeuralDEM 则是首个面向大规模多物理过程的端到端深度学习代理模型,支持流化床反应器等工业过程的实时仿真。
说到最爱的滤波器…… 最初的出现,大多是偶然 @TacoCohen:我记得那时候,一次成功的实验就是能产出很酷的滤波器
I remember the days when a successful experiment was one that produced cool filters
Google Research 公布其开放科学资源进展:十余年积累的开源工具与开放数据集已服务全球超 25 万名研究者和开发者。
Together AI 与 Adaption 合作,把 Together Fine-Tuning 接入 Adaptive Data,用户可在该平台优化训练数据集后直接执行微调并部署评估。
Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)架构,将训练拆分到异步解耦的计算岛(learner units),隔离硬件故障让其他部分继续训练。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升为虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让世界模型的长时程规划更稳健。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,将小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Together AI 提出稳定循环架构 Parcae,通过将激活多次穿过同一批层来增加计算量,验证困惑度较此前大规模循环模型最多降低 6.3%。770M Parcae 在相同数据上追平 1.3B 参数 Transformer 的质量,参数约减半。团队还首次建立循环的缩放定律,发现计算最优训练需同步提升循环次数与数据量。
Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。
Together AI 内核团队在获得 NVIDIA Blackwell GPU 一周内,基于 ThunderKittens 库开发出部分最快的 FP4 和 FP8 GEMM 内核,相比 H100 上的 cuBLAS 最高提速 2 倍。
OpenAI 对齐团队在 o4-mini 规模模型上测试了 Tice et al. 提出的对齐中期训练,用各 230k 文档(约 340M tokens)分别做对齐与错位中期训练后再做推理后训练。
Together AI 扩展 Together Fine-Tuning,新增工具调用、推理和视觉语言模型(VLM)微调支持,训练栈升级后支持 100B+ 参数模型,吞吐最高提升 6×,数据集支持最大 100GB。
Mistral AI 推出 Forge,让企业基于自有专有知识训练前沿级 AI 模型,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可运行在企业自有基础设施内以保留控制权。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据。
Together AI 与 CMU、普林斯顿、Cartesia AI 等机构合作推出 Mamba-3,一个以推理效率为首要目标的状态空间模型。
Answer.AI 联合创始人 Rachel Thomas 与 KAMI Think Tank 的 Kamayani Gupta 对谈生命科学中 AI 应用的风险与局限,本文为整理稿。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Answer.AI 分析 PyPI 数据,未发现 ChatGPT 发布后包创建或更新频率的全面跃升,质疑 AI 让开发者普遍 2x 到 100x 提效的说法。按描述分类后发现,2023 年首发且最受欢迎的 AI 相关包中位更新达每年 21-26 次,是同为热门的非 AI 包(约 10 次)的两倍多,2024 年 AI 包占比也从 2021 年的约 1:6 升至近 1:2。
推荐理由:作者用 PyPI 十年数据检验 AI 提效说法,发现增速未变,只有热门 AI 包更新频率翻倍,为讨论提供了少见的量化证据。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
Together AI 发布 SF Streets 和 US Streets 两个语音识别基准,测试 15 个模型在街名转写上的表现,平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
Together AI 研究团队通过近无约束生成实验(如 "Actually"、"Let's think step by step" 等中性种子提示,移除聊天模板和系统提示)研究 LLM 的默认行为,发现各模型家族具有稳定且可解释的知识先验。
Sierra 发布 Expert Answers,可在 AI 智能体遇到知识缺口、转交人工客服解决后,自动从该次解决过程生成可审核的知识草稿并回灌给智能体。一家数字健康公司用其基于真实客服对话生成的文章做小流量测试,解决率提升 4% 且未增加客服工作量,随后全面铺开。该功能还可配合 Live Assist 将知识同步给整个客服团队。
OpenAI 发布实验性数据集 CoVal,将价值观敏感的提示词与众包撰写的可审计评分标准配对,记录人们偏好某个模型回复的具体理由而非仅选择结果。CoVal 含保留多元甚至冲突标准的 CoVal-full 和每提示词保留 4 条高评分兼容标准的 CoVal-core 两种形式,其评分可预测样本外人类排名,并揭示 GPT-5 系列模型的行为差异。
伯克利 AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了信息估计与下游解码性能的一致性,优化后的设计达到 SOTA 端到端方法水平,同时所需内存和算力更少,且无需任务专用解码器设计。