Liquid AI 发布 LongevityBench:17 项任务评估 18 个前沿 AI 系统
Liquid AI 推出 LongevityBench,一个覆盖五个生物数据领域的 17 项任务开放基准,并用它评估了来自六个开发团队的 18 个前沿 AI 系统。同期研究还包括 In-Place Tokenizer Expansion,可在不损失质量的前提下将非英文 token 数量最多减少 4 倍。
Liquid AI 推出 LongevityBench,一个覆盖五个生物数据领域的 17 项任务开放基准,并用它评估了来自六个开发团队的 18 个前沿 AI 系统。同期研究还包括 In-Place Tokenizer Expansion,可在不损失质量的前提下将非英文 token 数量最多减少 4 倍。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。
CMU 研究者发布 CHAI,一个基于批判式人机监督的视频描述管线,与 100+ 专业视频创作者合作一年构建,对应 CVPR 2026 论文(Highlight,Top 3%)。
CMU 提出 V-pretraining,在持续预训练中把固定的自监督任务构造规则换成可学习的任务设计器,下游样本只用于训练设计器,学习者仍只接收自监督梯度。
CMU 博客解读 Forking-Sequences 训练范式:不再逐窗口编码,而是在单次前向传播中编码解码整条序列的所有预测创建日期,无需新增参数。该范式在 MLP、RNN、LSTM、CNN、Transformer 和 State Space 六种编码器上验证,LSTM 编码器的 sCRPS 最高提升 49.3%,梯度方差线性下降。
Baseten 发布训练 SDK Loops(早期访问),支持 256K+ 序列长度、2T+ 参数模型训练与异步 RL,训练完成后一条命令即可部署到 Baseten 推理栈。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态世界模型与实验闭环设计,读者可了解 AI 参与生物实验设计与验证的具体路径。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。实验室与新加坡经济发展局(EDB)合作开展联合博士培养,并于 2026 年 2 月共同举办物流与交通 AI 高管圆桌会;医疗健康领域已落地多模态医疗 AI 与自进化诊断智能体的合作研究。
Databricks 提出用 Data and AI Platform 打通制造业产品价值链,让跨阶段数据问题从人工查票变成一次查询。平台通过 zero-copy Open Sharing 和 Lakehouse Federation 直接访问源系统数据,无需为每个用例新建 ETL 管道或复制数据;需要镜像时可用连接器和云对象存储将数据汇入 lakehouse。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,提供 CloudFormation 和 Terraform 模板、跨账户适配器提升流程、生产安全配置及文档预分类路由模式。
MIT 研究团队借助可在小数据集上工作的机器学习算法,调整 mRNA 疫苗脂质纳米颗粒(LNP)中的辅料配方,使疫苗在室温下可稳定保存一年,在约 100 华氏度下保存两个月。
Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户记录代表谁、受众何时可激活等五个执行问题展开。每个术语都给出营销侧与数据工程侧的两套定义,例如“实时”在营销眼中是每 15 分钟刷新,在数据团队眼中则是秒级更新,涉及新基础设施与持续成本。文章建议在开工前先对齐“客户”“受众就绪”“信号新鲜度”等含义,避免误解变成活动返工。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化专家并行(EP)在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。适用于 RLHF、PPO 和 GRPO 等大规模 RL 训练流程。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多轮强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NVIDIA 技术博客解析了生物基础模型的高效 MoE 训练方案:相比每个 token 都要过全部层的稠密 Transformer,MoE 用多个专家子网络、每个 token 只激活其中一小部分,从而降低训练与推理算力开销。文章指出,随着语言模型规模增长,稠密架构的扩展成本越来越高。
我们与 @GoogleDeepMind、@emblebi 及研究伙伴合作,将 2,800 多种病毒的 AI 预测蛋白质复合物结构公开开放。 这为科学家提前应对潜在疫情提供了先机。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。
推荐理由:读者可了解开放病毒蛋白结构数据集如何降低结构预测门槛,以及配套开源流程的复用方式。
NVIDIA 验证工程师 Sakeena Fiza 在数据中心系统工程实验室负责新产品量产前的硬件验证,她回忆 NVIDIA Rubin GPU 首次在系统级被识别时全场欢呼,那是全球首次 Rubin GPU 在系统层面完成枚举。她将验证工作比作破案,目标是在客户之前发现问题,单块板卡可能含数万个组件,一个机架接近 50 万个。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式集成策略融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的排序预测。
小米 MiMo 在 GitHub 新建仓库 verl,其 HybridFlow 是一个灵活高效的强化学习后训练框架。该仓库定位为 RL post-training 框架,强调灵活性与效率,目前原文未披露参数规模、benchmark 分数或开源许可等细节。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
MIT 政治学副教授 Naoki Egami 专注研究方法论,尤其研究社会科学的“外部有效性”,即特定研究结论能否推广到其他情境。他早在 ChatGPT 引发 AI 热潮之前就开始研究 AI 工具引入研究后产生的误差,以及如何系统识别并校正这些误差。Egami 2020 年获普林斯顿大学博士学位,2025 年加入 MIT 政治学系。
Apple 研究者提出 DACA-GRPO,一种可插拔的 GRPO 训练增强方法,用于扩散语言模型强化学习。它通过 Denoising Progress Scores 提取逐 token 重要性权重(无额外前向开销),并用 Stratified Masking Likelihood 降低 mean-field 似然偏差。
Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,用集合级属性奖励评估整组结果,无需人工标注,也无需推理时的 CoT 思考 token。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需在数千次集合通信操作中同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA 技术博客介绍如何用 NVIDIA Transformer Engine 在 JAX 中加速 Dropless MoE 训练。MoE 通过条件计算实现高效训练,DeepSeek、Qwen、Mixtral 等模型以远低于稠密模型的训练算力达到或超越其性能。文章针对传统 MoE 依赖共享稠密 FFN 的做法,给出 Dropless 训练路径。
vime 联合 RL-Kernel 在 AMD Instinct MI300X 上实现训练与 rollout 的逐位数值一致性,8× MI300X 跑 Qwen3-8B GRPO 实验连续 200 步 mismatch_count = 0、max_abs_diff = 0。
New episode with @johnschulman2, @oneill_c and @BerenMillidge. I got together with some of the most insightful AI researchers I know who are at the openish companies, because I wanted to hear the details of what's actually happening at the frontier and what comes next. 0:00:00 – Steelmanning the case against RSI 0:18:39 – What’s driving the Chinese labs’ progress 0:28:06 – How will automated AI researchers be trained 0:33:51 – Will long-horizon RL elicit AGI? 0:45:24 – The sim-to-real gap 1:00:33 – How much progress is explained by data? 1:18:03 – Why is RL working so well? 1:24:54 – Move 37 and entropy collapse 1:28:31 – Rapid-fire timelines
Together AI 扩展 Together Fine-Tuning 服务,新增 GLM 5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源权重模型支持,并通过 API、CLI 和 UI 提供逐步训练指标实时追踪。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先迭代构建可验证的 API 调用链,再反推用户提示词,替代 ToolBench、ToolACE 等基于 DFS 试错的低效方案。
编码器回归了,宝贝 (引用推文 @scaling01:这到底是什么外星架构)
what in the alien architecture is this
“we cannot rule out that de-identified data derived from their usage of our products helped improve our models.” i mean props to them for straight coming clean. (so far the proof looks more along the lines of another euler blowup proof we had, off of whose ansatz naming we were making really stupid puns like “smooth criminale”, unlike the much better “ideal fluids explode”, Tristan) so i’ll now give a bit on my thinking here. i actually woulda been pumped to collaborate on this, there are a lot of people at oai i like (ok, clearly some were indirectly dicks to me because of being part of the whole situation, but im a big boy, i still like them), idgaf about authorship on that step anyway, coulda been me Tristan and every fte at oai for all i care (on that Tristan would disagree:p). but on hearing the loud convo in the hallway, especially the part where a millennium prize was offered if i’d just be removed from the paper, it was kinda clear the die had been cast and things were locked. pretty wacky, unstrategic, and unnecessary, since on my side things were mostly me and claude having a good time yoloing random stuff in the corner rather than anything institutional. i also like the idea of the labs cooperating, and even better on scientific progress. it’s a shame!
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组全部约 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与在罕见病研究中的验证案例。
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存智能体记忆。该智能体面向企业工作中随时间变化的邮件、决策、项目和待办事项,避免每次启动都需重建上下文。