Nathan Lambert 的 RLHF 与 LLM 后训练教材由 Manning 出版并开售
Nathan Lambert 宣布其 post-training 教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》由 Manning 出版,Manning 和 Amazon US 已开售,Amazon UK 十月发售。
Nathan Lambert 宣布其 post-training 教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》由 Manning 出版,Manning 和 Amazon US 已开售,Amazon UK 十月发售。
最新论文《Efficient Knowledge Distillation for LLMs》提出离线 top-K logits 缓存与融合分块 KL 损失两项改动,让教师模型无需与学生同时驻留显存,也不再生成完整的词表×序列长度矩阵。
Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。
Google Cloud 在 Next '26 的 Agentic Data Cloud 发布中推出两款 AI 数据库智能体。
Target 基于 Spanner Graph 构建企业本体,将图关系、向量嵌入、全文检索与事务数据统一到同一数据库引擎,替代原有 Elasticsearch 加 NoSQL 的碎片化架构。迁移采用零停机四阶段方案,完成后下线旧 Elasticsearch 集群,数据库维护成本降低 50%。该平台为 Gift Finder 等对话式购物助手提供结构化上下文,支撑 GraphRAG 式商品发现。
Dwarkesh Patel 认为,更聪明的 AI 模型可能将算力价格推高 10 倍。该内容为其上周所写文章的视频录制版,原文可在其博客查看。视频由 Mercury 赞助,其内置 AI Command 可自动归类交易并同步至 QuickBooks。
Google 宣布 Data Commons on Spanner Graph 正式可用,并预览新的 Data Commons Platform,用于把企业私有知识与公共数据集知识图谱打通。
Nathan Lambert 的 Interconnects 推出 Artifacts Hub 和 Adoption Dashboard 两个免费工具。
Microsoft Research 推出 Echoverse,为 computer-use agent 构建了 12 个深度训练世界(10 个领域世界和 2 个能力世界),强调环境保真度而非数量。
MIT 与波士顿 Beth Israel 医院的研究者从 1975 年开始数字化心电图记录,1980 年完成逾 10 万条标注,最初预计只寄给不到十几个机构,十年间却寄出约 100 份拷贝。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 智能体的摘要以自然语言"信念状态"形式隔离并监督其信息内容,替代完整交互历史作为工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。
Google Cloud 在 Next 2026 上推出 Agentic Data Cloud,将数据、AI 模型与运营数据库统一为单一 System of Action。
Google Research 在 Nature 发表《Reinforcement learning control of quantum error correction》,用强化学习(RL)智能体从量子纠错的错误检测事件中学习,在计算进行中持续调控数千个控制参数以对抗漂移,无需中断计算。
OpenAI 与 Apollo Research 发布 Contrastive Synthetic Document Finetuning 方法,通过向模型两个副本灌输相反的评分者信念,测量行为对评分者偏好的因果敏感度。
推荐理由:原文提出可量化的 reward-seeking 测量方法,并用模型有机体验证其有效性,读者可以据此了解前沿 RL 训练中奖励寻求的演变趋势。
上海人工智能实验室 InternLM 开源 archspace 项目,目标是把 LLM 架构探索转化为社区可复用的知识。该项目以“让架构探索成为可复用知识”为定位,面向 LLM 架构研究场景。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,为 2.8T 参数 MoE 模型,权重定于 7 月 27 日开放,在 Vals AI 指数排第 2、Artificial Analysis 智能指数排第 3、Frontend Code Arena 排第 1。
推荐理由:作者基于榜单和架构细节分析 K3 对开源模型经济与中美竞争格局的影响,提供了可参考的行业判断框架。
Sebastian Raschka 撰文讲解推理模型如何支持多档推理力度(reasoning effort)设置。
DharmaOCR 在葡萄牙语专用基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
MIT 与 IBM 等机构的研究者提出 GIFT(Geometric Inference Feedback Tuning),可让视觉语言模型自动把 2D 设计图转成可执行的 CAD 程序,精度更高且仅需约 20% 的计算量。
MIT LIDS 首席研究员 Devavrat Shah 基于其实验室多年研究,为衍生公司 Ikigai Labs 构建了面向表格与时序数据的基础模型,可从企业多源数据持续学习并实时预测。
英灵殿创始人 Odin 在播客中讲述自己高中辍学、自学考入浙大、离开 David Baker 诺奖实验室后投身 AI for Science 创业,已融资数千万美元。他提出要做「全模态分子世界模型」和「通用科学人工智能」,目标是造一台「新时代科学发现的蒸汽机」,把人类科学进程压缩上百年。团队约 30 人,曾让一名本科生带做 8 个靶点,每轮都做出 sub 纳摩尔级活性分子。
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。
Google Research 发布 SensorFM,一个大传感器基础模型,用来自 500 万名同意参与研究者的超过一万亿分钟无标签多模态可穿戴数据进行自监督预训练,覆盖 100 多个国家、20 多种 Fitbit 和 Pixel Watch 设备。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
美团 LongCat 团队发布 LongCat-2.0,总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,权重以 MIT 协议开源。
Dwarkesh Patel 公布其 AI 大问题征文比赛的三篇获奖作品,比赛共收到超 600 篇投稿。
研究者提出 DiScoFormer(Density and Score Transformer),给定一组数据点即可在单次前向传播中同时估计分布的密度与 score,无需针对新分布重新训练。
Dwarkesh Patel 撰文提出,实验室押注 RLVR 在数千环境中训练可通向 AGI,但仅在会话内学习不够,真正的下一个范式是让 AI 从部署后的真实经验中持续学习并回写到权重。
推荐理由:作者用计算机使用进度慢的例子说明可验证性之外还需可反复模拟性,并给出把部署经验蒸馏回权重的可能路径。
Lilian Weng 撰文梳理 Scaling Laws 的经验基础,指出训练损失 L 随模型规模 N、数据量 D 和算力 C 按幂律下降,在对数坐标上呈直线,核心是在 N 与 D 之间最优分配算力,常用近似为 C ≈ 6ND。
Dwarkesh Patel 撰文指出,过去几年 AI 进步主要来自更多更好的数据与算力,而非训练样本效率的提升;RL 可视为一种合成数据生成,需要大量高度定制的人类专家轨迹和 rubric。
推荐理由:作者用人类与模型的 token 消耗对比和 Chinchilla 常数推算,解释为什么数据而非训练技巧才是追赶前沿的关键。
蚂蚁 inclusionAI 在 GitHub 开源 AReno,一个易用且快速的工具包,用于在单节点上扩展强化学习后训练。该工具定位为轻量级 RL post-training 方案,具体性能数据与支持模型尚未在仓库说明中披露。
vLLM 社区发布开源 RL 后训练框架 vime(Apache 2.0),基于 slime 的训练栈和数据生成设计,将 Megatron 训练与 vLLM 推理接入同一条解耦管线。
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。
推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。
Nous Research 在 GitHub 上线 Automodel,这是一个基于 PyTorch 原生分布式、面向 LLM 与 VLM 的训练库,开箱即支持 Hugging Face。
Nous Research 在 GitHub 新建 Megatron-LM 仓库,用于持续开展大规模 Transformer 模型训练研究。该仓库定位为规模化训练 Transformer 的持续性研究项目,目前公开信息仅包含这一句描述,未披露模型规模、参数或具体训练细节。
Nous Research 推出 Megatron-Bridge,一个面向 Megatron 系列模型的训练库,支持与 Hugging Face 的双向转换。该库同时提供模型训练能力与 Hugging Face 格式互转功能。
Mistral 收购 Emmi AI,并加倍投入面向航空航天、汽车、半导体和能源等实体产业的物理 AI 基础研究。其成果包括 AB-UPT 物理 Transformer,可在单张 GPU 上处理 9M 表面与 140M 体积网格的原始几何数据而无需重新划分网格;NeuralDEM 则是首个面向大规模多物理过程的端到端深度学习代理模型,支持流化床反应器等工业过程的实时仿真。
阿里巴巴在 GitHub 上线 EfficientRL,为 ICML 2026 论文《Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization》的官方代码仓库。该工作以信息瓶颈驱动树式策略优化,具体参数与评测结果原文未披露。