Together AI 首日上线 NVIDIA Nemotron 3 Super,开发者可专用推理部署
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
Together AI 等团队发布 FlashAttention-4,通过算法与内核协同设计在 Blackwell B200 上最大化 matmul 与其他资源瓶颈的重叠。
Google 发布 Gemini 3.1 Flash-Lite,定位最快最高效、面向高负载工作负载的模型,官方称在推理、可靠性和可扩展性上超过 2.5 Flash 且成本更低。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Jakub Pachocki 表示看好 First Proof 挑战,认为前沿新研究可能是评估下一代 AI 模型能力最重要的方式。
OpenAI 提出一种利用推理模型(AI judges)分析真实生产对话的方法,通过识别用户情绪退化来检测和诊断 ChatGPT 的失调行为,发现情绪退化的对话包含 Model Spec 违规的概率约为其他对话的两倍。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
小米发布 MiMo-V2-Flash 基础模型,主打高效推理、编码与智能体能力。该模型以 MiMo-V2-Flash 为名在 GitHub 新仓库开源,具体参数规模、benchmark 分数与上下文长度尚未在现有信息中披露。
Gemini 3 Deep Think 模式现已面向 Ultra 用户上线。Noam Shazeer 表示该模式使用并行思考线时,在 ARC-AGI-2 和 HLE 等关键推理基准上有明显提升。
Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。
推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。
OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。
上海人工智能实验室 InternLM 团队开源 ARC-VL,为 CVPR 2026 论文《Think Visually, Reason Textually: Vision-Language Synergy in ARC》的官方实现。该方法在 ARC 任务中让视觉与语言协同工作,以视觉方式进行思考、以文本方式进行推理。
Thinking Machines Lab 发布 On-Policy Distillation 博客,提出用教师模型对学生模型自采样轨迹逐 token 计算反向 KL 奖励,把 RL 的 on-policy 优势与蒸馏的密集反馈结合。
推荐理由:文章给出可复现的 on-policy distillation 配方和成本对比数据,读者可以据此判断它能否替代或补充现有 RL 与 SFT 训练流程。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
上海人工智能实验室 InternLM 团队开源了 SIM-CoT(Supervised Implicit Chain-of-Thought)的官方实现,该工作已被 ICLR 2026 接收。SIM-CoT 通过监督方式实现隐式思维链推理,代码已在 GitHub 公开。
Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。
推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。
OpenAI 发布推理模型使用指南,说明 o 系列模型(如 o3、o4-mini)擅长规划、复杂决策和高精度任务,GPT 模型(如 GPT-4.1)更适合快速低成本的明确任务,多数 AI 工作流可组合两者,用 o 系列做规划、GPT 做执行。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
小米发布 MiMo,一个从预训练到后训练全流程优化推理能力的语言模型。该模型旨在释放语言模型的推理潜力,相关代码与模型已托管于 GitHub 的 XiaomiMiMo/MiMo 仓库。