跳到正文

#推理

今日 5 条
9月29日周二
9月28日周一
9月25日周五
  1. Sakana AI57

    Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问,与现职兼任,将参与公司的 RSI Lab。正文称其自 1987 年学位论文起开创递归自我改进方向,1990 年提出世界模型思路,2018 年与 CEO David Ha 合著的 World Models 论文使其广为人知。他将于 10 月下旬来日,在东京举办公开活动。

    引用Sakana AI@SakanaAILabs

    Sakana AI welcomes Jürgen Schmidhuber as Chief Scientific Advisor. https://sakana.ai/schmidhuber/ Sakana AI is incredibly proud to announce that Jürgen Schmidhuber, universally recognized as the father of modern AI, is officially joining Sakana AI as Chief Scientific Advisor. For nearly four decades, Jürgen has explored how machines can learn to learn. His foundational work in the 1990s drove core advancements in deep learning and established early frameworks for world models. Crucially, his pioneering innovations in meta-learning opened the very path toward recursive self-improvement. These ideas have already shaped our own research, from the Darwin Gödel Machine to The AI Scientist. Now Jürgen will help guide our newly formed RSI Lab, whose objective is to trigger a compounding cycle of scientific discovery aimed at improving machine intelligence. We are assembling a critical mass of world-class experts in Tokyo to make this a reality. Welcome, @SchmidhuberAI !

9月24日周四
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)39

    NVIDIA 推出 NV-Reason-CT Open 3D CT VLM,面向放射科医生链式推理

    NVIDIA 发布 NV-Reason-CT Open,这是一个面向 3D CT 体积影像的开放视觉语言模型,支持放射科医生的链式推理(Chain-of-Thought)。现有前沿通用模型在体积影像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力,而 3D CT 是临床信息最丰富、数据最密集的模态之一,此前一直未被现代 VLM 充分覆盖。

9月23日周三
  1. Apple Machine Learning Research(RSS)45

    Apple 提出 probe guidance:用扩散模型冻结内部状态引导流匹配,刷新扩散语言模型无条件生成 SOTA

    Apple 研究团队提出 probe guidance,利用已有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算,即可让弱模型与强模型保持相近动态。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,传统 autoguidence 中的弱模型必须来自训练的低熵区域。

9月21日周一
9月19日周六
9月17日周四
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)30

    TensorRT Edge-LLM 在 Jetson AGX Thor 上以 6.4 倍速度完成 MLPerf Edge Agentic Benchmark

    NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该方案面向从云端数据中心迁移至车辆、机器人等边缘设备的 AI 智能体,针对其多步骤工具调用、结果评估与长对话推理带来的边缘推理新需求,实现快速 token 生成。

9月16日周三
  1. Google Research29

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,用集合级属性奖励评估整组结果,无需人工标注,也无需推理时的 CoT 思考 token。

9月15日周二
  1. MiniMax (official)36

    H3 越来越快了。⚡️ @sgl_project + VDN-H3 现在让 MiniMax H3 在 8× B200 上突破 2 倍实时去噪——预热后端到端 9.0s 生成 14.4s 的 768p 视频,未测得质量下降。 开放模型通过开放生态持续进化。🚀

    引用SGLang@sgl_project

    SGLang-Diffusion with VDN-H3 now generates 14.4s of 768p video in just 9.0s 🚀 On 8× B200, 8 step denoising takes just 6.9s, reaching over 2× real time. The 9.0s figure covers the full generation request after warmup. No measured quality regression versus dense 50-step H3 across 103 test prompts. 🧵

9月14日周一
9月13日周日
9月12日周六
  1. Thinking Machines42

    我们自己的 @johnschulman2 与 Dwarkesh 对话,讨论随着模型不断进步和自我改进,人类判断力在哪些方面仍然重要:教它们处理混乱的现实世界任务,用品味判断什么在长期内有效,以及最重要的——明确我们真正想要什么。

    引用Dwarkesh Patel@dwarkesh_sp

    New episode with @johnschulman2, @oneill_c and @BerenMillidge. I got together with some of the most insightful AI researchers I know who are at the openish companies, because I wanted to hear the details of what's actually happening at the frontier and what comes next. 0:00:00 – Steelmanning the case against RSI 0:18:39 – What’s driving the Chinese labs’ progress 0:28:06 – How will automated AI researchers be trained 0:33:51 – Will long-horizon RL elicit AGI? 0:45:24 – The sim-to-real gap 1:00:33 – How much progress is explained by data? 1:18:03 – Why is RL working so well? 1:24:54 – Move 37 and entropy collapse 1:28:31 – Rapid-fire timelines

9月11日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)29

    全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户

    NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。

9月10日周四
  1. SiliconFlow70

    DeepSeek-V4.1-Flash 在 SiliconFlow 上线,提供 Day 0 支持。模型为 552B MoE,prefill 阶段约激活 8B、decode 阶段约激活 16B,支持原生视觉与 1M 上下文窗口,KV cache 占用相比 V4 Flash 约缩小 4 倍,采用 MIT 许可证,主打高吞吐生产级推理。

    推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。

9月9日周三
9月5日周六
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)34

    NVIDIA Jetson 如何部署与优化前沿推理模型

    NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。

9月3日周四
8月26日周三
8月25日周二
  1. Hugging Face:Blog(RSS)66

    IBM 发布 Granite 4.2 推理模型系列并详解构建过程

    IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。

    推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。

8月21日周五
  1. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

8月19日周三
8月14日周五
8月13日周四
  1. Microsoft Research 博客(RSS)37

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。

8月12日周三
8月6日周四
  1. Meta Engineering Blog(RSS)47

    Meta 广告排序的多阶段序列模型:从用户序列到 LLM 式缩放定律

    Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。

7月29日周三
  1. BAIR:Berkeley AI Research Blog62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。