SGLang 集成 DSpark:基于置信度的变长验证投机解码
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较 Host DRAM 方案降低 6.7 倍。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 支持,完成四节点端到端验证。
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。
推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。
SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。
推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
RadixArk 与 Google Cloud 宣布合作,把开源推理框架 SGLang 带到 Google TPU 上。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
SGL-Diffusion 团队用 SRT 替换 HF 后端,将 AR 阶段从扩散 worker 中解耦为独立服务,使 AR 可单独配置 TP、DiT 保留 SP。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。
推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。
SGLang 发布 Unified Radix Cache,用单一 token 基数树统一 full attention KV、滑动窗口 KV 与 Mamba 循环状态的复用边界,替代此前的缓存类矩阵。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
SGLang 团队详解其 CUDA Graph 重构,将支持拆分为 runner/backend 两层,使不同捕获策略可跨执行路径复用。
LMSYS 博客给出 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro 在 H20 GPU 上的服务优化方案,单节点 H20-141GB 在 batch size 1 下达到 271 output tokens/s,与 B300 的 383.7 tokens/s 相比解码性能差距缩小至 1.42×。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
蚂蚁集团基础设施团队联合阿里巴巴与 SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将常驻 GPU 的量化后权重直接提供给新的 SGLang 引擎实例。
Liquid AI 官方文档介绍其 Liquid Foundation Models (LFM) 多模态模型家族,面向快速推理和端侧部署,统一支持 32K 上下文(LFM2.5-8B-A1B 为 128K)。
Liquid AI 展示五套基于 LFM 的可运行系统,每套将微调后的 Liquid 模型部署在手机、边缘 GPU 或用户自控 VPC 中,支持断网运行。模型覆盖文本、视觉与音频,量化与推理引擎按目标硬件联合选型并在用户实际硬件上做性能剖析。训练在单张 GPU 上数小时完成,并以留出集评分。
Liquid AI 与 .txt 合作展示如何在边缘设备上实现可靠的 LLM 函数调用:LFM2-350M 无量化下内存占用低于 1 GB、常见边缘硬件推理时间低于 100ms,配合 .txt 的 dotgrammar 库用上下文无关文法保证输出语法有效且不增加推理延迟。
Liquid AI 宣布其 Liquid Edge AI Platform(LEAP)原生支持 AMD 最新 Ryzen 和 Ryzen AI 处理器,基于 llama.cpp 推理引擎,可在本地运行 LFM 模型。
Liquid AI 发布 LFM2 系列目前最大的模型 LFM2-2.6B,共 2.6B 参数,训练使用 10 万亿 token,官方称性能超过 Llama 3.2-3B-Instruct、Gemma-3-4b-it 和 SmolLM3-3B 等 3B+ 级模型。
Liquid AI 发布 Liquid Nanos 系列 350M–2.6B 参数的端侧基础模型,主打在手机、笔记本和嵌入式设备上本地运行,并已在 LEAP 平台和 Hugging Face 上线。
Liquid AI 在开发 LFM2 系列开放权重模型时选用 PyTorch ExecuTorch 作为推理引擎,看中其混合缓存支持与单条命令打包权重、元数据和执行图的自动化部署流程。
Liquid AI 发布 LFM2-24B-A2B 的早期 checkpoint,总参数 24B、每 token 激活约 2.3B,是迄今最大的 LFM2 模型,开放权重已上线 Hugging Face。
Liquid AI 发布开源桌面智能体 LocalCowork,展示 LFM2-24B-A2B 完全在本地笔记本上执行工具调用,无云端、无 API 密钥、数据不出设备。
Liquid AI 发布 LFM2.5-350M,基于 LFM2 架构,预训练从 10T 扩至 28T tokens 并加入大规模强化学习,Base 和后训练模型已在 Hugging Face、LEAP 和 Playground 开放。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言搜索。
Liquid AI 发布其最小的模型 LFM2.5-230M,基于 LFM2 架构,预训练 19T tokens,Base 和 post-trained 版本已在 Hugging Face 开放下载。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。
推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。
Trilogy AI Center of Excellence 围绕 Fireworks 上的 Kimi K3 发布公开 AI 网络安全手册与练习包,包含交互式手册、仓库和十个针对本地训练应用的练习。
月之暗面的 Kimi K3 以开源权重发布,共 2.8T 总参数、104B 激活参数、896 专家、1M 上下文,并在 Fireworks 上线 Day-0 推理与训练。
推荐理由:原文汇总了 K3 的参数规格、多项第三方基准成绩和与 Opus 5 的成本对比,读者可据此评估开源模型在自有工作流中的可行性。
Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Fireworks AI 宣布 Training API 正式可用,并推出 Fireworks Lab 服务。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。
Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。