Z Lab、Modal 与 SGLang 联合发布 DFlash 与 Spec V2 推测解码方案
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms,降幅 53%。
SGLang 为 DeepEP MoE 推理引入 Waterfill 和 LPLB 两项调度期负载均衡特性。
SGLang 团队发布博客,介绍将开发流程编码为可执行 skills 的初步探索,覆盖 CUDA 崩溃调试、基准测试、profiling、扩散模型接入和生产事故分诊。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较 Host DRAM 方案降低 6.7 倍。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 支持,完成四节点端到端验证。
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。
推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。
SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。
推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
RadixArk 与 Google Cloud 宣布合作,把开源推理框架 SGLang 带到 Google TPU 上。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
SGL-Diffusion 团队用 SRT 替换 HF 后端,将 AR 阶段从扩散 worker 中解耦为独立服务,使 AR 可单独配置 TP、DiT 保留 SP。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。
推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。
SGLang 发布 Unified Radix Cache,用单一 token 基数树统一 full attention KV、滑动窗口 KV 与 Mamba 循环状态的复用边界,替代此前的缓存类矩阵。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
SGLang 团队详解其 CUDA Graph 重构,将支持拆分为 runner/backend 两层,使不同捕获策略可跨执行路径复用。
LMSYS 博客给出 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro 在 H20 GPU 上的服务优化方案,单节点 H20-141GB 在 batch size 1 下达到 271 output tokens/s,与 B300 的 383.7 tokens/s 相比解码性能差距缩小至 1.42×。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
蚂蚁集团基础设施团队联合阿里巴巴与 SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将常驻 GPU 的量化后权重直接提供给新的 SGLang 引擎实例。
LlamaIndex 发布 Parse Gateway,基于 LiteParse v2.2.0 的 is_complex 功能在页面级别估计文档复杂度,并将各页路由到不同的 LlamaParse 层级。
LlamaIndex 发文讲解 OCR 自动化与单纯文本提取的区别,指出生产准确性主要取决于解析前后的输入质量、置信度阈值校准和直通处理率,并给出 85-92% 到 90-95% 的直通率基准。
LlamaIndex 用 Temporal 替换 RabbitMQ,支撑起每天数千万页文档的处理,并驱动其最新的 Batch API 发布。Temporal 作为持久化函数执行运行时,将业务逻辑组织为确定性的 Workflow 与 Activity,由 Worker 执行、服务端持久保存执行状态,失败可从断点重试。
LlamaIndex 尝试让静态嵌入模型实现 ColBERT 式 late-interaction 检索,发现直接用 MaxSim 打分在公开基准上反而输给池化(mean NDCG 0.418 vs 0.504)。
Stainless 团队于 2026 年 5 月 18 日宣布加入 Anthropic 并关停包括 SDK 生成器在内的托管产品,LlamaIndex 撰文复盘为何当初选择 Stainless 以及迁移中的经验。
LlamaParse 面向 PDF 表格提取,解决 PDF 只存字符坐标、不存行列结构的问题,需从空间布局推断行列关系。文章指出扁平文本提取、模板规则系统和单纯 OCR 都会在生产文档上失效,因为无边框表格、跨页表头、合并单元格、嵌套表格和扫描件会破坏简单假设。
LlamaIndex 撰文指出,OCR 文档处理中每字段准确率与每文档自动化率存在单位错配,20 个字段的发票在 97% 字段准确率下整单全对的概率约 54%,而路由门控读的是置信信号而非准确率。
LlamaIndex 发布 LiteParse 更新,通过对自维护 PDFium fork 做内存分配等优化,文本提取提速 20-25%,OCR 关闭下平均 2.8ms/page 提取文本、3.9ms/page 渲染 markdown。
收入验证 API 通过数据采集、验证与决策支持三步流程,将工资单、税表、银行流水等文档转为结构化收入记录。文章对比了 payroll API(Argyle、Pinwheel)、开放银行数据、人工审核与文档提取 API(LlamaParse)四类方案,指出 payroll API 对自雇、零工及小雇主覆盖不足,文档提取可覆盖任意收入类型但需下游结构化逻辑,混合方案覆盖更广但集成更复杂。
LlamaIndex 发布 LlamaCloud 文档处理 API 文档,支持用 Python、TypeScript 和 curl 调用解析、抽取、分类与拆分四类能力。
Liquid AI 官方文档介绍其 Liquid Foundation Models (LFM) 多模态模型家族,面向快速推理和端侧部署,统一支持 32K 上下文(LFM2.5-8B-A1B 为 128K)。
Liquid AI 展示五套基于 LFM 的可运行系统,每套将微调后的 Liquid 模型部署在手机、边缘 GPU 或用户自控 VPC 中,支持断网运行。模型覆盖文本、视觉与音频,量化与推理引擎按目标硬件联合选型并在用户实际硬件上做性能剖析。训练在单张 GPU 上数小时完成,并以留出集评分。
Liquid AI 与 .txt 合作展示如何在边缘设备上实现可靠的 LLM 函数调用:LFM2-350M 无量化下内存占用低于 1 GB、常见边缘硬件推理时间低于 100ms,配合 .txt 的 dotgrammar 库用上下文无关文法保证输出语法有效且不增加推理延迟。
Liquid AI 宣布其 Liquid Edge AI Platform(LEAP)原生支持 AMD 最新 Ryzen 和 Ryzen AI 处理器,基于 llama.cpp 推理引擎,可在本地运行 LFM 模型。
Liquid AI 发布 LFM2 系列目前最大的模型 LFM2-2.6B,共 2.6B 参数,训练使用 10 万亿 token,官方称性能超过 Llama 3.2-3B-Instruct、Gemma-3-4b-it 和 SmolLM3-3B 等 3B+ 级模型。
Liquid AI 发布 Liquid Nanos 系列 350M–2.6B 参数的端侧基础模型,主打在手机、笔记本和嵌入式设备上本地运行,并已在 LEAP 平台和 Hugging Face 上线。