Upstage 发布 Solar Mini 4:Artificial Analysis 实测 24 分推理模型,单任务成本约为 GPT-6 Luna 的 5 倍
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
Databricks 宣布 IP Functions 正式 GA,将 IP 地址分析变为 Lakehouse 上原生高性能 SQL 工作负载,可统一处理 IPv4 与 IPv6、原生支持 CIDR 表示法并由 Photon 加速。
NVIDIA Dynamo-Triton 现已通过 recsys-examples 仓库支持 HSTU 生成式推荐模型的端到端推理工作流,结合 PyTorch AOTI 编译、FlexKV KV 缓存与 NV embedding cache。
NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。
Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。
Google 在 TPU 上通过稀疏注意力内核优化加速视频扩散模型的时空注意力计算。视频扩散中自注意力在单层延迟占比可从 720p 的 55.5% 升至 1440p 的 88.2%。
NVIDIA NeMo Relay 可追踪 AI 智能体执行框架(agent harness)的行为,揭示智能体在完成任务时走过的低效路径。失败的搜索会触发另一次搜索,被截断的文件读取会导致命令重复获取相同内容,这些多余步骤虽被正确答案掩盖,却增加延迟并消耗 token。
xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。
推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。
xAI 宣布开源 Grok Build 的编码 Agent 与 TUI,源码已发布在 GitHub。
推荐理由:源码公开了 agent loop、工具、TUI 和扩展系统的实现细节,还支持本地编译和接自有推理服务。
Cloudflare Containers now start 6x faster, let your agent choose each sandbox's image and instance type at runtime, and support filesystem snapshots in public beta, all controlled from a Durable Object. https://cfl.re/4hVasac #BirthdayWeek
TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。
欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。
METR 发布对开源权重模型 DeepSeek-V3 的评估报告(2025年2月12日),未发现其具备超越 Claude 3.5 Sonnet 和 GPT-4o 等现有模型的危险自主能力。
SGLang 团队推出 Mini-SGLang,一个仅 5k 行 Python 代码的轻量级 LLM 推理框架,源自 SGLang 项目,旨在降低现代推理系统的学习门槛并支持快速研究原型。
SGLang 团队与蚂蚁集团 DeepXPU 团队宣布在 SGLang 内实现 Diffusion LLM(dLLM)框架,并 Day-0 支持 LLaDA 2.0。
推荐理由:原文给出 SGLang 支持 Block Diffusion LLM 的实现思路和实测吞吐数据,读者可据此评估 dLLM 推理方案的可用性。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可独立横向扩展。
SGLang 推出高度优化的流水线并行(PP)实现,结合分块流水线并行、异步 P2P 通信与动态分块机制,专攻超长上下文推理。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1,分块预填充设为 12K 时预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高 30.5%,TTFT 最多降低 67.9%,强扩展效率 82.8%。
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
Novita AI 发布基于 SGLang 部署 GLM4-MoE 模型的端到端推理优化方案,TTFT 最高降低 65%,agentic coding 负载下 TPOT 提升 22%,结果在 H200 集群 TP8、FP8 配置下验证。
SGLang RL 团队联合 InfiXAI、蚂蚁 Asystem & AQ Infra、slime、RadixArk 团队,在 slime 框架上落地了 INT4 QAT 端到端流程,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性与稳定性。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 与 Qwen3-VL-235B 完成极致延迟优化。
SGLang-Diffusion 团队公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE 与多请求服务稳定性。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。
NVIDIA 与 SGLang 团队公布在 GB300 NVL72 上优化 DeepSeek R1-NVFP4 长上下文推理的进展,128K/8K 场景下 SGLang 达到 226.2 TPS/GPU,较 GB200 提升 1.53 倍。
SGLang 与 NVIDIA 合作在 GB300 NVL72 上实现最高 25 倍推理性能提升,基于 SemiAnalysis InferenceXv2 运行 DeepSeek R1 对比 H200(50 TPS/user 延迟约束)。
NVIDIA 宣布 Nemotron 3 Super 发布,SGLang 于 Day-0 提供支持。
SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射实现部分故障容错,DeepSeek V3.2 在 32 GPU、256 冗余专家配置下服务中断控制在 10 秒内,较完整重启的 2-3 分钟减少 90%。该方案静态性能与标准 DeepEP 持平,系统吞吐 3560.21 tokens/sec,由 Mooncake EP 提供容错通信层支持。
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。
LMSYS 的 SGLang 与 Miles 团队宣布对 DeepSeek-V4(1.6T Pro、284B Flash)提供 Day-0 推理和 RL 训练支持,是首个在发布日同时服务与训练该模型的开源栈。
推荐理由:LMSYS 团队详述了为 DeepSeek-V4 混合稀疏注意力等新架构所做的推理与 RL 训练优化,附基准数据。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,作为传统 NCCL broadcast 的补充,兼容所有主流开源模型。
AMD 与 SGLang 团队联合发布博客,展示基于 SGLang 和 MoRI 通信库的 DeepSeek-R1 分离式推理在 AMD Instinct MI355X 上实现有竞争力的 TCO,结果由 SemiAnalysis 的 InferenceX 基准平台验证。
Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms,降幅 53%。
SGLang 为 DeepEP MoE 推理引入 Waterfill 和 LPLB 两项调度期负载均衡特性。
SGLang 团队发布博客,介绍将开发流程编码为可执行 skills 的初步探索,覆盖 CUDA 崩溃调试、基准测试、profiling、扩散模型接入和生产事故分诊。