跳到正文
热点事件持续更新

SGLang 与 NVIDIA 合作优化 GPT-OSS 本地部署

2 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,LMSYS 的 Chatbot Arena 团队博客发布两篇关于 GPT-OSS 本地部署的内容。其一,SGLang 团队与 NVIDIA 合作,在 NVIDIA DGX Spark 上为 GPT-OSS 20B 和 120B 提供支持,实测吞吐约 70 tokens/s 和 50 tokens/s,被称为目前 SOTA 水平,并可用于本地运行 Claude Code。其二,NVIDIA ModelOpt 团队发布教程,演示如何用 QAT 在保留 FP4 精度的情况下微调 gpt-oss,并通过 SGLang 部署。两篇报道均来自同一时间点,未出现数字或说法上的前后矛盾。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展

  1. 10月2日 22:51 · 1 篇报道
    NVIDIA 发布 gpt-oss MXFP4 量化感知微调与 SGLang 部署教程
    LMSYS:Blog(Chatbot Arena 团队):NVIDIA ModelOpt 团队发布 gpt-oss MXFP4 微调与 SGLang 部署教程
  2. 10月2日 22:51 · 1 篇报道
    LMSYS 在 NVIDIA DGX Spark 上优化 GPT-OSS
    LMSYS:Blog(Chatbot Arena 团队):如何在 NVIDIA DGX Spark 上用 SGLang 优化 GPT-OSS:本地跑 Claude Code

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. LMSYS:Blog(Chatbot Arena 团队)
    NVIDIA ModelOpt 团队发布 gpt-oss MXFP4 微调与 SGLang 部署教程

    NVIDIA ModelOpt 团队发布教程,演示用 QAT 在保留 FP4 精度的情况下微调 gpt-oss,并用 SGLang 部署。

  2. LMSYS:Blog(Chatbot Arena 团队)
    如何在 NVIDIA DGX Spark 上用 SGLang 优化 GPT-OSS:本地跑 Claude Code

    SGLang 团队与 NVIDIA 合作,在 DGX Spark 上为 GPT-OSS 20B 和 120B 提供支持,实测吞吐约 70 tokens/s 和 50 tokens/s,为目前 SOTA 水平。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。