热点事件持续更新
SGLang 与 NVIDIA 合作优化 GPT-OSS 本地部署
2 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,LMSYS 的 Chatbot Arena 团队博客发布两篇关于 GPT-OSS 本地部署的内容。其一,SGLang 团队与 NVIDIA 合作,在 NVIDIA DGX Spark 上为 GPT-OSS 20B 和 120B 提供支持,实测吞吐约 70 tokens/s 和 50 tokens/s,被称为目前 SOTA 水平,并可用于本地运行 Claude Code。其二,NVIDIA ModelOpt 团队发布教程,演示如何用 QAT 在保留 FP4 精度的情况下微调 gpt-oss,并通过 SGLang 部署。两篇报道均来自同一时间点,未出现数字或说法上的前后矛盾。
AI 根据报道生成 · 2 小时前更新
事件进展
2 个进展
- 10月2日 22:51 · 1 篇报道NVIDIA 发布 gpt-oss MXFP4 量化感知微调与 SGLang 部署教程LMSYS:Blog(Chatbot Arena 团队):NVIDIA ModelOpt 团队发布 gpt-oss MXFP4 微调与 SGLang 部署教程
- 10月2日 22:51 · 1 篇报道LMSYS 在 NVIDIA DGX Spark 上优化 GPT-OSSLMSYS:Blog(Chatbot Arena 团队):如何在 NVIDIA DGX Spark 上用 SGLang 优化 GPT-OSS:本地跑 Claude Code
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- LMSYS:Blog(Chatbot Arena 团队)NVIDIA ModelOpt 团队发布 gpt-oss MXFP4 微调与 SGLang 部署教程
NVIDIA ModelOpt 团队发布教程,演示用 QAT 在保留 FP4 精度的情况下微调 gpt-oss,并用 SGLang 部署。
- LMSYS:Blog(Chatbot Arena 团队)如何在 NVIDIA DGX Spark 上用 SGLang 优化 GPT-OSS:本地跑 Claude Code
SGLang 团队与 NVIDIA 合作,在 DGX Spark 上为 GPT-OSS 20B 和 120B 提供支持,实测吞吐约 70 tokens/s 和 50 tokens/s,为目前 SOTA 水平。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。