LMSYS 深度评测 NVIDIA DGX Spark:本地 AI 推理的新选择
Blog NVIDIA DGX Spark In-Depth Review: A New Standard for Local AI Inference Thanks to NVIDIA’s early access program, we are thrilled to get our hands on the NVIDIA DGX™ Spark. It’s quite an unconventional system, as NVIDIA rarely releases compact, all-in-one machines that bri... Jerry Zhou and Richard Chen October 13, 2025
LMSYS(Chatbot Arena 团队)通过 NVIDIA 早鸟计划实测 DGX Spark,评测其外观、硬件与推理性能。
LMSYS 用 SGLang 和 Ollama 实测 DGX Spark 多款模型性能,指出 273 GB/s 内存带宽是瓶颈,并给出可复用的部署命令。
得益于 NVIDIA 的早期访问计划,我们非常激动能够拿到 NVIDIA DGX™ Spark。这是一款相当非比寻常的系统,因为 NVIDIA 很少发布紧凑型一体机,将超级计算级性能带入桌面工作站形态。
在过去一年中,SGLang 在数据中心领域的开发者基础迅速扩大,因其出色性能而受到推理社区的认可。成功大规模部署 DeepSeek,采用预填充-解码分离(PD)和专家并行(EP),运行在 96 个 NVIDIA H100 GPU 集群以及最新的 GB200 NVL72 系统上,SGLang 不断突破大规模推理性能和开发者生产力的边界。
受 DGX Spark 能力的启发,SGLang 如今首次从数据中心扩展到消费市场,将其久经考验的推理框架直接带给各地的开发者和研究人员。在这篇评测中,我们将仔细审视这台精美的机器,从外观美学到性能和用例。
也请查看我们的视频评测 这里。

外观
DGX Spark 是一件华丽的工程作品。它采用全金属机箱,配以光滑的香槟金饰面。前面板和后面板均采用金属泡沫材质,让我想起 NVIDIA DGX A100 和 H100 的设计。
在背面,DGX Spark 提供了令人印象深刻的连接选项:一个电源按钮、四个 USB-C 端口(最左侧支持高达 240 W 供电)、一个 HDMI 端口、一个 10 GbE RJ-45 以太网端口,以及两个由 NVIDIA ConnectX-7 NIC 驱动的 QSFP 端口,能够提供高达 200 Gbps。这些接口允许将两台 DGX Spark 单元连接在一起,使它们能够运行更大的 AI 模型。
使用 USB Type-C 进行供电是一个特别有趣的设计选择,这在其他桌面机器上几乎闻所未闻。类似系统如 Mac Mini 或 Mac Studio 依赖标准的 C5/C7 电源接口,这种接口更安全但也更笨重。NVIDIA 很可能选择 USB-C 以保持电源外置,从而为冷却系统腾出宝贵的内部空间。然而,代价是你需要格外小心,避免意外拉扯导致线缆松脱。

硬件能力
在硬件方面,DGX Spark 在其尺寸和功耗范围内提供了卓越的性能。其核心是 NVIDIA GB10 Grace Blackwell 超级芯片,专为此设备设计。它集成了 10 个 Cortex-X925 性能核心和 10 个 Cortex-A725 能效核心,总共 20 个 CPU 核心。
在 GPU 方面,GB10 可提供高达 1 PFLOP 的稀疏 FP4 张量性能,其 AI 能力大致介于 RTX 5070 和 5070 Ti 之间。其突出特点是拥有 128 GB 的一致性统一系统内存,在 CPU 和 GPU 之间无缝共享。这种统一架构使 DGX Spark 能够直接加载并运行大型模型,而无需承担系统内存到显存的数据传输开销。借助其双 QSFP 以太网端口(总带宽达 200 Gb/s),两台 DGX Spark 可连接在一起作为小型集群运行,从而实现对更大模型的分布式推理。据 NVIDIA 称,两台互联的 DGX Spark 可处理高达 4050 亿参数的 FP4 模型。
然而,这台机器唯一的缺点在于内存带宽,其统一内存为 LPDDR5x,最高提供 273 GB/s,由 CPU 和 GPU 共享。正如我们稍后将看到的,这种有限的带宽预计(并且已被实证)会成为 AI 推理性能的关键瓶颈。尽管如此,128GB 的内存使 DGX Spark 能够运行对大多数桌面系统而言过大的模型。

性能
我们使用 SGLang 和 Ollama 在 DGX Spark 上对多个开放权重的大语言模型进行了基准测试。我们的发现表明,虽然 DGX Spark 确实能够加载并运行非常大的模型,例如 GPT-OSS 120B 和 Llama 3.1 70B,但这些工作负载最适合用于原型设计和实验,而非生产环境。DGX Spark 真正出彩之处在于服务较小的模型,尤其是在利用批处理来最大化吞吐量时。
方法
⚠️ 注意:由于 DGX Spark 的软件支持仍处于早期阶段,随着未来软件更新提升性能和兼容性,本节中呈现的基准测试结果可能会过时。
测试设备
我们准备了以下系统用于基准测试:
- NVIDIA DGX Spark
- NVIDIA RTX PRO™ 6000 Blackwell 工作站版
- NVIDIA GeForce RTX 5090 创始人版
- NVIDIA GeForce RTX 5080 创始人版
- Apple Mac Studio(M1 Max,64 GB 统一内存)
- Apple Mac Mini(M4 Pro,24 GB 统一内存)
基准测试模型
我们使用两个框架 SGLang 和 Ollama 评估了多种开放权重的大语言模型,总结如下:
| 框架 | 批大小 | 模型与量化 |
|---|---|---|
| SGLang | 1–32 | Llama 3.1 8B (FP8) Llama 3.1 70B (FP8) Gemma 3 12B (FP8) Gemma 3 27B (FP8) DeepSeek-R1 14B (FP8) Qwen 3 32B (FP8) |
| Ollama | 1 | GPT-OSS 20B (MXFP4) GPT-OSS 120B (MXFP4) Llama 3.1 8B (q4_K_M / q8_0) Llama 3.1 70B (q4_K_M) Gemma 3 12B (q4_K_M / q8_0) Gemma 3 27B (q4_K_M / q8_0) DeepSeek-R1 14B (q4_K_M / q8_0) Qwen 3 32B (q4_K_M / q8_0) |
我们还在上述部分模型上测试了使用 SGLang 的推测解码(EAGLE3)。我们排除了超出目标机器可用 RAM 或 VRAM 容量的模型。
结果
完整的基准测试结果可在此处找到。
总体性能
虽然 DGX Spark 在其尺寸和功耗范围内展现了令人印象深刻的工程设计,但与全尺寸独立 GPU 系统相比,其原始性能受到限制是可以理解的。
例如,在 Ollama 中运行 GPT-OSS 20B (MXFP4) 时,Spark 达到了 2,053 tps prefill / 49.7 tps decode,而 RTX Pro 6000 Blackwell 则达到了 10,108 tps / 215 tps,大约快 4 倍。即便是 GeForce RTX 5090 也达到了 8,519 tps / 205 tps,这证实了 Spark 的统一 LPDDR5x 内存带宽是主要的限制因素。
然而,对于较小的模型,尤其是 Llama 3.1 8B,DGX Spark 表现不俗。在 batch 1 下使用 SGLang 时,它达到了 7,991 tps prefill / 20.5 tps decode,并在 batch 32 时线性扩展至 7,949 tps / 368 tps,展现出出色的批处理效率以及各次运行间强劲的吞吐量一致性。
紧凑型统一内存工作负载方面的优势
DGX Spark 的标志性优势之一在于其 128 GB 一致性统一内存,它允许 CPU 和 GPU 访问同一地址空间。
这使得大型模型,例如 Llama 3.1 70B、Gemma 3 27B,甚至 GPT-OSS 120B,能够直接加载到内存中,而无需传统系统到 VRAM 的传输开销。尽管外形紧凑,Spark 仍成功以 803 tps prefill / 2.7 tps decode 运行了 Llama 3.1 70B (FP8),这对于一台安静放置在桌面上的工作站来说非常出色。
这种统一内存设计使 DGX Spark 对于原型设计、模型实验和边缘 AI 研究尤为有价值,在这些场景中,无缝内存访问往往比原始 TFLOPs 更有用。
投机解码加速
为了进一步探索 DGX Spark 上的性能优化,我们在 SGLang 中使用 EAGLE 3 启用了投机解码。该技术允许较小的“草稿”模型提前提出多个 token,而较大的目标模型并行验证它们。
启用投机解码后,我们在多个模型(例如 Llama 3.1 8B)上观察到端到端推理吞吐量相比标准解码最高可提升 2 倍。
这一改进有效缓解了部分统一内存带宽限制,并表明诸如投机解码之类的软件层面创新能够切实提升像 DGX Spark 这样紧凑、带宽受限系统上的推理性能。
效率与散热设计
DGX Spark 在高强度测试中保持持续吞吐量,没有出现热降频。即使在全负载下,例如 SGLang DeepSeek-R1 14B (FP8) 在 batch 8 下达到 2,074 tps / 83.5 tps,风扇噪音和温度仍保持稳定,凸显了 NVIDIA 出色的金属泡沫散热设计和经过良好优化的供电系统。
其 USB-C 电源输入(最高 240 W)和外部 PSU 为机箱内部提供了更大的散热余量,与 Mac Mini 或 Mac Studio 等紧凑型消费级系统相比,这对于长时间运行的工作负载是一个明显优势,后者在类似测试中出现了热衰减。
总结
简而言之,DGX Spark 并非为了与全尺寸的 Blackwell 或 Ada-Lovelace GPU 正面竞争,而是将 DGX 体验带入紧凑、对开发者友好的形态。
它是以下场景的理想平台:
- 模型原型设计与实验
- 轻量级端侧推理
- 内存一致性 GPU 架构研究
它是一台精美、精心设计的迷你超级计算机,以原始性能换取可及性、效率和优雅,而在这些方面,它绝对大放异彩。

使用场景
SGLang 模型服务
DGX Spark 预装了 Docker,让你只需一条命令即可通过 SGLang 提供开放权重模型的服务:
docker run --gpus all \
--shm-size 32g \
-p 30000:30000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=<secret>" \
--ipc=host \
lmsysorg/sglang:spark \
python3 -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct --quantization fp8 --host 0.0.0.0 --port 30000
将 <secret> 替换为你自己的 Hugging Face 访问令牌。
启用推测解码(EAGLE3)
要使用 EAGLE3 启用推测解码,只需运行以下命令:
docker run --gpus all \
--shm-size 32g \
-p 30000:30000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=<secret>" \
--env "SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1" \
--ipc=host \
lmsysorg/sglang:spark \
python3 -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct --quantization fp8 --host 0.0.0.0 --port 30000 \
--speculative-algorithm EAGLE3 \
--speculative-draft-model-path jamesliu1/sglang-EAGLE3-Llama-3.1-Instruct-8B \
--speculative-num-steps 5 \
--speculative-eagle-topk 8 \
--speculative-num-draft-tokens 32 \
--mem-fraction 0.6 \
--cuda-graph-max-bs 2 \
--dtype float16
启用推测解码后,SGLang 可以利用一个较小的草稿模型提前预测多个 token,与标准解码相比,有效将推理吞吐量翻倍。
通过 OpenAI 兼容 API 发送请求
一旦 SGLang 成功初始化,你就可以通过 OpenAI 兼容的 API 端点与你的模型交互:
curl http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"messages": [
{
"role": "system",
"content": "You are a helpful assistant."
},
{
"role": "user",
"content": "How many letters are there in the word SGLang?"
}
]
}'

与本地模型聊天
当你设置好 SGLang 并让它服务一个模型后,你可以轻松将其连接到 Open WebUI,与你喜欢的任何开放权重模型聊天。Open WebUI 提供了一个简洁的、基于浏览器的界面,完全兼容 OpenAI 风格的 API,这意味着它可以与你的本地 SGLang 服务器无缝协作。只需快速配置指向你的 DGX Spark 端点,你就可以直接从浏览器与 Llama 3、Gemma 3 或 DeepSeek-R1 等模型交互,无需云依赖、无延迟,并完全掌控你的数据。

使用本地模型编程
利用 DGX Spark 最实用的方式之一是作为本地编程助手,完全离线且安全。
通过将 Zed(一款现代 AI 集成代码编辑器)与 Ollama 结合,你可以在本地运行 GPT-OSS 20B,为代码补全、内联聊天和智能重构提供支持,而无需依赖云端。
步骤 1. 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
步骤 2. 拉取 GPT-OSS 20B 用于编程
ollama pull gpt-oss:20b
步骤 3. 将 Zed 与 Ollama 集成
安装 Zed:
curl -f https://zed.dev/install.sh | sh
Zed 会自动检测由 Ollama 服务的本地模型,让你在启动编辑器后即可立即使用内置聊天助手。

结论
NVIDIA DGX Spark 是对个人 AI 计算未来的一次迷人窥探。它将曾经专属于数据中心的东西:大内存、高带宽以太网互连和 Blackwell 级性能,提炼成一个紧凑、设计精美的桌面形态。虽然它在原始吞吐量上无法与全尺寸 DGX 服务器或独立 RTX GPU 匹敌,但它在可及性、效率和多功能性方面大放异彩。
从运行 SGLang 和 Ollama 进行本地模型服务,到试验推测解码(EAGLE3),再到通过双 Spark 集群探索分布式推理,该平台证明了自己不仅仅是一台微型超级计算机。它是面向 AI 新时代的开发者沙盒。
NVIDIA DGX Spark 并非为取代云规模基础设施而打造;它的设计目标是将 AI 实验带到你的桌面上。无论你是在对开放权重的 LLM 进行基准测试、开发推理框架,还是构建自己的私有编码助手,Spark 都能让你在本地安静、优雅地完成这一切,并带有 NVIDIA 无可置疑的工程打磨。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org