跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 2 小时前精选AI 评分62

LMSYS 深度评测 NVIDIA DGX Spark:本地 AI 推理的新选择

Blog NVIDIA DGX Spark In-Depth Review: A New Standard for Local AI Inference Thanks to NVIDIA’s early access program, we are thrilled to get our hands on the NVIDIA DGX™ Spark. It’s quite an unconventional system, as NVIDIA rarely releases compact, all-in-one machines that bri... Jerry Zhou and Richard Chen October 13, 2025

AI 导读

LMSYS(Chatbot Arena 团队)通过 NVIDIA 早鸟计划实测 DGX Spark,评测其外观、硬件与推理性能。

推荐理由

LMSYS 用 SGLang 和 Ollama 实测 DGX Spark 多款模型性能,指出 273 GB/s 内存带宽是瓶颈,并给出可复用的部署命令。

正文 · AI 翻译

得益于 NVIDIA 的早期访问计划,我们非常激动能够拿到 NVIDIA DGX™ Spark。这是一款相当非比寻常的系统,因为 NVIDIA 很少发布紧凑型一体机,将超级计算级性能带入桌面工作站形态。

在过去一年中,SGLang 在数据中心领域的开发者基础迅速扩大,因其出色性能而受到推理社区的认可。成功大规模部署 DeepSeek,采用预填充-解码分离(PD)和专家并行(EP),运行在 96 个 NVIDIA H100 GPU 集群以及最新的 GB200 NVL72 系统上,SGLang 不断突破大规模推理性能和开发者生产力的边界。

受 DGX Spark 能力的启发,SGLang 如今首次从数据中心扩展到消费市场,将其久经考验的推理框架直接带给各地的开发者和研究人员。在这篇评测中,我们将仔细审视这台精美的机器,从外观美学到性能和用例。

也请查看我们的视频评测 这里。

外观

DGX Spark 是一件华丽的工程作品。它采用全金属机箱,配以光滑的香槟金饰面。前面板和后面板均采用金属泡沫材质,让我想起 NVIDIA DGX A100 和 H100 的设计。

在背面,DGX Spark 提供了令人印象深刻的连接选项:一个电源按钮、四个 USB-C 端口(最左侧支持高达 240 W 供电)、一个 HDMI 端口、一个 10 GbE RJ-45 以太网端口,以及两个由 NVIDIA ConnectX-7 NIC 驱动的 QSFP 端口,能够提供高达 200 Gbps。这些接口允许将两台 DGX Spark 单元连接在一起,使它们能够运行更大的 AI 模型。

使用 USB Type-C 进行供电是一个特别有趣的设计选择,这在其他桌面机器上几乎闻所未闻。类似系统如 Mac Mini 或 Mac Studio 依赖标准的 C5/C7 电源接口,这种接口更安全但也更笨重。NVIDIA 很可能选择 USB-C 以保持电源外置,从而为冷却系统腾出宝贵的内部空间。然而,代价是你需要格外小心,避免意外拉扯导致线缆松脱。

硬件能力

在硬件方面,DGX Spark 在其尺寸和功耗范围内提供了卓越的性能。其核心是 NVIDIA GB10 Grace Blackwell 超级芯片,专为此设备设计。它集成了 10 个 Cortex-X925 性能核心和 10 个 Cortex-A725 能效核心,总共 20 个 CPU 核心。

在 GPU 方面,GB10 可提供高达 1 PFLOP 的稀疏 FP4 张量性能,其 AI 能力大致介于 RTX 5070 和 5070 Ti 之间。其突出特点是拥有 128 GB 的一致性统一系统内存,在 CPU 和 GPU 之间无缝共享。这种统一架构使 DGX Spark 能够直接加载并运行大型模型,而无需承担系统内存到显存的数据传输开销。借助其双 QSFP 以太网端口(总带宽达 200 Gb/s),两台 DGX Spark 可连接在一起作为小型集群运行,从而实现对更大模型的分布式推理。据 NVIDIA 称,两台互联的 DGX Spark 可处理高达 4050 亿参数的 FP4 模型。

然而,这台机器唯一的缺点在于内存带宽,其统一内存为 LPDDR5x,最高提供 273 GB/s,由 CPU 和 GPU 共享。正如我们稍后将看到的,这种有限的带宽预计(并且已被实证)会成为 AI 推理性能的关键瓶颈。尽管如此,128GB 的内存使 DGX Spark 能够运行对大多数桌面系统而言过大的模型。

性能

我们使用 SGLang 和 Ollama 在 DGX Spark 上对多个开放权重的大语言模型进行了基准测试。我们的发现表明,虽然 DGX Spark 确实能够加载并运行非常大的模型,例如 GPT-OSS 120B 和 Llama 3.1 70B,但这些工作负载最适合用于原型设计和实验,而非生产环境。DGX Spark 真正出彩之处在于服务较小的模型,尤其是在利用批处理来最大化吞吐量时。

方法

⚠️ 注意:由于 DGX Spark 的软件支持仍处于早期阶段,随着未来软件更新提升性能和兼容性,本节中呈现的基准测试结果可能会过时。

测试设备

我们准备了以下系统用于基准测试:

  • NVIDIA DGX Spark
  • NVIDIA RTX PRO™ 6000 Blackwell 工作站版
  • NVIDIA GeForce RTX 5090 创始人版
  • NVIDIA GeForce RTX 5080 创始人版
  • Apple Mac Studio(M1 Max,64 GB 统一内存)
  • Apple Mac Mini(M4 Pro,24 GB 统一内存)

基准测试模型

我们使用两个框架 SGLang 和 Ollama 评估了多种开放权重的大语言模型,总结如下:

框架批大小模型与量化
SGLang1–32Llama 3.1 8B (FP8)
Llama 3.1 70B (FP8)
Gemma 3 12B (FP8)
Gemma 3 27B (FP8)
DeepSeek-R1 14B (FP8)
Qwen 3 32B (FP8)
Ollama1GPT-OSS 20B (MXFP4)
GPT-OSS 120B (MXFP4)
Llama 3.1 8B (q4_K_M / q8_0)
Llama 3.1 70B (q4_K_M)
Gemma 3 12B (q4_K_M / q8_0)
Gemma 3 27B (q4_K_M / q8_0)
DeepSeek-R1 14B (q4_K_M / q8_0)
Qwen 3 32B (q4_K_M / q8_0)

我们还在上述部分模型上测试了使用 SGLang 的推测解码(EAGLE3)。我们排除了超出目标机器可用 RAM 或 VRAM 容量的模型。

结果

完整的基准测试结果可在此处找到。

总体性能

虽然 DGX Spark 在其尺寸和功耗范围内展现了令人印象深刻的工程设计,但与全尺寸独立 GPU 系统相比,其原始性能受到限制是可以理解的。

例如,在 Ollama 中运行 GPT-OSS 20B (MXFP4) 时,Spark 达到了 2,053 tps prefill / 49.7 tps decode,而 RTX Pro 6000 Blackwell 则达到了 10,108 tps / 215 tps,大约快 4 倍。即便是 GeForce RTX 5090 也达到了 8,519 tps / 205 tps,这证实了 Spark 的统一 LPDDR5x 内存带宽是主要的限制因素。

然而,对于较小的模型,尤其是 Llama 3.1 8B,DGX Spark 表现不俗。在 batch 1 下使用 SGLang 时,它达到了 7,991 tps prefill / 20.5 tps decode,并在 batch 32 时线性扩展至 7,949 tps / 368 tps,展现出出色的批处理效率以及各次运行间强劲的吞吐量一致性。

紧凑型统一内存工作负载方面的优势

DGX Spark 的标志性优势之一在于其 128 GB 一致性统一内存,它允许 CPU 和 GPU 访问同一地址空间。

这使得大型模型,例如 Llama 3.1 70B、Gemma 3 27B,甚至 GPT-OSS 120B,能够直接加载到内存中,而无需传统系统到 VRAM 的传输开销。尽管外形紧凑,Spark 仍成功以 803 tps prefill / 2.7 tps decode 运行了 Llama 3.1 70B (FP8),这对于一台安静放置在桌面上的工作站来说非常出色。

这种统一内存设计使 DGX Spark 对于原型设计、模型实验和边缘 AI 研究尤为有价值,在这些场景中,无缝内存访问往往比原始 TFLOPs 更有用。

投机解码加速

为了进一步探索 DGX Spark 上的性能优化,我们在 SGLang 中使用 EAGLE 3 启用了投机解码。该技术允许较小的“草稿”模型提前提出多个 token,而较大的目标模型并行验证它们。

启用投机解码后,我们在多个模型(例如 Llama 3.1 8B)上观察到端到端推理吞吐量相比标准解码最高可提升 2 倍。

这一改进有效缓解了部分统一内存带宽限制,并表明诸如投机解码之类的软件层面创新能够切实提升像 DGX Spark 这样紧凑、带宽受限系统上的推理性能。

效率与散热设计

DGX Spark 在高强度测试中保持持续吞吐量,没有出现热降频。即使在全负载下,例如 SGLang DeepSeek-R1 14B (FP8) 在 batch 8 下达到 2,074 tps / 83.5 tps,风扇噪音和温度仍保持稳定,凸显了 NVIDIA 出色的金属泡沫散热设计和经过良好优化的供电系统。

其 USB-C 电源输入(最高 240 W)和外部 PSU 为机箱内部提供了更大的散热余量,与 Mac Mini 或 Mac Studio 等紧凑型消费级系统相比,这对于长时间运行的工作负载是一个明显优势,后者在类似测试中出现了热衰减。

总结

简而言之,DGX Spark 并非为了与全尺寸的 Blackwell 或 Ada-Lovelace GPU 正面竞争,而是将 DGX 体验带入紧凑、对开发者友好的形态。
它是以下场景的理想平台:

  • 模型原型设计与实验
  • 轻量级端侧推理
  • 内存一致性 GPU 架构研究

它是一台精美、精心设计的迷你超级计算机,以原始性能换取可及性、效率和优雅,而在这些方面,它绝对大放异彩。

使用场景

SGLang 模型服务

DGX Spark 预装了 Docker,让你只需一条命令即可通过 SGLang 提供开放权重模型的服务:

docker run --gpus all \
    --shm-size 32g \
    -p 30000:30000 \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    --env "HF_TOKEN=<secret>" \
    --ipc=host \
    lmsysorg/sglang:spark \
    python3 -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct --quantization fp8 --host 0.0.0.0 --port 30000

将 <secret> 替换为你自己的 Hugging Face 访问令牌。

启用推测解码(EAGLE3)

要使用 EAGLE3 启用推测解码,只需运行以下命令:

docker run --gpus all \
    --shm-size 32g \
    -p 30000:30000 \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    --env "HF_TOKEN=<secret>" \
    --env "SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1" \
    --ipc=host \
    lmsysorg/sglang:spark \
    python3 -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct --quantization fp8 --host 0.0.0.0 --port 30000 \
    --speculative-algorithm EAGLE3 \
    --speculative-draft-model-path jamesliu1/sglang-EAGLE3-Llama-3.1-Instruct-8B \
    --speculative-num-steps 5 \
    --speculative-eagle-topk 8 \
    --speculative-num-draft-tokens 32 \
    --mem-fraction 0.6 \
    --cuda-graph-max-bs 2 \
    --dtype float16

启用推测解码后,SGLang 可以利用一个较小的草稿模型提前预测多个 token,与标准解码相比,有效将推理吞吐量翻倍。

通过 OpenAI 兼容 API 发送请求

一旦 SGLang 成功初始化,你就可以通过 OpenAI 兼容的 API 端点与你的模型交互:

curl http://localhost:30000/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{
        "messages": [
            {
                "role": "system",
                "content": "You are a helpful assistant."
            },
            {
                "role": "user",
                "content": "How many letters are there in the word SGLang?"
            }
        ]
    }'

与本地模型聊天

当你设置好 SGLang 并让它服务一个模型后,你可以轻松将其连接到 Open WebUI,与你喜欢的任何开放权重模型聊天。Open WebUI 提供了一个简洁的、基于浏览器的界面,完全兼容 OpenAI 风格的 API,这意味着它可以与你的本地 SGLang 服务器无缝协作。只需快速配置指向你的 DGX Spark 端点,你就可以直接从浏览器与 Llama 3、Gemma 3 或 DeepSeek-R1 等模型交互,无需云依赖、无延迟,并完全掌控你的数据。

使用本地模型编程

利用 DGX Spark 最实用的方式之一是作为本地编程助手,完全离线且安全。

通过将 Zed(一款现代 AI 集成代码编辑器)与 Ollama 结合,你可以在本地运行 GPT-OSS 20B,为代码补全、内联聊天和智能重构提供支持,而无需依赖云端。

步骤 1. 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

步骤 2. 拉取 GPT-OSS 20B 用于编程

ollama pull gpt-oss:20b

步骤 3. 将 Zed 与 Ollama 集成

安装 Zed:

curl -f https://zed.dev/install.sh | sh

Zed 会自动检测由 Ollama 服务的本地模型,让你在启动编辑器后即可立即使用内置聊天助手。

结论

NVIDIA DGX Spark 是对个人 AI 计算未来的一次迷人窥探。它将曾经专属于数据中心的东西:大内存、高带宽以太网互连和 Blackwell 级性能,提炼成一个紧凑、设计精美的桌面形态。虽然它在原始吞吐量上无法与全尺寸 DGX 服务器或独立 RTX GPU 匹敌,但它在可及性、效率和多功能性方面大放异彩。

从运行 SGLang 和 Ollama 进行本地模型服务,到试验推测解码(EAGLE3),再到通过双 Spark 集群探索分布式推理,该平台证明了自己不仅仅是一台微型超级计算机。它是面向 AI 新时代的开发者沙盒。

NVIDIA DGX Spark 并非为取代云规模基础设施而打造;它的设计目标是将 AI 实验带到你的桌面上。无论你是在对开放权重的 LLM 进行基准测试、开发推理框架,还是构建自己的私有编码助手,Spark 都能让你在本地安静、优雅地完成这一切,并带有 NVIDIA 无可置疑的工程打磨。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org