跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 2 小时前精选AI 评分70

SGLang 发布 LongCat-Flash 部署方案:美团开源 560B 参数 Agentic MoE 模型

Blog LongCat-Flash: Deploying Meituan's Agentic Model with SGLang LongCat-Flash, Meituan's open-source Agentic Mixture-of-Experts (MoE) model is now available from huggingface LongCat-Flash-Chat. Released by Meituan LongCat Team, it features: - 560B total params - 1... Meituan LongCat Team September 01, 2025

AI 导读

美团 LongCat 团队开源 Agentic MoE 模型 LongCat-Flash-Chat,总参数 560B,每 token 激活 18.6B–31.3B(平均 27B),采用 ScMoE 结构与 MLA,官方称其作为非思考基础模型在智能体任务上表现突出。

推荐理由

原文给出 LongCat-Flash 的参数结构、推理优化方案和具体部署配置,读者可据此评估其智能体场景的部署成本与速度。

正文 · AI 翻译

1. 引言:部署美团的 Agentic 开源 MoE 模型

LongCat-Flash,美团开源的 Agentic 混合专家(MoE)模型,现已在 huggingface 上提供 LongCat-Flash-Chat。该模型由美团 LongCat 团队发布,具有以下特点:

  • 560B 总参数
  • 每 token 激活 18.6B–31.3B(平均 27B)
  • 512 个 FFN 专家和 256 个零计算专家
  • 用于计算-通信重叠的 Shortcut-Connected Structure(ScMoE)
  • 多头潜在注意力(MLA)

基于多项基准测试,LongCat-Flash 作为非思考型基础模型,仅激活少量参数即可达到与主流领先模型相当的性能。它在 agent 任务上表现尤为出色。此外,得益于其面向推理效率的设计与创新,LongCat-Flash 展现出显著更快的推理速度,使其更适合复杂、耗时的 agent 应用。

benchmark_overview.jpg

更多详情,请参阅我们的技术报告 LongCat-Flash-Technical-Report。

2. 为什么模型-系统协同设计很重要?

正如我们的技术报告所述,典型的基于 ReACT 的 agent 系统由于其多轮对话特性,对 Prefill 和 Decode 速度都提出了极高要求。

对于 Prefill,我们观察到模型中并非每个 token 都需要同等的激活参数。基于此,我们设计了动态激活特性,在保持模型性能的同时,将每 token 激活参数控制在 18.6B–31.3B(平均 27B)以内,这对于减少 Prefill 计算至关重要。

对于 decode,MoE 模型的高稀疏性需要大批次来提高 GEMM(通用矩阵乘法)计算强度。虽然宽专家并行(EP)释放了 HBM 以支持更大的 KV 缓存——有效增大了批次大小,但通信成为瓶颈。计算/通信重叠是性能的关键。来自 DeepSeek V3/SGLang 的 TBO(Two Batch Overlap)通过批次重叠降低延迟,但在小批次或单请求场景下失效。吞吐量(大批次)和延迟(小批次)本质上是相互冲突的目标,在线应用中往往需要权衡。通过模型-系统协同设计,ScMoE 打破了这一权衡,同时优化吞吐量和延迟。ScMoE 的另一个优势是,密集 FFN 上的节点内张量并行通信(通过 NVLink)可以与节点间专家并行通信(通过 RDMA)完全重叠,从而最大化总网络利用率。

3. 我们的解决方案:SGLang + PD 分离 + SBO + 宽专家并行

3.1 PD 分离

为了实现预填充和解码阶段的独立优化,采用了 PD 分离架构。基于 SGLang 的 PD 分离,我们开发了具有分层传输特性的解决方案,在高 QPS 工作负载下显著降低了首 token 时间(TTFT)。

3.2 单批次重叠(SBO)

SBO 是一种四阶段流水线执行方式,利用模块级重叠充分释放 LongCat-Flash 的潜力。SBO 与 TBO 的不同之处在于,它将通信开销隐藏在单个批次内。在 SBO 中,

  • 阶段 1 需要单独执行,因为 MLA 的输出是后续阶段的输入。
  • 阶段 2 是全对全分发与 Dense FFN 和 Attn 0(QKV 投影)重叠。这种重叠至关重要,因为通信开销过大,促使我们拆分注意力过程。
  • 阶段 3 独立执行 MoE GEMM。该阶段的延迟将受益于宽 EP 部署策略。
  • 阶段 4 将 Attn 1(核心注意力和输出投影)和 Dense FFN 与 all-to-all combine 重叠。

这种编排有效缓解了通信开销,确保 LongCat-Flash 的高效推理。由于所有重叠都发生在单个批次内,SBO 同时提升了吞吐量并降低了延迟。

3.3 宽专家并行

扩大 EP 规模和增加批次大小会导致更高的通信开销,但通过 SBO,通信被密集路径计算所重叠。在 SBO 中,MoE 计算仍然暴露在外。在达到 MoE 计算的计算受限状态之前,扩大 EP 规模和批次大小可减少 MoE 计算时间。因此,SBO 可以从更宽的 EP 配置中获得性能收益。顺便提一下,我们采用了 DeepEP 进行 MoE 的 dispatch 和 combine 通信,类似于 SGLang 的实现。

3.4 其他优化

多步重叠调度器

为了提高 GPU 利用率,SGLang 实现了重叠调度器。然而,实验结果表明,LongCat-Flash 前向传播的低延迟使得单步预调度策略不足以完全消除调度开销。因此,我们实现了多步重叠调度器,在单次调度迭代中为多个前向步骤启动内核。这种方法有效地将 CPU 调度和同步隐藏在 GPU 前向过程中,确保 GPU 持续占用。

多 Token 预测

为了获得最佳推理性能,我们采用单个密集层而非 MoE 层作为 MTP 头。该功能已在 SGLang 中得到支持。由于 LongCat-Flash 的轻量级 MTP,对验证内核和草稿前向传播进行单独调度会引入显著开销。为了缓解这一问题,我们采用了 TVD 融合策略,将目标前向、验证和草稿前向融合到单个 CUDA 图中。

4. 性能

成本与延迟影响:

  • 吞吐量优化场景:LongCat-Flash 的理论成本低于同等(或更小)模型的 50%。
  • 延迟优化场景:SBO 的批内优化实现了最小延迟。

基准测试:

  • 与 DeepSeek V3 相当的吞吐量:在生成速度上表现更优。
  • 平衡的吞吐量-延迟:在 NVIDIA H800 平台上测试,以具有竞争力的成本实现 100 tps。
模型注意力上下文GPUTGSTPS/u
DeepSeek-V3-ProfileBF164096128232420
LongCat-FlashBF165000128220568.9
LongCat-FlashBF165000128804100.5

5. 使用 SGLang 部署 LongCat-Flash                                                           

我们推荐使用 SGLang 部署 LongCat-Flash。通过与 SGLang 社区的紧密合作,LongCat-Flash 从第一天起就得到了 SGLang 的支持。由于其规模为 5600 亿参数(560B),LongCat-Flash 需要至少一个 8xH20-141G 节点来以 FP8 格式托管模型权重,以及至少两个 16xH800-80G 节点用于 BF16 权重。详细的启动配置如下所示。

安装 SGLang

pip install --upgrade pip
pip install uv
uv pip install "sglang[all]>=0.5.2.rc0"

单节点部署( 8xH20-141G)

该模型可以通过结合张量并行与专家并行,在单个节点上部署。

python3 -m sglang.launch_server \
    --model meituan-longcat/LongCat-Flash-Chat-FP8 \
    --trust-remote-code \
    --attention-backend flashinfer \
    --enable-ep-moe \
    --tp 8

多节点部署( 16xH800-80G )

在多节点部署中,采用张量并行与专家并行,未来计划实现更多并行策略。 将 $NODE_RANK 和 $MASTER_IP 替换为你集群的具体值。

python3 -m sglang.launch_server \
    --model meituan-longcat/LongCat-Flash-Chat \
    --trust-remote-code \
    --attention-backend flashinfer \
    --enable-ep-moe \
    --tp 16 \
    --nnodes 2 \
    --node-rank $NODE_RANK \
    --dist-init-addr $MASTER_IP:5000

启用多令牌预测(MTP)

要在 SGLang 中启用 MTP,你可以在启动命令中添加以下参数。

    --speculative-draft-model-path meituan-longcat/LongCat-Flash-Chat \
    --speculative-algorithm NEXTN \
    --speculative-num-draft-tokens 2 \
    --speculative-num-steps 1 \
    --speculative-eagle-topk 1

6. 结论

通过利用 SGLang、PD 分离、宽专家并行和 SBO 等能力,我们为 LongCat-Flash 实现了极低的成本和快速的生成速度。LongCat-Flash 的高效推理也依赖于 SGLang 团队、Mooncake 团队、NVIDIA TensorRT-LLM 以及其他开源社区的工作。未来,我们计划与 SGLang 团队合作,逐步将我们基于 SGLang 的优化上游化,以进一步支持开源生态系统。

致谢

我们衷心感谢以下团队和合作者:

  • SGLang 团队及社区:感谢他们在 SGLang 框架上的工作。
  • Mooncake 团队感谢他们在业界最早开源的 PD 分离架构和 TransferEngine 工作。
  • NVIDIA TensorRT-LLM:感谢他们在 Hopper GPU 上的高效内核。
  • 美团 LongCat 团队:感谢我们的模型-系统协同设计。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org