SGLang 发布 LongCat-Flash 部署方案:美团开源 560B 参数 Agentic MoE 模型
Blog LongCat-Flash: Deploying Meituan's Agentic Model with SGLang LongCat-Flash, Meituan's open-source Agentic Mixture-of-Experts (MoE) model is now available from huggingface LongCat-Flash-Chat. Released by Meituan LongCat Team, it features: - 560B total params - 1... Meituan LongCat Team September 01, 2025
美团 LongCat 团队开源 Agentic MoE 模型 LongCat-Flash-Chat,总参数 560B,每 token 激活 18.6B–31.3B(平均 27B),采用 ScMoE 结构与 MLA,官方称其作为非思考基础模型在智能体任务上表现突出。
原文给出 LongCat-Flash 的参数结构、推理优化方案和具体部署配置,读者可据此评估其智能体场景的部署成本与速度。
1. 引言:部署美团的 Agentic 开源 MoE 模型
LongCat-Flash,美团开源的 Agentic 混合专家(MoE)模型,现已在 huggingface 上提供 LongCat-Flash-Chat。该模型由美团 LongCat 团队发布,具有以下特点:
- 560B 总参数
- 每 token 激活 18.6B–31.3B(平均 27B)
- 512 个 FFN 专家和 256 个零计算专家
- 用于计算-通信重叠的 Shortcut-Connected Structure(ScMoE)
- 多头潜在注意力(MLA)
基于多项基准测试,LongCat-Flash 作为非思考型基础模型,仅激活少量参数即可达到与主流领先模型相当的性能。它在 agent 任务上表现尤为出色。此外,得益于其面向推理效率的设计与创新,LongCat-Flash 展现出显著更快的推理速度,使其更适合复杂、耗时的 agent 应用。

更多详情,请参阅我们的技术报告 LongCat-Flash-Technical-Report。
2. 为什么模型-系统协同设计很重要?
正如我们的技术报告所述,典型的基于 ReACT 的 agent 系统由于其多轮对话特性,对 Prefill 和 Decode 速度都提出了极高要求。
对于 Prefill,我们观察到模型中并非每个 token 都需要同等的激活参数。基于此,我们设计了动态激活特性,在保持模型性能的同时,将每 token 激活参数控制在 18.6B–31.3B(平均 27B)以内,这对于减少 Prefill 计算至关重要。
对于 decode,MoE 模型的高稀疏性需要大批次来提高 GEMM(通用矩阵乘法)计算强度。虽然宽专家并行(EP)释放了 HBM 以支持更大的 KV 缓存——有效增大了批次大小,但通信成为瓶颈。计算/通信重叠是性能的关键。来自 DeepSeek V3/SGLang 的 TBO(Two Batch Overlap)通过批次重叠降低延迟,但在小批次或单请求场景下失效。吞吐量(大批次)和延迟(小批次)本质上是相互冲突的目标,在线应用中往往需要权衡。通过模型-系统协同设计,ScMoE 打破了这一权衡,同时优化吞吐量和延迟。ScMoE 的另一个优势是,密集 FFN 上的节点内张量并行通信(通过 NVLink)可以与节点间专家并行通信(通过 RDMA)完全重叠,从而最大化总网络利用率。
3. 我们的解决方案:SGLang + PD 分离 + SBO + 宽专家并行
3.1 PD 分离
为了实现预填充和解码阶段的独立优化,采用了 PD 分离架构。基于 SGLang 的 PD 分离,我们开发了具有分层传输特性的解决方案,在高 QPS 工作负载下显著降低了首 token 时间(TTFT)。
3.2 单批次重叠(SBO)
SBO 是一种四阶段流水线执行方式,利用模块级重叠充分释放 LongCat-Flash 的潜力。SBO 与 TBO 的不同之处在于,它将通信开销隐藏在单个批次内。在 SBO 中,
- 阶段 1 需要单独执行,因为 MLA 的输出是后续阶段的输入。
- 阶段 2 是全对全分发与 Dense FFN 和 Attn 0(QKV 投影)重叠。这种重叠至关重要,因为通信开销过大,促使我们拆分注意力过程。
- 阶段 3 独立执行 MoE GEMM。该阶段的延迟将受益于宽 EP 部署策略。
- 阶段 4 将 Attn 1(核心注意力和输出投影)和 Dense FFN 与 all-to-all combine 重叠。
这种编排有效缓解了通信开销,确保 LongCat-Flash 的高效推理。由于所有重叠都发生在单个批次内,SBO 同时提升了吞吐量并降低了延迟。
3.3 宽专家并行
扩大 EP 规模和增加批次大小会导致更高的通信开销,但通过 SBO,通信被密集路径计算所重叠。在 SBO 中,MoE 计算仍然暴露在外。在达到 MoE 计算的计算受限状态之前,扩大 EP 规模和批次大小可减少 MoE 计算时间。因此,SBO 可以从更宽的 EP 配置中获得性能收益。顺便提一下,我们采用了 DeepEP 进行 MoE 的 dispatch 和 combine 通信,类似于 SGLang 的实现。
3.4 其他优化
多步重叠调度器
为了提高 GPU 利用率,SGLang 实现了重叠调度器。然而,实验结果表明,LongCat-Flash 前向传播的低延迟使得单步预调度策略不足以完全消除调度开销。因此,我们实现了多步重叠调度器,在单次调度迭代中为多个前向步骤启动内核。这种方法有效地将 CPU 调度和同步隐藏在 GPU 前向过程中,确保 GPU 持续占用。
多 Token 预测
为了获得最佳推理性能,我们采用单个密集层而非 MoE 层作为 MTP 头。该功能已在 SGLang 中得到支持。由于 LongCat-Flash 的轻量级 MTP,对验证内核和草稿前向传播进行单独调度会引入显著开销。为了缓解这一问题,我们采用了 TVD 融合策略,将目标前向、验证和草稿前向融合到单个 CUDA 图中。
4. 性能
成本与延迟影响:
- 吞吐量优化场景:LongCat-Flash 的理论成本低于同等(或更小)模型的 50%。
- 延迟优化场景:SBO 的批内优化实现了最小延迟。
基准测试:
- 与 DeepSeek V3 相当的吞吐量:在生成速度上表现更优。
- 平衡的吞吐量-延迟:在 NVIDIA H800 平台上测试,以具有竞争力的成本实现 100 tps。
| 模型 | 注意力 | 上下文 | GPU | TGS | TPS/u |
|---|---|---|---|---|---|
| DeepSeek-V3-Profile | BF16 | 4096 | 128 | 2324 | 20 |
| LongCat-Flash | BF16 | 5000 | 128 | 2205 | 68.9 |
| LongCat-Flash | BF16 | 5000 | 128 | 804 | 100.5 |
5. 使用 SGLang 部署 LongCat-Flash
我们推荐使用 SGLang 部署 LongCat-Flash。通过与 SGLang 社区的紧密合作,LongCat-Flash 从第一天起就得到了 SGLang 的支持。由于其规模为 5600 亿参数(560B),LongCat-Flash 需要至少一个 8xH20-141G 节点来以 FP8 格式托管模型权重,以及至少两个 16xH800-80G 节点用于 BF16 权重。详细的启动配置如下所示。
安装 SGLang
pip install --upgrade pip
pip install uv
uv pip install "sglang[all]>=0.5.2.rc0"
单节点部署( 8xH20-141G)
该模型可以通过结合张量并行与专家并行,在单个节点上部署。
python3 -m sglang.launch_server \
--model meituan-longcat/LongCat-Flash-Chat-FP8 \
--trust-remote-code \
--attention-backend flashinfer \
--enable-ep-moe \
--tp 8
多节点部署( 16xH800-80G )
在多节点部署中,采用张量并行与专家并行,未来计划实现更多并行策略。
将 $NODE_RANK 和 $MASTER_IP 替换为你集群的具体值。
python3 -m sglang.launch_server \
--model meituan-longcat/LongCat-Flash-Chat \
--trust-remote-code \
--attention-backend flashinfer \
--enable-ep-moe \
--tp 16 \
--nnodes 2 \
--node-rank $NODE_RANK \
--dist-init-addr $MASTER_IP:5000
启用多令牌预测(MTP)
要在 SGLang 中启用 MTP,你可以在启动命令中添加以下参数。
--speculative-draft-model-path meituan-longcat/LongCat-Flash-Chat \
--speculative-algorithm NEXTN \
--speculative-num-draft-tokens 2 \
--speculative-num-steps 1 \
--speculative-eagle-topk 1
6. 结论
通过利用 SGLang、PD 分离、宽专家并行和 SBO 等能力,我们为 LongCat-Flash 实现了极低的成本和快速的生成速度。LongCat-Flash 的高效推理也依赖于 SGLang 团队、Mooncake 团队、NVIDIA TensorRT-LLM 以及其他开源社区的工作。未来,我们计划与 SGLang 团队合作,逐步将我们基于 SGLang 的优化上游化,以进一步支持开源生态系统。
致谢
我们衷心感谢以下团队和合作者:
- SGLang 团队及社区:感谢他们在 SGLang 框架上的工作。
- Mooncake 团队感谢他们在业界最早开源的 PD 分离架构和 TransferEngine 工作。
- NVIDIA TensorRT-LLM:感谢他们在 Hopper GPU 上的高效内核。
- 美团 LongCat 团队:感谢我们的模型-系统协同设计。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org