GLM-4.5 与 GLM-4.5-Air 发布,SGLang 提供首日部署支持
Blog GLM-4.5 Meets SGLang: Reasoning, Coding, and Agentic Abilities Today, we are excited to introduce our latest flagship models GLM-4.5 and GLM-4.5-Air, along with their FP8 variants. All models are now available with day-one support on SGLang. GLM-4.5 and GLM-4.5-A... GLM Team July 31, 2025
GLM 团队发布旗舰模型 GLM-4.5 和 GLM-4.5-Air 及其 FP8 变体,参数规模分别为 355B(32B 激活)和 106B(12B 激活),SGLang 提供首日支持。
官方发布 GLM-4.5 系列并给出 SGLang 部署命令与架构细节,读者可据此了解参数规模和基准表现。
今天,我们很高兴推出最新的旗舰模型 GLM-4.5 和 GLM-4.5-Air,以及它们的 FP8 变体。所有模型现已在 SGLang 上获得首日支持。 GLM-4.5 和 GLM-4.5-Air 都是强大的模型,旨在统一推理、编码和智能体能力,分别拥有 355B 总参数(32B 激活)和 106B 总参数(12B 激活)。
使用 SGLang 部署 GLM-4.5
我们推荐使用 SGLang 部署 GLM-4.5 系列模型以获得最佳性能。通过与 SGLang 社区的紧密合作,所有 GLM-4.5 模型从第一天起就在 SGLang 上获得完全支持。
基本用法
安装 SGLang
pip install --upgrade pip
pip install "sglang[all]>=0.4.9.post6"
355B 模型
python3 -m sglang.launch_server --model zai-org/GLM-4.5 --tp 8
106B 模型
python3 -m sglang.launch_server --model zai-org/GLM-4.5-Air --tp 8
355B FP8 量化模型
python3 -m sglang.launch_server --model zai-org/GLM-4.5-FP8 --tp 8
106B FP8 量化模型
python3 -m sglang.launch_server --model zai-org/GLM-4.5-Air-FP8 --tp 4
工具调用
在命令中追加以下参数:
--tool-call-parser glm45
推理解析器
在命令中追加以下参数:
--reasoning-parser glm45
使用 MTP 的推测解码
在命令中追加以下参数:
--speculative-algorithm EAGLE \
--speculative-num-steps [number of steps] \
--speculative-eagle-topk [top k] \
--speculative-num-draft-tokens [number of draft tokens]
GLM 4.5 模型架构与亮点
GLM-4.5 采用 MoE 架构,具有无损平衡路由和 sigmoid 门控,提升了计算效率。与 DeepSeek-V3 和 Kimi K2 等模型相比,我们优先考虑深度而非宽度——更少的专家和更小的隐藏维度,但更多层——从而获得更好的推理性能。
关键架构设计与亮点:
- 带部分 RoPE 的分组查询注意力
- 5120 隐藏维度使用 96 个注意力头(比典型多 2.5 倍),在训练损失相近的情况下提升了 MMLU/BBH 上的推理能力
- QK-Norm 用于稳定注意力 logits
- Muon 优化器,实现更快的收敛和更大的批量大小
- MTP(多 token 预测)头用于推测解码
- RL 训练由开源框架 slime 提供支持,该框架此前由 THUDM 开源。
性能
我们在 12 个基准测试上比较了 GLM-4.5 与来自 OpenAI、Anthropic、Google DeepMind、xAI、阿里巴巴、Moonshot 和 DeepSeek 的各种模型,涵盖智能体(3 个)、推理(7 个)和编码(2 个)。总体而言,GLM-4.5 排名第 3,GLM-4.5 Air 排名第 6。

智能体能力 GLM-4.5 支持 128k 上下文和原生函数调用。在 τ-bench 和 BFCL-v3 上,它可与 Claude 4 Sonnet 匹敌,而在 BrowseComp 网页浏览基准测试上,它超越了 Claude 4 Opus(26.4% 对 18.8%),并接近 GPT o4-mini-high(28.3%)。其高工具调用成功率(90.6%)凸显了其在基于智能体的工作流中的可靠性。
推理 GLM-4.5 在数学和逻辑推理方面表现出色。它在 MMLU Pro(84.6)、AIME-24(91.0)和 MATH500(98.2)上取得了有竞争力的分数,并在 GPQA、LCB 和 AA-Index 等基准测试上展现出强大的泛化能力。
编码 GLM-4.5 展现出全面的全栈开发能力,在 SWE-bench Verified(64.2)和 Terminal-Bench(37.5)上位列顶级模型之列。在正面评估中,它对 Kimi K2 取得 53.9% 的胜率,对 Qwen3-Coder 取得 80.8% 的胜率。其高智能体可靠性、多轮编码任务性能和视觉界面质量展示了其作为自主编码助手的实力。
结论
GLM-4.5 系列代表新一代大型语言模型,在长上下文推理、智能体工作流和编码任务方面表现卓越。其混合 MoE 架构——通过分组查询注意力、MTP 和 RL 训练等技术增强——兼具高效性与强大能力。
SGLang 提供生产就绪的高性能推理栈,通过先进的内存管理和请求批处理实现无缝部署。
GLM-4.5 与 SGLang 共同构成下一代 AI 的坚实基础——为代码、文档和智能体领域的智能、可扩展解决方案提供动力。
致谢
我们衷心感谢以下团队和合作者在本次 PR 中的贡献:
- GLM 团队:Yuxuan Zhang、Chenhui Zhang、Xin Lv、Zilin Zhu 及同事。
- SGLang 团队及社区:Biao He、Lifu Huang、Binyao Jiang、Minglei Zhu、Cheng Wan、Chang Su、Xinyuan Tong 以及许多其他人。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org