Modal 上线 GLM-5 免费端点并发布部署指南
Try GLM-5.1, the new frontier of open intelligence, on Modal
Modal 与 Z.ai 合作,为开源权重模型 GLM-5 提供免费端点(限单并发请求,开放至 4 月底),并给出可复现的自部署代码。
Modal 官方给出 GLM-5 的部署细节和免费端点,读者可以据此了解开源前沿模型的自托管方案。
更新 2026-04-07:今天,Z.ai 发布了 GLM-5.1,再次刷新了开放权重智能的最高水平。我们的免费端点已升级以提供这个新版本。
今天 Z.ai 发布了 GLM-5,这是一个前沿的开放权重基础语言模型,专为长时程智能体和系统工程而设计。
Modal 研究团队在公开发布前与 Z.ai 合作,以便我们能在自己的基础设施上试驾该模型。它令人愉悦、聪明且快速。在内部,我们已将其加入我们最喜欢的 AI 前端:Vercel AI SDK、Claude Code、OpenCode 和 OpenClaw。
现在你也可以了:免费试用!
为什么这很重要?
如果你还没注意到,软件工程师已经正式被自动化取代了工作;我们现在都是提示工程师了。
嗯,也不完全是。但在过去两个月里,氛围编程发生了一次氛围转变,因为来自 Linus Torvalds(Linux)到 dhh(Ruby on Rails)的严肃、有品味的资深工程师们越来越多地拥抱用智能体编程。就连 George Hotz 也称智能体编程“还行”。
缺失的一环是模型质量。每一代新的前沿模型都支持一个更新、更雄心勃勃的应用,从GPT-3 模型的早期标签补全(code-davinci-002 安息)到GPT-3.5/Claude 2 的聊天助手副驾驶再到GPT-4/Claude 3 的简单应用开发。现在,有了 Claude Opus 4.6 和 GPT 5.3 Codex,前沿支持长时程任务,比如复杂系统的开发和改进。如果你不信,就去问问你那个整天泡在网上、对 Claude Code 和 ClawdeBot moltbot OpenClaw 喋喋不休的朋友。
和以往一样,这个新的应用领域是由专有模型开创的——这些模型的权重不在开源促进会批准的许可证下提供,比如 MIT 或 Apache。但自从 DeepSeek 划时代地发布 DeepSeek-R1 以来,开放模型一直没有落后太远。现在,GLM-5 匹配了上个月发布的专有模型的性能,并以 MIT 许可证提供。
关于上述基准测试及更多细节,请参阅 Z.ai 的博客文章。
我如何运行 GLM-5?
我们已经深入撰写了关于 LLM 推理性能特征的文章,但这里我们快速梳理一下 GLM-5 的核心考量。在八位浮点精度下,GLM-5 重约 700 GB。这比市场上任何单块 GPU 的 HBM 都大,因此必须部署到多块 GPU 上以避免性能暴跌。像大多数大型模型一样,它在 MLP 块的矩阵乘法中使用混合专家(MoE)稀疏性来减少对内存带宽的需求。DeepSeek 稀疏注意力的一个变体通过一个轻量级、数据依赖的过滤层(“索引器”)快速过滤掉除几千个过去 token 之外的所有内容,从而控制注意力机制随序列长度呈惩罚性二次方扩展的问题。我们最终确定在 MoE 层使用张量并行(使用 DeepSeek 的 DeepGemm 内核),在注意力层使用数据并行(使用 DeepSeek 的 FlashMLA 内核)来运行它。
借助 vLLM 和 SGLang 等高质量开源推理引擎,任何拥有合适硬件的工程师都可以自行托管该模型,并以出色的单用户延迟支持长时程智能体和系统工程任务。我们一直在内部运行该模型,每用户交互速度在每秒 30 到 75 个 token 之间(取决于副本负载和推测器命中率)。
在撰写本文时,让 GLM-5 运行起来还需要一些补丁,我们在此处记录了可复现的部署代码。该代码在我们云平台的单节点八张 B200 上使用 SGLang 部署 GLM-5。我们预计后续会快速跟进,以稳定支持并提升性能,包括整合我们在Flash Attention 4 推理优化路径上的工作。
如何使用 GLM-5?
为了支持所有想试用 GLM-5 的人,我们发布了一个端点,你可以将其连接到最喜欢的 AI 前端。而且它是免费的!从现在起到四月底。你可以在此处生成凭证并开始使用。
使用量限制为单个并发请求。对 token 没有直接限制——请求数才是真正重要的!我们发现这很好地对应了编码智能体的“个人使用”场景:一个或少数几个活跃的客户端线程,每个线程可能跨越数千个 token。
这是我们首次在示例自部署代码之外还发布端点。Modal Research 团队在这方面还会有更多进展。
有生产用例的想法?请联系 sales@modal.com 讨论更高的速率限制,或获取关于在 Modal 上部署你自己的 GLM-5 端点的指导。
下面,我们记录如何将我们的 GLM-5 端点与各种前端框架集成。我们运行的是与 OpenAI API 兼容的服务器,因此集成路径通常会通过你的框架对该 API 的支持来实现。
如何将 GLM-5 与 OpenCode 一起使用?
我们非常喜欢 OpenCode 编码智能体框架。它易于配置,与其他工具广泛兼容,并且高度可扩展。
一旦你为 Modal GLM-5 端点创建了 token,只需在 opencode.json 配置文件中将 Modal 添加为一个 provider,如下方示例所示。你可以在此处找到文档。
如果你想扩展你的 OpenCode 智能体,可以尝试将它们部署到 Modal Sandbox 上。你保留 HTTP API 以及易用的 Web 和终端 UI,同时获得超快速自动扩缩的云基础设施。这正是Ramp 在 Modal Sandboxes 上用 OpenCode 构建其 Inspect 后台编码智能体的原因。
如何将 GLM-5 与 OpenClaw 一起使用?
目前最热门的智能体框架是 OpenClaw,它广泛地将 LLM API 与工具、知识源和技能集成在一起。如果你觉得 --dangerously-skip-permissions 很吓人,那你还没见过更厉害的呢!
OpenClaw 通过在 openclaw.json 中定义的模型提供者的 api 键的 openai-completions 设置,支持与 OpenAI API 兼容的提供者。
从下方片段中复制 modal 键和值,将其添加到你的 openclaw.json 中,然后在环境中以 LLM_BACKEND_API_KEY 设置你的 token 并启动 OpenClaw 服务器。或者直接将其粘贴到你的 OpenClaw UI 中,让智能体自己弄明白;这更符合其精神。
如何将 GLM-5 与 Claude Code 一起使用?
Claude Code 不像其他前端智能体框架那样开放。它与 Anthropic 的专有后端产品紧密集成。
不过,你可以使用 LiteLLM 网关进行代理,在 Claude Code 客户端与像我们这样兼容 OpenAI API 的端点之间转发请求。我们在这里演示了如何在 Modal 上部署这样的代理。
如何在 Vercel AI SDK 中使用 GLM-5?
Vercel AI SDK 是用于 LLM API 的 JavaScript 应用程序的关键库。例如,OpenCode 通过委托给 Vercel AI SDK 来支持兼容 OpenAI 的 API。
在你为 Modal GLM-5 端点创建令牌后,可以在创建 OpenAICompatible 提供程序时将其作为 apiKey 提供。
在创建 chatModel 时,你还需要包含模型名称:
像任何优秀的全栈 JavaScript 框架一样,Vercel AI SDK 有两个组件:用于逻辑的 Core 库和用于前端的 UI 库。
你可以在这里找到将 Modal 托管的 LLM 与 Vercel AI SDK Core 集成的最小示例。我们在调试 LLM 后端时喜欢使用它,因为你可以保留大量的控制权和可观测性,同时仍然针对一个在像 TUI 这样更难调试的应用程序中使用的接口进行开发。
你可以在这个示例 React 应用程序中找到将 Modal 托管的 LLM 与 AI SDK 的 UI 元素更完整的集成。
来源:Modal 官方工程博客(RSS) · modal.com