跳到正文
原文
LMSYS:Blog(Chatbot Arena 团队)·· 2 小时前精选AI 评分62

MiniMax M2 为何回归全注意力:MiniMax 团队复盘高效注意力的权衡

Blog "No Free Lunch": Deconstruct Efficient Attention with MiniMax M2 We are excited to announce day-one support for the new flagship model, MiniMax M2, on SGLang. The MiniMax M2 redefines efficiency for agents: it is a compact, fast, and cost-effective Mixture of Exper... MiniMax LLM Team together with Xinyuan Tong, Kangyan Zhou, Mingyi Lu, and Chenyang Zhao November 4, 2025

AI 导读

SGLang 宣布 day-one 支持 MiniMax M2,并联合 MiniMax 团队发布复盘文章,解释 M2(230B 总参数、10B 激活的 MoE 模型)为何从高效注意力回归全注意力。

推荐理由

MiniMax 团队复盘 M2 回归全注意力的原因,给出基准失真、基础设施与混合 SWA 实验失败等一手经验。

正文 · AI 翻译

MiniMax LLM 团队与 Xinyuan Tong、Kangyan Zhou、Mingyi Lu 和 Chenyang Zhao2025年11月4日

我们很高兴地宣布,SGLang 已在新旗舰模型 MiniMax M2 上实现首日支持。MiniMax M2 重新定义了智能体的效率:它是一个紧凑、快速且高性价比的混合专家(MoE)模型(总参数 2300 亿,激活参数 100 亿),专为在编程和智能体任务中提供顶尖性能而打造,同时保持强大的通用智能。凭借仅 100 亿的激活参数,M2 提供了领先模型所应具备的复杂端到端工具使用性能,但其精简的形态使部署和扩展比以往任何时候都更加容易。

python -m sglang.launch_server \
    --model-path MiniMaxAI/MiniMax-M2 \
    --tp-size 8 \
    --ep-size 8 \
    --tool-call-parser minimax-m2 \
    --trust-remote-code \
    --host 0.0.0.0 \
    --reasoning-parser minimax-append-think \
    --port 8000 \
    --mem-fraction-static 0.85

此次发布标志着 SGLang 与 MiniMax 团队的重大合作。SGLang 为新模型提供了快速高效的支持,同时我们邀请 MiniMax 团队正式分析他们对高效注意力算法的权衡与思考。从 M1 到 M2 模型,MiniMax 团队一直处于探索这些算法的前沿。在这篇文章中,他们分享了关于这些权衡的实证见解,并解释了为什么 MiniMax M2 模型最终回归了全注意力。

评估挑战:基准测试与现实

在大语言模型(LLM)架构的演进中,注意力机制的计算复杂度仍然是一个核心挑战。线性或稀疏注意力机制,例如 MiniMax-01 中的 Lightning Attention,旨在解决全注意力的二次计算瓶颈。然而,MiniMax M2 模型已回归全注意力,这一决定为高效注意力替代方案的生产就绪性提供了关键的实证见解。

MiniMax 团队报告称,尽管高效注意力变体在理论上具有吸引力,但在实际工业部署中,尚未有任何一种变体展现出稳定优于全注意力的性能。对于在开放场景中部署的 LLM,模型质量仍然是首要优先事项,因此一个高效但质量欠佳的模型几乎没有实际价值。要达到有竞争力的质量,会带来严峻的系统层面和方法论层面的挑战。

基准测试作为“有漏洞的抽象”

LLM 基准测试(例如 MMLU、BBH、LongBench)是必不可少的工具,但它们本质上是对真实能力的有损抽象。MiniMax 的经验表明,在小规模实验中,混合注意力模型(例如 Lightning Attention + Full Attention)在这些标准排行榜上与纯全注意力模型表现相当。

然而,这种表面上的持平掩盖了深层次的能力缺陷。随着模型规模扩大,这些混合注意力模型在复杂的多跳推理任务中表现出明显的不足。

验证的高昂成本

基准测试的这种局限性造成了一个恶性循环:一旦识别出某个特定缺陷(如多跳推理),研究人员就会开发新的代理指标来针对它进行优化。但无法保证这个新的代理指标在更大规模下仍与真实世界的下游性能相关,也无法穷尽覆盖其他隐藏的弱点。

讽刺的是,尽管高效注意力旨在节省计算,但仅为了在这些更难的验证指标上获得具有统计显著性的信号,所需的实验计算量就会呈天文级增长。发现真正的问题往往远比解决它们更加困难。

基础设施与系统协同设计的障碍

高效注意力的理论优势必须通过成熟的训练和推理基础设施才能实现。然而,当前的硬件和软件生态系统正日益针对全注意力进行优化,为新架构制造了显著的准入门槛。

计算与内存瓶颈的错配

以线性注意力为例。其理论计算复杂度和内存复杂度分别是线性和常数级的。理论上,效率的交叉点应该仅出现在几千个 token 处。

然而在实践中,许多线性注意力架构即使在训练期间也受限于内存。这意味着如果没有极致的 IO 优化,系统无法利用 GPU 可用的 FLOPs,导致大量算力被闲置,理论上的收益也随之化为乌有。

推理系统集成挑战

在生产推理环境中,任何新的注意力机制都必须与前缀缓存和投机解码等关键系统共存。MiniMax 的报告强调了几个关键的工程问题:

  • 低精度状态存储:线性注意力目前对数值精度的敏感度远高于全注意力,这对推理中常用的低精度 KV 缓存和状态存储构成了严峻挑战。
  • 前缀缓存:在对话等真实应用场景中,缓存命中率非常高。新架构必须优雅地处理这种频繁的缓存命中场景。
  • 投机解码:如何以高效注意力为主干深度优化投机解码机制,仍然是一个悬而未决的开放问题。

实证案例研究

为了进一步探索这一问题,MiniMax 团队在 M2 的训练期间尝试实现了一种混合滑动窗口注意力(SWA)模型,但实验未能成功。

动机:系统负载均衡

团队尝试构建一种层内混合 SWA 模型。其系统层面的动机是,在同一层内混合 SWA 和全注意力可以确保一致的计算强度。这反过来又能减少流水线并行以及注意力数据并行组之间的负载不均衡问题。选择 SWA 的另一个原因是,与其他高效注意力方法相比,它的工程复杂度显著更低。

结果:各维度上的一致失败

尽管尝试了大量配置并持续预训练了数千亿(甚至数万亿)个 token,结果依然很差。所有变体无一例外,在智能体任务和复杂长上下文评估中表现都极为糟糕。

这在多个实验维度上都得到了验证,包括:

  • 调整 SWA 与全注意力之间的比例。
  • 独立修改 SWA 和全注意力的 ROPE 设置(甚至在某些层中用 NoPE 替换 ROPE)。
  • 探索层内和层间两种混合设计。
  • 对全局注意力模式(如归纳头)进行事后分析以调优 SWA。
  • 在 SWA 中使用 sink token。

结论与展望

MiniMax M2 回归全注意力,并非对高效注意力方向的否定,而是基于当今工业级 LLM 系统工程现实的务实选择。

这一案例研究清楚地表明,高效注意力架构的成功不仅取决于算法本身,还取决于三大支柱的共同成熟:评估、数据和基础设施。

随着 GPU 算力增长放缓、上下文长度持续增加,线性注意力和稀疏注意力的优势终将显现。然而,要跨越从理论到生产的鸿沟,社区必须持续投入,构建信息量更丰富的评估体系、更成熟的训练与推理基础设施,以及更高质量、信息密度更高的长上下文数据。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org