蚂蚁集团发布推理模型 Ling 3.1 Flash,总参数 560B、激活 25B、上下文窗口 1M token,在 Artificial Analysis Intelligence Index v4.3 得分 41,较 Ling 3.0 Flash 的 20 大幅提升,智能体能力改善明显。
第三方评测给出了智能指数提升幅度、幻觉率变化和每任务成本,可与 GLM、DeepSeek、Gemini 同级模型直接对比。
Ling 3.1 Flash 在智能上较其前代取得大幅提升,在 Artificial Analysis Intelligence Index 上得分 41,尤其在 agentic 能力方面有明显进步
@AntLingAGI 发布了 Ling 3.1 Flash,这是一款推理模型,总参数 560B,激活参数 25B,上下文窗口 1M token。它在 Artificial Analysis Intelligence Index v4.3 上得分 41,高于 8 月发布的 Ling 3.0 Flash 的 20 分。Ling 3.1 Flash 预计将开放权重,蚂蚁集团将很快发布权重。
主要结果:
➤ Ling 3.1 Flash 较其前代提升了 agentic 能力。其 GDPval-AA v2 Elo 为 1,622,AA-Briefcase Elo 为 1,400,可媲美 GLM-5.3-Flash、Gemini 3.8 Flash (high) 和 DeepSeek V4.1 Flash (Max) 等同级模型。Ling 3.1 Flash 在 AutomationBench-AA (62%) 和 Terminal-Bench v4.0 (33%) 上也显示出显著提升。
➤ Ling 3.1 Flash 在 AA-Omniscience 上得分 +2,较 Ling 3.0 Flash (-18) 提升 22 分。与其前代相比,在相近的尝试率(56% 至 58%)下,其准确率从 18% 升至 29%,而幻觉率从 44% 降至 38%,表明这一提升主要来自知道得更多,而非更多地弃答。作为对比,DeepSeek V4.1 Flash (Max) 的幻觉率为 97%。
➤ Ling 3.1 Flash 是比其前代更大的模型,定价也相应提高,但 token 效率更高。其总参数为 560B、激活参数为 25B,高于 Ling 3.0 Flash 的 124B 和 5.1B,定价为每 1M 输入 / 输出 token $0.30 / $0.90,高于 $0.075 / $0.22。它运行 Intelligence Index 使用了 218M 输出 token,比 Ling 3.0 Flash(261M)少 16%。
➤ Ling 3.1 Flash 的每任务成本高于部分同级模型,但仍处于最具吸引力的象限。Ling 3.1 Flash 每任务成本为 $0.99,远高于 GLM-5.3-Flash($0.42)和 DeepSeek V4.1 Flash (Max,$0.32),但低于 Gemini 3.8 Flash (High) 的 $1.24。
其他模型细节:
➤ 规模:总参数 560B,激活参数 25B
➤ 上下文窗口:1M token
➤ 定价:每 1M 输入 token $0.30,每 1M 输出 token $0.90,缓存输入为每 1M $0.06(80% 折扣)
➤ 可用性:可通过 Novita AI 访问,权重即将发布
来源:Artificial Analysis · x.com