Liquid AI 开源 d1-3B 与 d1-omni-600M 边缘决策模型
Open d1: Edge decision models for text, vision, and audio
Liquid AI 发布开源权重决策模型 d1-3B 和 d1-omni-600M,已在 Hugging Face 提供。d1-3B 在 Decision Index v0.2.1 公开集得分 48.57,领先所有 10B 以下模型,单次前向传播直接输出答案;在 RTX 4090 上单问题延迟 8 ms,Jetson Orin Nano 上 50 ms。
同一新闻,精选展示《Liquid AI 发布开源 d1 决策模型 d1-3B 与 d1-omni-600M》
今天,我们发布 d1-3B 和 d1-omni-600M,这是我们 d1 决策模型家族中的两个开放权重模型。
d1-3B 在 Decision Index v0.2.1(公开集)上得分 48.57,领先于所有 10B 以下的模型,并与 Decider 35B-A3B 持平,后者是一个规模为其 12 倍的决策模型。它可运行完整的 NVIDIA 技术栈,从数据中心的 DGX 到边缘的 Jetson:在 NVIDIA GeForce RTX 4090 上,d1-3B 回答一个问题仅需 8 ms;在 Jetson AGX Thor 上为 16 ms;在 Jetson AGX Orin 上为 26 ms。即便是 Jetson Orin Nano 也能在 50 ms 内运行它,对于最小的边缘硬件而言,这也足够快,可实现实时决策。
d1-omni-600M 是我们的首个实验性检查点,可同时处理文本与图像,以及文本与音频。它在同一指数上得分 15.95。
d1-3B 和 d1-omni-600M 模型现已在 Hugging Face 上提供。请查看我们的文档,了解如何在本地运行它们。
架构与训练
与我们的生成式 Liquid Foundation Models(LFM)不同,我们的 d1 决策模型不生成 token。相反,它们通过单次前向传递即可给出答案。
d1-3B 和 d1-omni-600M 基于两个截然不同的骨干网络训练而成:
- d1-3B 基于 LFM2.5-VL-3B 训练,这是我们最新的 VLM,采用仅解码器结构。它接受文本和图像作为输入。
- d1-omni-600M 基于 LFM2.5-Encoder-350M 训练,这是一个双向编码器。它增加了视觉和音频编码器,以处理全部三种模态。它接受文本与图像,或文本与音频作为输入。
d1-3B。我们将 LFM2.5-2.6B 与 LFM2.5-VL-3B 的文本骨干网络的权重进行平均,以创建更好的基础模型。随后,我们使用不同的随机种子和数据混合对多个检查点进行微调,之后再将它们合并。在长输入上训练、打乱答案选项以及修正数据中的捷径,比更先进的技术带来了更大的差异。
d1-omni-600M。我们首先在决策任务上微调 LFM2.5-Encoder-350M,然后分阶段加入音频和视觉。对于音频,我们训练了一个 FastConformer 编码器,并配以适配器将其连接到骨干网络,然后在冻结文本骨干网络的情况下微调音频编码器。对于视觉,我们采用 LFM2.5-VL-450M 的编码器,并训练一个适配器以及对骨干网络进行 LoRA 更新。这些更新仅在输入包含图像时生效,且视觉编码器保持冻结。随后,我们微调整个模型,合并 LoRA 更新,并将权重与之前的检查点进行平均,以正则化最终模型。
基准测试
文本基准测试。我们在七个公开基准上评估了 d1-3B 和 d1-omni-600M,涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。
基准 | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
SQuAD 2.0 | 74.0 | 85.3 | 67.7 | 76.0 |
Civil Comments | 95.8 | 93.0 | 93.6 | 92.8 |
MASSIVE intent | 86.1 | 87.3 | 81.1 | 88.3 |
PubMedQA | 61.3 | 66.0 | 65.7 | 63.3 |
BoolQ | 77.7 | 86.7 | 87.3 | 89.0 |
XNLI | 74.7 | 85.0 | 85.0 | 88.6 |
PAWS-X | 79.5 | 76.9 | 59.5 | 69.8 |
均值 | 78.4 | 82.9 | 77.1 | 81.1 |
d1-3B 以 82.9 的均值领先,为表中最高,并领先于 Decider 4B(81.1)。d1-omni-600M 达到 78.4,以四分之一的参数量超越了 Decider 2B(77.1)。它还在表中的毒性检测(Civil Comments:95.8)和释义识别(PAWS-X:79.5)上取得了最高分。
视觉与音频性能。Decision Index v0.3 包含一个未公开的视觉分项,我们在本次发布中不作报告。相反,我们验证了 d1-3B 在标准视觉基准上保留了其 LFM2.5-VL-3B 骨干网络的视觉能力,并且 d1-omni-600M 能处理全部三种模态。它们的视觉能力展示在下方我们的 playground 演示中。专门的音频决策基准目前仍是一个开放问题。随着多模态决策模型这一类别日趋成熟,我们期待看到社区开发出这类基准。
随处快速推理
d1-3B 和 d1-omni-600M 可运行完整的 NVIDIA 技术栈——从数据中心的 DGX,到 RTX 工作站,再到边缘端的 Jetson——并首日支持 llama.cpp。
由于决策模型不生成输出 token,我们测量的是从输入到输出的端到端延迟。我们报告 d1-3B 的推理数据。d1-omni-600M 是早期研究版本,正在积极开发中。
边缘推理。我们在 Apple M5 Pro 上测量延迟,并与 NVIDIA 合作,在 NVIDIA Jetson AGX Thor、Jetson AGX Orin 64 GB 和 Jetson Orin Nano 上测量延迟。我们一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、3.4K token 状态和 384px 图像。
一个问题 | 3 个问题 | 3.4K token 状态 | 384px 图像 | 64 个状态,打包 | |
Apple M5 Pro | 30 ms | 41 ms | 640 ms | 62 ms | 78 / s |
Jetson AGX Thor | 16 ms | 20 ms | 220 ms | 35 ms | 262 / s |
Jetson AGX Orin 64 GB | 26 ms | 35 ms | 560 ms | 83 ms | 110 / s |
Jetson Orin Nano | 50 ms | 73 ms | 1,640 ms | 202 ms | 38 / s |
d1-3B 在每台测量设备上都能在 50 ms 以内回答单个问题。三个问题仅需一个问题的 1.3 倍时间,AGX Thor 从 16 ms 增加到 20 ms。
GPU 推理。我们在 NVIDIA RTX 4090 和 AMD MI325X 上测量延迟,一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、3.4K token 状态和 384px 图像。
一个问题 | 3 个问题 | 3.4K token 状态 | 384px 图像 | 64 个状态,打包 | |
NVIDIA RTX 4090 | 8 ms | 21 ms | 102 ms | 17 ms | 475 / s |
AMD MI325X | 9 ms | 14 ms | 44 ms | 18 ms | 1,106 / s |
在 GPU 上,d1-3B 在两大平台上都能在 10 ms 以内回答一个问题,并在 18 ms 以内处理一张 384px 图像。
d1 实战演示
这些结果让我们的小型开放 d1 决策模型非常适合任何需要快速、结构化决策的场景,包括多模态输入。d1-3B 在其规模下提供最高的决策质量,而 d1-omni-600M 则适合对占用空间有要求的场景。
为了展示实时决策在实际中的表现,我们构建了十个演示,让开放的 d1-3B 循环处理实时摄像头输入,从手势控制游戏到实时内容审核,每个演示每帧只需一次推理即可读取答案。你可以在我们的 Hugging Face space 中无需任何配置直接体验。
我们还与 NVIDIA 合作,演示了 d1-3B 在 Isaac Sim 中导航环境,模型在硬件在环设置中部署于 Jetson 上。
开始使用
从今天起,使用 Hugging Face 上提供的 d1-3B 和 d1-omni-600M 开始构建。
借助 d1,我们正在实现 AI 随处运行的愿景。这些模型:
- 开放权重 — 可无限制下载、微调和部署
- 第一天就快 — 原生支持 llama.cpp,覆盖 Apple、AMD、Qualcomm 和 NVIDIA,并支持 NVFP4
- 一个家族 — 两种尺寸让你根据部署需求在精度与占用之间取舍。
我们迫不及待想看到你构建的作品。
在 Hugging Face 上下载 d1-3B
在 Hugging Face 上下载 d1-omni-600M
阅读关于 d1-3B 的 NVIDIA Jetson AI Lab
阅读关于 d1-omni-600M 的 NVIDIA Jetson AI Lab
引用
如需引用,请使用以下参考文献或 BibTeX:
Liquid AI, "Open d1: Edge decision models for text, vision, and audio", Liquid AI Blog, Oct 2026.
来源:Liquid AI 模型与工程博客 · liquid.ai