Liquid AI 发布开源决策模型 d1-3B 和 d1-omni-600M
Open d1: Edge decision models for text, vision, and audio
Liquid AI 发布开源权重决策模型 d1-3B 和 d1-omni-600M,已在 Hugging Face 上提供。
官方公开了模型架构、训练细节和各硬件延迟数据,读者可以据此评估小参数决策模型在边缘部署中的取舍。
今天,我们发布 d1-3B 和 d1-omni-600M,这是我们 d1 决策模型家族中的两个开放权重模型。
d1-3B 在 Decision Index v0.2.1(公开划分)上得分为 48.57,领先于所有 10B 以下的模型,并与 Decider 35B-A3B 持平,后者是一个规模为其 12 倍的决策模型。它运行完整的 NVIDIA 技术栈,从数据中心的 DGX 到边缘的 Jetson:d1-3B 在 NVIDIA GeForce RTX 4090 上 8 毫秒内回答问题,在 Jetson AGX Thor 上为 16 毫秒,在 Jetson AGX Orin 上为 26 毫秒。即使是 Jetson Orin Nano 也能在 50 毫秒内运行它,足够快,可在最小的边缘硬件上实现实时决策。
d1-omni-600M 是我们的首个实验性检查点,可处理文本和图像,以及文本和音频。它在同一指数上得分为 15.95。
d1-3B 和 d1-omni-600M 模型现已在 Hugging Face 上提供。请查看我们的 文档,了解如何在本地运行它们。
架构与训练
与我们的生成式 Liquid Foundation Models(LFMs)不同,我们的 d1 决策模型不生成 token。相反,它们通过单次前向传播产生答案。
d1-3B 和 d1-omni-600M 基于两个非常不同的骨干网络训练而成:
- d1-3B 基于 LFM2.5-VL-3B 训练,这是我们最新的 VLM,仅解码器架构。它接受文本和图像作为输入。
- d1-omni-600M 基于 LFM2.5-Encoder-350M 训练,这是一个双向编码器。它增加了视觉和音频编码器以处理所有三种模态。它接受文本和图像,或文本和音频作为输入。
d1-3B。我们对 LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本骨干网络的权重进行平均,以创建更好的基础模型。然后,我们使用不同的随机种子和数据混合对检查点进行微调,再将它们合并。在长输入上训练、打乱答案选项以及修复数据中的捷径,比更先进的技术带来了更大的差异。
d1-omni-600M。我们首先在决策任务上微调 LFM2.5-Encoder-350M,然后分阶段添加音频和视觉。对于音频,我们训练了一个带有适配器的 FastConformer 编码器,将其连接到骨干网络,然后使用冻结的文本骨干网络微调音频编码器。对于视觉,我们采用了 LFM2.5-VL-450M 的编码器,并训练了一个适配器以及对骨干网络进行 LoRA 更新。这些更新仅在输入包含图像时激活,视觉编码器保持冻结。然后,我们微调了整个模型,合并了 LoRA 更新,并将权重与前一个检查点进行平均,以正则化最终模型。
基准测试
文本基准测试。我们在七个公共基准测试中评估了 d1-3B 和 d1-omni-600M,涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。
基准测试 | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
SQuAD 2.0 | 74.0 | 85.3 | 67.7 | 76.0 |
Civil Comments | 95.8 | 93.0 | 93.6 | 92.8 |
MASSIVE intent | 86.1 | 87.3 | 81.1 | 88.3 |
PubMedQA | 61.3 | 66.0 | 65.7 | 63.3 |
BoolQ | 77.7 | 86.7 | 87.3 | 89.0 |
XNLI | 74.7 | 85.0 | 85.0 | 88.6 |
PAWS-X | 79.5 | 76.9 | 59.5 | 69.8 |
均值 | 78.4 | 82.9 | 77.1 | 81.1 |
d1-3B 以 82.9 的均值领先,为表中最高,领先于 Decider 4B(81.1)。d1-omni-600M 达到 78.4,以四分之一的参数优于 Decider 2B(77.1)。它还在毒性检测(Civil Comments:95.8)和释义识别(PAWS-X:79.5)方面创下了表中的最高分。
视觉与音频性能。Decision Index v0.3 包含一个私有视觉分项,本次发布中我们不予报告。相反,我们验证了 d1-3B 在标准视觉基准上保留了其 LFM2.5-VL-3B 骨干网络的视觉能力,并且 d1-omni-600M 能够处理全部三种模态。它们的视觉能力展示在下方我们的 playground 演示中。专门的音频决策基准目前仍是一个开放性问题。随着多模态决策模型这一类别逐渐成熟,我们期待看到社区开发出这些基准。
随处快速推理
d1-3B 和 d1-omni-600M 可运行完整的 NVIDIA 技术栈——从数据中心的 DGX,到 RTX 工作站,再到边缘端的 Jetson——并首日支持 llama.cpp。
由于决策模型不生成输出 token,我们测量的是从输入到输出的端到端延迟。我们报告 d1-3B 的推理数据。d1-omni-600M 是早期研究版本,正在积极开发中。
边缘推理。我们在 Apple M5 Pro 上测量延迟,并与 NVIDIA 合作,在 NVIDIA Jetson AGX Thor、Jetson AGX Orin 64 GB 和 Jetson Orin Nano 上测量延迟。我们一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。
单个问题 | 3 个问题 | 3.4K token 状态 | 384px 图像 | 64 个状态,打包 | |
Apple M5 Pro | 30 ms | 41 ms | 640 ms | 62 ms | 78 / s |
Jetson AGX Thor | 16 ms | 20 ms | 220 ms | 35 ms | 262 / s |
Jetson AGX Orin 64 GB | 26 ms | 35 ms | 560 ms | 83 ms | 110 / s |
Jetson Orin Nano | 50 ms | 73 ms | 1,640 ms | 202 ms | 38 / s |
d1-3B 在每台被测设备上都能在 50 ms 内回答单个问题。三个问题耗时仅为单个问题的 1.3 倍,其中 AGX Thor 从 16 ms 增至 20 ms。
GPU 推理。我们在 NVIDIA RTX 4090 和 AMD MI325X 上测量延迟,一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。
单个问题 | 3 个问题 | 3.4K token 状态 | 384px 图像 | 64 个状态,打包 | |
NVIDIA RTX 4090 | 8 ms | 21 ms | 102 ms | 17 ms | 475 / s |
AMD MI325X | 9 ms | 14 ms | 44 ms | 18 ms | 1,106 / s |
在 GPU 上,d1-3B 在两个平台上都能在 10 ms 内回答一个问题,并在 18 ms 内处理一张 384px 图像。
开放 d1 实战
这些结果使我们的小型开放 d1 决策模型非常适合任何需要快速、结构化决策的场景,包括多模态输入。d1-3B 在其规模下提供最高的决策质量,而 d1-omni-600M 则适合对占用空间有要求的场景。
为了展示实时决策在实际中的样子,我们构建了十个演示,让我们的开放 d1-3B 在实时摄像头输入上循环运行,从手势控制游戏到实时内容审核,每个演示每帧只需一次推理即可读取答案。你可以在我们的 Hugging Face space 中无需任何设置即可试用它们。
与 NVIDIA 合作,我们还展示了 d1-3B 在 Isaac Sim 中导航环境,模型在硬件在环设置中由 Jetson 提供服务。
开始使用
今天就开始使用 d1-3B 和 d1-omni-600M 进行构建,它们已在 Hugging Face 上提供。
借助 d1,我们正在实现 AI 随处运行的愿景。这些模型是:
- 开放权重——下载、微调和部署均无限制
- 开箱即快 — 原生支持 llama.cpp,覆盖 Apple、AMD、Qualcomm 和 NVIDIA,并支持 NVFP4
- 一个系列 — 两种规模让你根据部署需求在精度与占用之间取舍。
我们迫不及待想看到你构建的作品。
在 Hugging Face 上下载 d1-3B
在 Hugging Face 上下载 d1-omni-600M
阅读 NVIDIA Jetson AI Lab 关于 d1-3B 的内容
阅读 NVIDIA Jetson AI Lab 关于 d1-omni-600M 的内容
引用
如需引用,请使用以下参考文献或 BibTeX:
Liquid AI, "Open d1: Edge decision models for text, vision, and audio", Liquid AI Blog, Oct 2026.
来源:Liquid AI 模型与工程博客 · liquid.ai