跳到正文
北京时间
原文
Liquid AI 模型与工程博客·· 18 小时前精选AI 评分61

Liquid AI 发布开源决策模型 d1-3B 和 d1-omni-600M

Open d1: Edge decision models for text, vision, and audio

AI 导读

Liquid AI 发布开源权重决策模型 d1-3B 和 d1-omni-600M,已在 Hugging Face 上提供。

推荐理由

官方公开了模型架构、训练细节和各硬件延迟数据,读者可以据此评估小参数决策模型在边缘部署中的取舍。

正文 · AI 翻译

今天,我们发布 d1-3B 和 d1-omni-600M,这是我们 d1 决策模型家族中的两个开放权重模型。 

d1-3B 在 Decision Index v0.2.1(公开划分)上得分为 48.57,领先于所有 10B 以下的模型,并与 Decider 35B-A3B 持平,后者是一个规模为其 12 倍的决策模型。它运行完整的 NVIDIA 技术栈,从数据中心的 DGX 到边缘的 Jetson:d1-3B 在 NVIDIA GeForce RTX 4090 上 8 毫秒内回答问题,在 Jetson AGX Thor 上为 16 毫秒,在 Jetson AGX Orin 上为 26 毫秒。即使是 Jetson Orin Nano 也能在 50 毫秒内运行它,足够快,可在最小的边缘硬件上实现实时决策。

d1-omni-600M 是我们的首个实验性检查点,可处理文本和图像,以及文本和音频。它在同一指数上得分为 15.95。

d1-3B 和 d1-omni-600M 模型现已在 Hugging Face 上提供。请查看我们的 文档,了解如何在本地运行它们。

架构与训练

与我们的生成式 Liquid Foundation Models(LFMs)不同,我们的 d1 决策模型不生成 token。相反,它们通过单次前向传播产生答案。

d1-3B 和 d1-omni-600M 基于两个非常不同的骨干网络训练而成:

  • d1-3B 基于 LFM2.5-VL-3B 训练,这是我们最新的 VLM,仅解码器架构。它接受文本和图像作为输入。
  • d1-omni-600M 基于 LFM2.5-Encoder-350M 训练,这是一个双向编码器。它增加了视觉和音频编码器以处理所有三种模态。它接受文本和图像,或文本和音频作为输入。

d1-3B。我们对 LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本骨干网络的权重进行平均,以创建更好的基础模型。然后,我们使用不同的随机种子和数据混合对检查点进行微调,再将它们合并。在长输入上训练、打乱答案选项以及修复数据中的捷径,比更先进的技术带来了更大的差异。

图 2:d1-3B 架构图

d1-omni-600M。我们首先在决策任务上微调 LFM2.5-Encoder-350M,然后分阶段添加音频和视觉。对于音频,我们训练了一个带有适配器的 FastConformer 编码器,将其连接到骨干网络,然后使用冻结的文本骨干网络微调音频编码器。对于视觉,我们采用了 LFM2.5-VL-450M 的编码器,并训练了一个适配器以及对骨干网络进行 LoRA 更新。这些更新仅在输入包含图像时激活,视觉编码器保持冻结。然后,我们微调了整个模型,合并了 LoRA 更新,并将权重与前一个检查点进行平均,以正则化最终模型。

图 3:d1-omni-600M 架构图。

基准测试

文本基准测试。我们在七个公共基准测试中评估了 d1-3B 和 d1-omni-600M,涵盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。

基准测试

d1-omni-600M

d1-3B

Decider 2B

Decider 4B

SQuAD 2.0

74.0

85.3

67.7

76.0

Civil Comments

95.8

93.0

93.6

92.8

MASSIVE intent

86.1

87.3

81.1

88.3

PubMedQA

61.3

66.0

65.7

63.3

BoolQ

77.7

86.7

87.3

89.0

XNLI

74.7

85.0

85.0

88.6

PAWS-X

79.5

76.9

59.5

69.8

均值

78.4

82.9

77.1

81.1

表 1:文本基准测试比较

d1-3B 以 82.9 的均值领先,为表中最高,领先于 Decider 4B(81.1)。d1-omni-600M 达到 78.4,以四分之一的参数优于 Decider 2B(77.1)。它还在毒性检测(Civil Comments:95.8)和释义识别(PAWS-X:79.5)方面创下了表中的最高分。

视觉与音频性能。Decision Index v0.3 包含一个私有视觉分项,本次发布中我们不予报告。相反,我们验证了 d1-3B 在标准视觉基准上保留了其 LFM2.5-VL-3B 骨干网络的视觉能力,并且 d1-omni-600M 能够处理全部三种模态。它们的视觉能力展示在下方我们的 playground 演示中。专门的音频决策基准目前仍是一个开放性问题。随着多模态决策模型这一类别逐渐成熟,我们期待看到社区开发出这些基准。

随处快速推理

d1-3B 和 d1-omni-600M 可运行完整的 NVIDIA 技术栈——从数据中心的 DGX,到 RTX 工作站,再到边缘端的 Jetson——并首日支持 llama.cpp。 

由于决策模型不生成输出 token,我们测量的是从输入到输出的端到端延迟。我们报告 d1-3B 的推理数据。d1-omni-600M 是早期研究版本,正在积极开发中。

边缘推理。我们在 Apple M5 Pro 上测量延迟,并与 NVIDIA 合作,在 NVIDIA Jetson AGX Thor、Jetson AGX Orin 64 GB 和 Jetson Orin Nano 上测量延迟。我们一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。

单个问题

3 个问题

3.4K token 状态

384px 图像

64 个状态,打包

Apple M5 Pro

30 ms

41 ms

640 ms

62 ms

78 / s

Jetson AGX Thor

16 ms

20 ms

220 ms

35 ms

262 / s

Jetson AGX Orin 64 GB

26 ms

35 ms

560 ms

83 ms

110 / s

Jetson Orin Nano

50 ms

73 ms

1,640 ms

202 ms

38 / s

表 2:边缘推理

d1-3B 在每台被测设备上都能在 50 ms 内回答单个问题。三个问题耗时仅为单个问题的 1.3 倍,其中 AGX Thor 从 16 ms 增至 20 ms。

GPU 推理。我们在 NVIDIA RTX 4090 和 AMD MI325X 上测量延迟,一次测量一个请求,涵盖单个问题、基于一个状态的三个问题、一个 3.4K token 的状态,以及一张 384px 图像。

单个问题

3 个问题

3.4K token 状态

384px 图像

64 个状态,打包

NVIDIA RTX 4090

8 ms

21 ms

102 ms

17 ms

475 / s

AMD MI325X

9 ms

14 ms

44 ms

18 ms

1,106 / s

表 3:GPU 推理

在 GPU 上,d1-3B 在两个平台上都能在 10 ms 内回答一个问题,并在 18 ms 内处理一张 384px 图像。

开放 d1 实战

这些结果使我们的小型开放 d1 决策模型非常适合任何需要快速、结构化决策的场景,包括多模态输入。d1-3B 在其规模下提供最高的决策质量,而 d1-omni-600M 则适合对占用空间有要求的场景。

为了展示实时决策在实际中的样子,我们构建了十个演示,让我们的开放 d1-3B 在实时摄像头输入上循环运行,从手势控制游戏到实时内容审核,每个演示每帧只需一次推理即可读取答案。你可以在我们的 Hugging Face space 中无需任何设置即可试用它们。

与 NVIDIA 合作,我们还展示了 d1-3B 在 Isaac Sim 中导航环境,模型在硬件在环设置中由 Jetson 提供服务。

开始使用

今天就开始使用 d1-3B 和 d1-omni-600M 进行构建,它们已在 Hugging Face 上提供。

借助 d1,我们正在实现 AI 随处运行的愿景。这些模型是:

  • 开放权重——下载、微调和部署均无限制
  • 开箱即快 — 原生支持 llama.cpp,覆盖 Apple、AMD、Qualcomm 和 NVIDIA,并支持 NVFP4
  • 一个系列 — 两种规模让你根据部署需求在精度与占用之间取舍。

我们迫不及待想看到你构建的作品。

hugging face logo liquid AI在 Hugging Face 上下载 d1-3Bhugging face logo liquid AI在 Hugging Face 上下载 d1-omni-600Mnvidia logo阅读 NVIDIA Jetson AI Lab 关于 d1-3B 的内容nvidia logo阅读 NVIDIA Jetson AI Lab 关于 d1-omni-600M 的内容

引用

如需引用,请使用以下参考文献或 BibTeX:

Liquid AI, "Open d1: Edge decision models for text, vision, and audio", Liquid AI Blog, Oct 2026.

来源:Liquid AI 模型与工程博客 · liquid.ai