跳到正文
北京时间
原文
Liquid AI 模型与工程博客·· 18 小时前精选AI 评分69

Liquid AI 发布 d1 决策模型并新增图像输入能力

Introducing d1: The most capable decision model, now with vision

AI 导读

Liquid AI 发布 d1 决策模型,新增文本与图像输入,可通过 console.liquid.ai 和 d1 Playground 使用。

推荐理由

原文给出 d1 在六类真实应用中对 GPT-6.1 Sol 和 Claude Opus 5.5 的成本与速度对比,以及按输入 token 计费规则,便于评估是否替换现有 LLM 调用。

正文 · AI 翻译

今天,我们推出 d1,我们的首个决策模型,现已支持文本和图像。通过上周的实验性发布,d1 成为首个在文本决策上可与 Jev 匹敌的模型,如今它又率先将这些能力扩展到图像。你今天就可以在console.liquid.ai 和 d1 Playground 中试用。

我们在六个真实应用中,将 d1 与 GPT-6.1 Sol 和 Claude Opus 5.5 进行了对比测试,从筛选支持工单到检查电路板。在其中四个应用上,d1 与 GPT-6.1 Sol 持平或更优。它的成本比这两个模型低 19 倍到 200 倍,并且在每项任务上都显著更快。

d1 决策模型如何工作

决策模型针对某个情境,为每个可能答案给出一个概率来回答问题。d1 决策模型接收非结构化数据(例如文本、图像或两者)以及一个或多个问题作为输入,在一次前向传播中读取它们,并返回概率,而不生成任何 token。一次文本决策耗时 200 到 300 毫秒,快到足以用于实时应用。

d1 回答三类问题:

  • Noul:一个是/否问题,用 0 到 1 之间的概率作答。
  • Choice:从多个标签中选一个,为每个标签给出一个概率。
  • Score:在一个量表上的位置,由每个等级的概率加权。

一个请求可以针对同一状态提出多个问题,从而节省输入 token。

d1 实战

当答案是结构化决策时,决策模型可以替代对语言模型的高成本调用。它们还催生了各种新用例,本节展示了其中一些。下面的每个演示都在 d1 Playground 中实时运行。

视觉检测。这个工业应用检查来自四条产线、经过摄像头下方的零件:电路板、蜡烛、腰果和口香糖(公开的 VisA 数据集)。d1 以 85-97% 的准确率分拣良品和缺陷品。最有趣的是,该模型从未为此训练过。得益于其出色的泛化能力,它能从一段简短描述中理解任务。

文本应用。五个应用将 d1 用于每一个决策:

  • Smart Filter:d1 成为 SQL 查询中的一个函数,WHERE d1(ticket, 'the customer wants to cancel)。它为 150 个支持工单逐一回答是或否。
  • Code Search:d1 逐层浏览 Hugging Face transformers 仓库(6,511 个文件),一次一个文件夹,直到找到能回答问题的那个函数。
  • Smart Folders:d1 将每个新文档归入一个文件夹,再归入一个子文件夹。它以同样方式归档搜索问题,因此关键词搜索只需查看一个子文件夹。
  • Web Agent:d1 根据一句话目标操作一个航班搜索网站。每一步,它都会在页面允许的所有操作中选出下一个动作。
  • Context Compaction:d1 读取编码智能体会话中的每个工具输出,并为下一个任务保留、裁剪或丢弃它。它移除了 52% 的 token,同时保留了任务所需的每一个输出。

我们改编了其中四个应用,来自以下开源项目: pg-jev、 jevgrep、 jev-ultrafast 和 fast-jev-compaction。

游戏。d1 实时玩八款经典游戏,并选择每一步。视觉在两方面帮助它:

  • 更优的决策:俄罗斯方块完全可以用文字描述,但加入屏幕画面后,d1 的得分从消除 70 行提升到 81 行。
  • 更简单的集成:在 Wordle 中,d1 直接从截图读取棋盘。开发者无需编写游戏的文字版本,而 d1 仍以平均 3.8 次猜测解决了 12 局中的 12 局。

d1 也能处理纯视觉任务。在 Quick, Draw! 中,它能在 62 个词中猜出玩家的涂鸦内容,并能识别 6 幅画中的 5.2 幅(随机猜测为 0.6)。

可用性与定价

立即使用 d1 决策模型开始构建,该模型已在 Liquid AI API 上以 d1 形式提供。在 console.liquid.ai 创建 API 密钥(Dashboard > API Keys)。

要使用视觉功能,您只需在 images 中以 base64 数据 URL 的形式发送图像:

import base64, os, requests

image = base64.b64encode(open("board.jpg", "rb").read()).decode()

response = requests.post(
    "https://api.liquid.ai/decisions/v1/systemone",
    headers={"Authorization": f"Bearer {os.environ['LIQUID_API_KEY']}"},
    json={
        "model": "d1",
        "images": [f"data:image/jpeg;base64,{image}"],
        "state": "Camera image of a circuit board on the production line.",
        "questions": 
            {"defect": {
                "type": "noul", 
                "instructions": "Does this circuit board have a defect?"
             }
         },
    },
)

print(response.json()["answers"]["defect"]["noul"])

完整的 API 参考文档见 决策模型文档。

d1 仅按输入 token 计费,无输出 token。图像按与文本相同的费率计为输入 token:每 32×32 像素块 1.5 个 token,因此一张 1024×1024 的图像消耗 1,536 个 token。每个问题作为独立的提示计费,包括其文本和所有图像。

d1 也可通过 Vercel 和 OpenRouter 使用,目前仅支持文本。视觉功能即将登陆这两个平台。

这是 AI 创造与探索的激动人心的时刻,而 d1 仅仅是开始。我们正在继续开发各种规模的决策模型,带来新功能、更高的决策质量和更低的延迟,并计划很快在 Hugging Face 上发布即将推出的模型的开源权重。

Liquid AI logo在 Liquid Console 上试用Liquid AI logo阅读我们的文档

引用

如需引用,请使用以下参考文献或 BibTeX:

Liquid AI,“Introducing d1: The most capable decision model, now with vision”,Liquid AI Blog,2026 年 10 月。

方法说明。我们于 2026 年 10 月 5 日使用 d1 Playground 的对比脚本对每个模型运行了每个应用一次。GPT-6.1 Sol 和 Claude Opus 5.5 将每个请求作为一条聊天消息接收并以 JSON 格式回答,采用其默认推理设置。当多个问题共享一个输入时,例如过滤器的工单或文件夹的段落,聊天模型会分批回答。成本使用标价,不含提示缓存折扣。d1 的成本使用每百万输入 token 0.04 美元。时间为每次运行的时间,最多 8 个请求并发。一次 Smart Filter 运行是对 150 个工单的一次查询。一次 Smart Folders 运行归档 105 个段落,其成本按每 1,000 个段落计算。过滤器的质量是其相对于人工标注的 F1 分数,该分数同时计入遗漏和错误的匹配。其他文本应用统计正确处理的目标、问题、段落或所需输出。我们在 d1 的流程设定后编写了 15 个代码问题中的 6 个以及 4 个压缩会话中的 2 个。在视觉检查中,每个模型都会看到来自同一产线的良品部件与待检查部件并排展示。

来源:Liquid AI 模型与工程博客 · liquid.ai