跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· tionis·· 2026-07-12精选AI 评分77

Mesh LLM:在 iroh 上进行分布式人工智能计算

AI 导读

Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 `localhost:9337/v1` 提供服务。

推荐理由

Mesh LLM 把多台机器的 GPU 拼成一个推理集群,让大模型在自建网络上运行。对想省钱且需隐私的开发者来说,这是一个值得尝试的实用工具。

正文 · AI 翻译

Distributed Model Inference: a mesh of laptop, GPU rig, mini PC, server, workstation, and cloud nodes connected directly to each other

当人们想象运行一个大语言模型时,他们想到的是数据中心。一排排属于别人的 GPU、按量计费的 API,以及随着你的业务越成功而每月不断增长的账单。你把提示词发送到一个黑箱里,然后祈祷价格、模型和隐私政策都保持在你注册时的样子。

对许多团队来说,这是一笔糟糕的交易。你放弃了对模型何时变更、数据流向何处以及什么硬件运行你的工作负载的控制权。而且随着使用量增长,账单也在增长,除了"多付钱"之外没有任何杠杆可拉。

Mesh LLM则是另一种形态。它把你已有的 GPU 和内存池化起来,跨越你想添加的任意多台机器,并将整体暴露为一个 OpenAI 兼容的 API。启动一个节点。之后再添加更多。让网格来决定模型是在你面前的机器上运行、路由到对等节点,还是拆分到多台机器上。

问题在于:AI 很昂贵,而且是别人的

流行的模型都是庞然大物。大多数人通过 UI 或 API key 来使用它们,付钱给大型供应商来运行一切。这很方便,但也是一种投降。你无法控制模型何时更新、它在什么内存中运行,或者底层是什么硬件。

许多依赖这些模型的企业和服务想要的恰恰相反:更多控制权、更强的可插拔性、更低的成本。他们的办公室里、壁橱里、桌子底下都有 GPU 闲置着。他们缺少的是一种让这些机器像一台机器一样运作的方式。

Mesh LLM:自己运行模型

这个卖点很简单。无需购买更大的 GPU,就能运行更大的模型。与你的团队私下共享算力,或与全世界公开共享,为智能体和聊天提供动力。把任何 OpenAI 客户端指向 http://localhost:9337/v1,就不用再关心实际计算发生在哪里。

在底层,Mesh LLM 将模型计算分布到由 iroh 端点组成的网状网络中。一个请求可以通过三种方式得到服务:

  • 在本机 GPU 上本地运行。
  • 将其路由到已经加载了该模型的节点。
  • 将一个大到任何单台机器都放不下的模型,以流水线方式拆分到多台机器上。

工作原理

该架构是可插拔的。插件在清单中声明它们提供什么,运行时负责启动它们、路由调用,并通过 MCP、HTTP、推理和网状事件暴露它们的能力。目录内置 40 多个模型,从能装进笔记本电脑的 5 亿参数模型,到 235B 的混合专家巨型模型。

对于巨头级模型,Mesh LLM 有一种拆分模式(内部代号“Skippy”)。模型按层范围被划分为多个阶段:第 0 到 15 层放在一个节点上,第 16 到 31 层放在下一个节点上,依此类推沿流水线排布。激活值从一个阶段流向下一阶段,因此几台普通的机器就能运行一个它们中任何一台都单独装不下的模型。OpenAI 客户端完全看不到这些。它仍然只是与 localhost 通信。

它如何使用 iroh

每个节点,无论是提供模型服务还是仅发送请求,都会启动一个 iroh 端点。该端点就是节点的身份,一个公钥,也是它唯一的网络接口。没有中心服务器。iroh 负责打洞、NAT 穿透以及中继回退,从而在任意两个节点之间建立一条直接的、经过认证的 QUIC 连接,无论它们位于何处。

为了在开放的互联网上保持这一机制运作,Mesh LLM 在不同区域运行两个 iroh 中继,这样无法直接互相连接的节点总能在附近拥有一条回退路径。

整个协议依托于 QUIC 的 ALPN 协商。共有三种:

ALPN它承载的内容
mesh-llm/1主网格:gossip、路由、HTTP 隧道、插件通道
mesh-llm-control/1所有者控制平面(配置同步、所有权证明)
skippy-stage/2面向拆分模型的延迟敏感型激活传输

在主 mesh-llm/1 连接内部,一切都是双向 QUIC 流,并带有一个单字节的前导标记,用以说明该流的类型。一条连接承载 gossip、推理、路由查询以及对等节点生命周期事件,全部通过这第一个字节进行解复用:

字节流类型描述
0x01GOSSIP对等节点公告(模型、GPU、RTT、能力)
0x04TUNNEL_HTTP代理到对等节点的推理请求
0x05ROUTE_REQUEST“你托管了哪些模型?”
0x06PEER_DOWN对等节点失联通知
0x07PEER_LEAVING优雅关闭
0x08PLUGIN_CHANNEL插件 RPC
0x0eDIRECT_PATH_REQUEST共享直连地址以实现 NAT 穿透

真正巧妙的地方在于它带来的好处。iroh 能在任意两台机器之间提供经过认证、可穿透 NAT 的 QUIC 连接,并以公钥作为寻址方式。于是,“路由到某个对等节点”和“把激活值流式传输到下一个流水线阶段”就变成了与“和 localhost 通信”相同的原语,只是端点 ID 不同而已。网络这件事不再需要你操心。

iroh 提供安全传输。Mesh LLM 在其之上构建了自己的 gossip 层,因此它可以精确控制谁被允许加入 mesh、哪些版本互相兼容,以及信任哪些对等节点。

快速上手

用户可以安装这款轻量级软件(约 18 MB),然后加入公共 mesh,或配置私有部署。该系统对任何标准 OpenAI 客户端都表现为 localhost:9337/v1。

一款移动应用即将推出,基于 iroh 的 Swift SDK 构建。计划是采用 ACP——这一新兴的智能体标准,从而让其他客户端也能加入 mesh。贯穿始终的主线与驱动整个项目的初衷一致:更多点对点,更少封闭服务器,且无锁定。

Iroh 是一个可拨号连接任意设备的网络库,开箱即用。你可以从现成协议的生态系统中组合出所需功能,也可以在哑管道之上的简洁抽象层上完全自定义。Iroh 是开源的,并且已在数十万台设备上投入生产运行。

要开始使用,请查看我们的

文档

,直接深入

代码

,或者在我们的

discord 频道

中与我们交流。

来源:Hacker News 热门(buzzing.cc 中文翻译) · iroh.computer