Bonsai 27B:首款可在手机上运行的27B级多模态模型
Bonsai 27B:首款可在手机上运行的27B级模型
Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。
1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
今天,我们发布 Bonsai 27B,它基于 Qwen3.6 27B,是 Bonsai 家族全新的多模态旗舰,也是该能力级别中首个可在手机上运行的模型。
我们此前的发布已经证明,采用 1-bit 和三值权重的模型能够产出具有商业价值的语言模型。Bonsai 27B 将这一前沿拓展到新的能力层级:多步推理、结构化工具调用、视觉任务,以及能在多步之间保持连贯的计算机使用智能体循环。直到今天,在本地部署这一层级一直不切实际,原因很具体:一个 27B 模型在 16-bit 精度下约占 54GB,即便是优秀的 4-bit 版本也有 18GB,对手机和大多数笔记本电脑来说都太大了。
Bonsai 27B 改变了这一点。它有两个版本:
Ternary Bonsai 27B 采用三值 {−1, 0, +1} 权重,配合 FP16 分组缩放,实现真正的每权重 1.71 有效比特。它体积为 5.9 GB,是偏向质量的版本:可在日常笔记本电脑上运行,具备完整的推理、工具调用和智能体能力。
1-bit Bonsai 27B 采用二值 {−1, +1} 权重,配合相同的分组缩放,实现每权重 1.125 有效比特。它体积为 3.9 GB,是偏向占用空间的版本,可纳入 iPhone 17 Pro 的内存预算,首次将 27B 级别的模型带到手机上。
与每一次 Bonsai 发布一样,低位表示在语言网络、嵌入向量、注意力、MLP 和 LM head 上端到端运行,没有任何更高精度的逃生通道。两个变体都是多模态的,视觉塔以紧凑的 4-bit 形式发布,因此端侧工作流可以看到截图、文档和摄像头输入,而不仅仅是文本。Bonsai 27B 拥有完整的 262K-token 上下文窗口,并支持投机解码,通过无损的草稿-验证加速进一步叠加速度优势。所有内容即日起在 Apache 2.0 许可证下提供。
保留智能水平
在涵盖知识、推理、数学、编程、指令遵循、工具调用和视觉的 15 项基准测试套件中(在思考模式下评估,即模型的完整推理能力被充分调用),Ternary Bonsai 27B 保留了全精度基线的 95%,1-bit Bonsai 27B 保留了 90%。
| 类别(基准测试) | Qwen 3.6 27B | Ternary Bonsai 27B | 1-bit Bonsai 27B |
|---|---|---|---|
| 数学(GSM8K、MATH-500、AIME25、AIME26) | 95.3 | 93.4 | 91.7 |
| 编程(HumanEval+、MBPP+、LiveCodeBench) | 88.7 | 86.0 | 81.9 |
| 智能体与工具调用(BFCL v3、TauBench) | 80.0 | 74.0 | 66.0 |
| 指令遵循(IFEval、IFBench) | 78.4 | 71.8 | 65.8 |
| 知识 / STEM(MMLU-Redux、MuSR) | 83.1 | 77.0 | 73.4 |
| 视觉(MMMU Pro、OCRBench) | 72.6 | 65.2 | 59.6 |
| 总体(15 项基准测试) | 85.0 | 80.5 | 76.1 |
图 I:Bonsai 27B(思考模式)与全精度基线的基准测试得分对比。完整的逐项基准测试结果见白皮书。
按能力维度来解读这张表,情况比平均值所呈现的更为鲜明:数学和编程能力几乎未受影响,工具调用与全精度的差距保持在几个百分点之内——而这些恰恰是智能体工作负载所依赖的能力。作为对比,同一基础模型最激进的常规低比特版本,得分显著低于 1-bit Bonsai 27B,却占用了 2.5 倍的内存。
这与我们此前在语言模型和图像模型上展示的帕累托前沿迁移如出一辙,如今在 27B 规模上得以重现:以比全精度 2B 模型更小的占用实现 27B 级别的能力。按智能密度——我们随 1-bit Bonsai 8B 一同提出的衡量指标——计算,1-bit Bonsai 27B 达到每 GB 0.53:超过全精度基线的 10 倍以上,约为现有最佳低比特替代方案的 2.7 倍。

为何这是一次重要的范式转变
最有价值的 AI 工作负载正在从单次响应转向持续工作:能够操作真实工具的助手、无人值守运行并在返回结果前持续执行的工作流,以及综合数十份文档的研究任务。这一转变改变了工作负载的形态——一个智能体不是发起一次模型调用,而是发起数百次,每一次都携带上下文、产生结构化输出,并馈入下一次调用。
对于许多产品而言,云端 API 仍将是正确的选择。但对于智能体工作负载,仅依赖云端执行会带来结构性约束:每一步都是远程请求,按 token 计费的成本随着每次迭代不断累积,而每一个计划、工具调用和中间结果都要跨越网络传输,包括用户的私有文件、屏幕和数据。
轮播图一:使用 Hermes 的端到端智能体工作流,由我们的 Ternary Bonsai 27B 模型在 NVIDIA GeForce RTX 5090 上驱动。
本地执行改变了这一局面。当一个能够胜任持续智能体工作的模型可以装进设备时,智能体就能活在产品内部:百步循环的边际成本为零,用户的数据永远不会离开这台机器。全新的品类随之打开——持久化的端侧智能体、可离线工作的助手、从架构上就对私有本地数据进行推理的助手。此前一直缺失的,是一个小到可以这样部署、又强到足以托付工作的模型。Bonsai 27B 就是那个模型。
它还解锁了一种新的系统架构:混合部署,将非前沿且隐私敏感的任务路由到能力足够的本地模型,把前沿云端模型留给最困难的步骤——从而大幅压缩智能体系统的单任务成本。
Bonsai 27B 在 NVIDIA GeForce RTX 5090 上,1-bit 模式下最高可达 163 tok/s,Ternary 模式下可达 134 tok/s。在 M5 Max 上,1-bit 模式下最高可达 87 tok/s,Ternary 模式下可达 58 tok/s。
适配手机比存储数字所暗示的门槛更为严格。手机从不会将全部内存暴露给应用——一台 12 GB 的 iPhone 大约只提供 6 GB 供模型在端侧使用,而模型还要与 KV cache 和激活值共享这一预算。任何常规构建的 27B 模型都远无法跨过这道门槛。1-bit Bonsai 27B 仅约 4 GB,是首个通过该门槛且仍有工作余量的模型。
正是这一约束,促使该系列特意推出两个经过深思熟虑的运行档位:Ternary 面向笔记本级质量,1-bit 面向手机级占用。
演示 II:由 1-Bit Bonsai 27B 在 iPhone 17 Pro Max 上驱动的多模态智能体用例(演示模式:缓存并预填充图像上下文)
前沿仍在不断推进
每一次 Bonsai 发布都将每 GB 智能的前沿向左推进,而 Bonsai 27B 将其推过了一个实用阈值:一个现代模型的完整能力集——具备思考、多模态理解、视觉、可靠的工具使用——如今已能装进人们已经拥有的设备之中。
我们认为,智能密度将成为 AI 下一阶段发展的关键维度之一。原始能力决定模型能做什么;密度决定它能在哪里做。前沿每向左移动一步,都会扩展先进 AI 可运行的设备、产品和环境集合,并改变它所触及的每一个部署场景的经济性,从手机到单 GPU 服务。Bonsai 背后的方法论与架构无关,而前沿将持续推进:更大的模型和新的架构已经在进行中。
早期的计算机占满整个房间;如今它们生活在我们的口袋里。智能正在经历同样的旅程,而 Bonsai 27B 是迄今为止最大的一步。
平台覆盖
Bonsai 27B 通过 MLX 在 Apple 设备(Mac、iPhone、iPad)上原生运行,并通过 CUDA 在 NVIDIA GPU 上运行,依托为其混合注意力架构打造的自定义低位内核。模型权重现已根据 Apache 2.0 许可证提供。通过此次发布,我们提供一个免费的限时开发者预览 API,让开发者可以轻松试用我们的模型。
关于我们的压缩、评估和基准测试流程的完整技术细节,请参阅我们的白皮书。
加入我们
PrismML 出自一支由 Caltech 研究人员组成的团队,在 Khosla Ventures、Cerberus 和 Google 的支持下成立,并持续获得 Samsung 的支持。多年来,我们一直致力于攻克该领域最棘手的问题之一:在不牺牲推理能力的前提下压缩神经网络。
如果你想帮助打造下一代最先进的 AI,我们很乐意听到你的消息。请查看我们的招聘页面。
来源:Hacker News 热门(buzzing.cc 中文翻译) · prismml.com