Artificial Analysis 开源 AA-AgentPerf-Local,测试笔记本与工作站上本地 AI 智能体推理性能
AA-AgentPerf-Local: Benchmarking local AI agents on laptops and workstations
Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过重放 8 个真实智能体任务(168 轮、上下文增长至约 56K tokens)测试本地推理性能,并上线笔记本与工作站排行榜。
原文给出四种桌面级硬件和四个模型的智能体推理实测结果与全部开源配置,可帮读者在搭建本地 agent 前做选型比较。
隆重推出 AA-AgentPerf-Local,这是我们面向本地 AI 模型的开源推理测试工具——测试智能体 AI 在你自己的笔记本电脑或工作站上能跑多快,并浏览我们的服务配置列表,为你的下一个智能体部署做规划
要点:
➤ 我们开源了 AA-AgentPerf-Local,它能在笔记本电脑和工作站硬件上回放真实智能体轨迹,以测试推理性能
➤ 我们发布了 NVIDIA DGX Spark、NVIDIA GeForce RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步结果
➤ 该工具和排行榜将很快扩展到覆盖更多硬件、框架和模型,并会随着新版本发布持续更新
我们已经在手机和数据中心级硬件上对推理性能进行基准测试,现在正将覆盖范围扩展到笔记本电脑和工作站。除了托管一个展示热门模型与硬件组合结果的排行榜外,我们还开源了运行 AA-AgentPerf-Local 所需的全部代码和数据,以确保个人和公司能够运行自己的试验,为其本地 AI 服务决策提供依据。
AA-AgentPerf-Local 会回放真实的智能体会话。我们的默认工作负载是 8 个录制的智能体任务,涵盖 168 个模型轮次。每个请求都像真实智能体那样携带到目前为止的完整对话,因此上下文会增长到约 56K token。每一轮都恰好生成其录制数量的 token,因此每个系统执行的工作完全相同。默认跳过工具执行,以隔离推理速度,但在对你自己系统进行基准测试时,你也可以回放真实录制的工具延迟,或在 CPU 上实时运行工具调用。
在发布之初,我们聚焦于单个智能体在能够利用整个系统时所能达到的性能;我们计划随时间扩展这一覆盖范围,以涵盖多智能体系统以及智能体必须与其他常规进程同时运行的场景。
我们官方页面最初覆盖的硬件包括:NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)和 NVIDIA GeForce RTX 5090(32 GB)。选择这些硬件是为了覆盖多种平台(CUDA、ROCm、Vulkan、Metal)、内存容量和带宽。我们将扩展重点硬件,纳入 x86(及其他)笔记本电脑、RTX PRO 6000 Blackwell 等面向 AI 的显卡等,以便让消费者全面了解不同硬件类型的性能表现。
发布时重点展示的模型包括:Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B 和 Ling 3.0 Flash(124B / 5B 激活)。这些初始模型覆盖了一系列内存需求和稠密/MoE 架构,并且每个模型都以 4 位量化进行基准测试,以反映真实的服务条件。随着新的开放权重模型发布,我们重点展示的核心模型集将随时间变化。除了重点展示的模型外,AA-AgentPerf-Local 还能对用户运行的任何 OpenAI 兼容推理服务器进行基准测试,这意味着任何模型和配置都可以在本地测试。
服务配置的选择很重要,运行时、量化和推测解码会显著改变结果。当某个系统与模型组合有官方现成配置可用时,我们使用已发布的配置。对于所有其他情况,我们开发了自己的配置。每个配置都使用推测解码(MTP、DFlash 或 DSpark),全部 14 个配置都发布在仓库以及我们网站的配置页面上。
初步结果:
➤ 完成时间与各模型的活跃参数数量最为吻合:Qwen3.6-35B-A3B(3B 活跃参数)在所有系统上都是最快的模型,例如比稠密的 Qwen3.8-27B 快 2.5-3.3 倍。然而,活跃参数并非全部因素,Ling 3.0 Flash(总计 124B,5B 活跃)在所有能支持它的硬件上仍然落后于 Qwen3.5-9B(活跃参数数量几乎是其两倍)。
➤ GeForce RTX 5090 是所有能装入其 32 GB 显存的模型的最快系统,完成时间比其他系统快 >3.5 倍。单用户解码在很大程度上受内存带宽影响,GeForce RTX 5090 拥有 1,792 GB/s,而统一内存系统为 256-307 GB/s。
➤ DGX Spark 和 Ryzen AI Halo 总体上是相似的系统,具有相同容量的统一内存、相近的内存带宽,以及相同的 4,000 美元首发建议零售价。在我们的默认轨迹集上,DGX Spark 在四个模型中的三个上快 1.4-1.7 倍,而 Ryzen AI Halo 在 Qwen3.5-9B 上与它持平。这一差距远大于它们 7% 的带宽差异——Spark 比 Ryzen AI Halo 拥有更强的低精度计算能力,使其能够更快地预填充,而其更成熟的 CUDA 软件很可能在实现更好的 MoE 和投机解码性能方面发挥了作用。
➤ MacBook Pro(M5 Pro,64 GB,20 核 GPU)是目前测试的唯一笔记本电脑,并展现出有竞争力的结果,在 Qwen3.6-35B-A3B 和 Qwen3.8-27B 上比 Ryzen AI Halo 慢 2–9%(不过在 Qwen3.5-9B 上慢 21%)。它在三个统一内存系统中拥有最高的内存带宽(307 GB/s),其当前 3,700 美元的价格是目前测试过的系统中最低的。它的结果可能受限于软件成熟度和可用于预填充的计算能力。
➤ 尽管智能体轨迹的提示词 token 中有 73-93% 由 KV 缓存提供,但仅仅读取每一轮的新输入(在预填充期间)就占用了端到端完成时间的很大比例,例如 Qwen3.8-27B 为 22-41%。这在计算 FLOP/s 相对于内存带宽较低的系统上影响尤为显著,例如 Ryzen AI Halo,以及可能包括 MacBook Pro(MacBook 的 FLOP/s 未公开)。
➤ 投机解码已在目前所有最成功的配置上实现,例如将 Qwen3.8-27B 的解码速度提升至带宽约束上限之上约 30-120%。

大多数硬件价格相比其首发建议零售价显著上涨。按当前市场价格,最初四种硬件类型中,端到端完成时间越短的价格越高,其中 MacBook Pro(M5 Pro,64 GB)是目前最便宜的,而 GeForce RTX 5090 系统则是最贵的。我们的页面默认使用首发建议零售价,但允许自定义价格输入。下面我们展示对当前市场价格的最佳估计。

Qwen3.8-27B 的解码速度在三个统一内存设备上大致相似,这些设备的内存带宽相近,为 256-307 GB/s。GeForce RTX 5090 的解码速度比这些设备快 >5 倍,主要归因于其内存速度快 >5 倍,带宽达 1,792 GB/s。

Qwen3.8-27B 的预填充速度与解码呈现相似的模式,但 DGX Spark 过高的计算/带宽比体现在更快的上下文读取速度上。这在我们的智能体轨迹中很重要,因为即使每个提示的大部分内容都从缓存中提供(在 llama.cpp 上约为 93%),每个会话仍有约 196K 个新输入 token,对应约 31K 个输出 token。当工具返回一个大文件时,智能体在 Halo 上最多可暂停 24 秒,在 MacBook 上最多可暂停 39 秒,然后才回复,而在 GeForce RTX 5090 上约为 2 秒。

AA-AgentPerf-Local 以及 Laptops & Workstations 页面将随着相关新硬件和软件的出现而频繁更新。我们计划实现一系列额外功能,以更好地帮助用户以最优方式运行本地 AI:
➤ 更广泛的流行硬件和模型
➤ 更全面的本地 AI 部署配置库
➤ 更多自定义推理框架,例如目前正在测试的 Inco Splash
➤ 用户提交的结果排行榜
➤ 展示实时 CPU 工具调用的排行榜
➤ 多智能体场景
在你自己的硬件上试用 AA-AgentPerf-Local:https://github.com/ArtificialAnalysis/aa-agentperf-local
在此查看初始结果:https://artificialanalysis.ai/hardware-inference-stack/laptops-workstations,在此查看每种服务配置:https://artificialanalysis.ai/hardware-inference-stack/laptops-workstations/configs
来源:Artificial Analysis 完整文章(网页) · artificialanalysis.ai