跳到正文
北京时间
原文
Artificial Analysis· @ArtificialAnlys · X·· 1 小时前精选AI 评分66
AI 导读

Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过在笔记本和工作站硬件上回放 8 个真实智能体任务共 168 轮模型交互(上下文增长至约 56K tokens)来测试本地推理性能。

正文 · AI 翻译

宣布推出 AA-AgentPerf-Local,我们面向本地 AI 模型的开源推理测试工具——测试智能体 AI 在你自己的笔记本电脑或工作站上能跑多快,并浏览我们的服务配置列表来规划你的下一个智能体配置

要点:

➤ 我们正在开源 AA-AgentPerf-Local,它会在笔记本电脑和工作站硬件上回放真实的智能体轨迹,以测试推理性能

➤ 我们发布了 NVIDIA DGX Spark、NVIDIA GeForce RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步结果

➤ 该工具和排行榜将很快扩展到覆盖更多硬件、框架和模型,并会随着新版本发布而持续更新

我们已经在手机和数据中心级硬件上对推理性能进行基准测试,并正在将覆盖范围扩展到笔记本电脑和工作站。除了托管一个展示热门模型与硬件组合结果的排行榜外,我们还开源了运行 AA-AgentPerf-Local 所需的全部代码和数据,以确保个人和公司能够运行自己的试验,为其本地 AI 服务决策提供依据。

AA-AgentPerf-Local 会回放真实的智能体会话。我们的默认工作负载是 8 个录制的智能体任务,跨越 168 个模型轮次。每个请求都像真实智能体那样携带到目前为止的完整对话,因此上下文会增长到约 56K tokens。每一轮都精确生成其录制数量的 tokens,因此每个系统执行的工作完全相同。默认情况下会跳过工具执行,以隔离推理速度,但在对你自己系统进行基准测试时,你也可以回放真实录制的工具延迟,或在你的 CPU 上实时运行工具调用。

在发布时,我们关注的是单个智能体在能够利用整个系统时所能达到的性能;我们计划随时间扩展这一覆盖范围,以涵盖多智能体系统以及智能体必须与其他常规进程一起运行的场景。

我们官方页面最初覆盖的硬件包括:NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)和 NVIDIA GeForce RTX 5090(32 GB)。选择这些硬件是为了覆盖一系列平台(CUDA、ROCm、Vulkan、Metal)、内存容量和带宽。我们将扩展重点硬件,以纳入 x86(及其他)笔记本电脑、面向 AI 的显卡(如 RTX PRO 6000 Blackwell)等,从而为消费者提供不同硬件类型性能的全面视图。

发布时重点展示的模型包括:Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B 和 Ling 3.0 Flash(124B / 5B 激活)。这些初始模型涵盖了不同的内存需求和稠密/MoE 架构,并且每个都以 4-bit 量化进行基准测试,以反映现实的服务条件。我们重点展示的核心模型集将随着新的开放权重模型发布而随时间变化。除了重点展示的模型外,AA-AgentPerf-Local 还能够对用户运行的任何 OpenAI 兼容推理服务器进行基准测试,这意味着任何模型和配置都可以在本地测试。

服务配置的选择很重要,运行时、量化和投机解码会显著改变结果。对于某个系统和模型组合存在官方现成配置的情况,我们使用了已发布的配置。对于所有其他情况,我们开发了自己的配置。每个配置都使用投机解码(MTP、DFlash 或 DSpark),全部 14 个配置都已发布在仓库和我们网站的配置页面上。

初步结果:

➤ 完成时间与每个模型的激活参数数量最为吻合:Qwen3.6-35B-A3B(3B 激活)在每个系统上都是最快的模型,例如比稠密的 Qwen3.8-27B 快 2.5-3.3 倍。然而,激活参数并不是全部,Ling 3.0 Flash(总计 124B,5B 激活)在所有能支持它的硬件上仍然落后于 Qwen3.5-9B(激活参数数量几乎是其两倍)。

➤ GeForce RTX 5090 是每个能装入其 32 GB 显存的模型的最快系统,完成时间比其他系统快 3.5 倍以上。单用户解码在很大程度上受内存带宽影响,GeForce RTX 5090 的带宽为 1,792 GB/s,而统一内存系统为 256-307 GB/s。

➤ DGX Spark 和 Ryzen AI Halo 总体上是相似的系统,具有相同容量的统一内存、相当的内存带宽,以及相同的 4,000 美元首发建议零售价。在我们的默认轨迹集上,DGX Spark 在四个模型中的三个上快 1.4-1.7 倍,而 Ryzen AI Halo 在 Qwen3.5-9B 上与它持平。这一差距远大于它们 7% 的带宽差异——Spark 比 Ryzen AI Halo 具有更强的低精度计算能力,使其能够更快地进行预填充,而其更成熟的 CUDA 软件很可能在实现更好的 MoE 和投机解码性能方面发挥了作用。

➤ MacBook Pro(M5 Pro,64 GB,20 核 GPU)是迄今为止测试的唯一笔记本电脑,并展现出有竞争力的结果,在 Qwen3.6-35B-A3B 和 Qwen3.8-27B 上比 Ryzen AI Halo 慢 2-9%(尽管在 Qwen3.5-9B 上慢 21%)。它在三个统一内存系统中拥有最高的内存带宽(307 GB/s),其当前 3,700 美元的价格是迄今为止测试系统中最低的。它的结果很可能受到软件成熟度和可用于预填充的计算能力的制约。

➤ 尽管智能体轨迹中 73-93% 的提示 tokens 由 KV 缓存提供,但仅仅读取每一轮的新输入(在预填充期间)就占用了端到端完成时间的很大比例,例如 Qwen3.8-27B 为 22-41%。这在相对于其内存带宽而言计算 FLOP/s 较低的系统上尤其影响显著,例如 Ryzen AI Halo,以及可能还有 MacBook Pro(MacBook 的 FLOP/s 未公布)。

➤ 迄今为止所有最成功的配置都实现了投机解码,例如将 Qwen3.8-27B 的解码速度提高到带宽约束上限之上约 30-120%。

来源:Artificial Analysis · x.com