跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· gainsurier·· 2026-06-09精选AI 评分74

小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token

MiMo-v2.5-Pro-UltraSpeed:1T型号,每秒1000个令牌

AI 导读

小米在 6 月 8 日发布 MiMo-v2.5-Pro-UltraSpeed 模型,拥有 1T 参数规模,推理速度达到每秒 1000 个 token。该模型来自小米旗下的 mimo.xiaomi.com 项目。

推荐理由

小米把万亿模型推上 1000 tokens/s,不是纸面速度,而是模型与系统深耦合的结果,对实时推理和编程智能体是真正可落地的信号。限时申请有点可惜,但开源部分值得关注。

正文 · AI 翻译

MiMo-V2.5-Pro-UltraSpeed:将 1T 参数模型的生成速度推至 1000 TPS

1. 小米 MiMo-V2.5-Pro-UltraSpeed:速度就是终极优势

从内燃机时代第一辆轰鸣的赛车,到击碎音障的音爆,人类对速度的渴望深植于我们的 DNA 之中。AI 推理的速度也不例外——它定义了智能本身的边界。当一个模型足够快时,它就不再是你需要等待的工具,而成为你思维的延伸:实时响应、瞬间迭代、无缝协作。

今天,我们非常激动地宣布,与 TileRT 合作发布小米 MiMo-V2.5-Pro-UltraSpeed,首次在 1 万亿参数模型上突破 1000 tokens/s 的解码速度!

视频 · 前往原文观看
MiMo-V2.5-Pro UltraSpeed 实时生成速度对比(最高约 1200 tokens/s)

2. 限时开放 · 申请制

MiMo-V2.5-Pro-UltraSpeed API 同步上线,限时促销价——价格为 MiMo-V2.5-Pro 的 3 倍,但带来约 10 倍的生成速度!3 倍价格,10 倍输出体验。(仅限 API;不支持 Token Plan。)

由于高速推理资源有限,MiMo-V2.5-Pro-UltraSpeed 将通过申请制、限时窗口的方式开放。获批用户可在试用期内访问 API,仅限 2026 年 6 月 9 日至 6 月 23 日 23:59(北京时间,UTC+8 / 08:59 PDT)。

如何申请

API 平台:platform.xiaomimimo.com/ultraspeed。试用名额有限——提交申请并不保证获批。我们将优先考虑有真实业务需求的企业和专业开发者。如需标准模型访问,请使用 MiMo-V2.5 模型系列。如需针对 UltraSpeed 模型的深度业务合作,请联系 business-mimo@xiaomi.com。

对话体验(试用期内免费)

获批用户将获得在两周窗口期内有效的免费对话访问权限。入口:ultraspeed.xiaomimimo.com

为确保资源受限条件下的质量和公平性,适用以下规则:每个账号每天最多可进入队列 10 次;每次会话上限为 30 分钟;空闲超过 5 分钟的会话将被自动释放。

3. 1000 tokens/s:不只是快,而是一次范式转变

在万亿参数(1T)规模下,突破 1000 tps 远不只是打字机更快了——它从根本上颠覆了 AI 应用范式。

首先,速度本身开始转化为智能。过去,面对一个难题,你只能"等一个答案,然后祈祷它是对的"。如今,在同样的实际时间内,模型可以并行运行数十条推理路径(Best-of-N / 树搜索),在后台自动验证并自我纠错——用原始速度生成思维深度,直接提升推理质量。

其次,它彻底释放了 Coding Agents 的生产力上限。以前,让 AI 写代码意味着开发者痛苦地守在屏幕前等待,受制于推理延迟。在 1000 tps 下,代码生成速度和生产效率经历范式级的加速。

最重要的是,万亿参数模型如今可以进入实时决策循环。毫秒级的"思考-响应"周期让 1T 旗舰模型能够无缝接入时间关键型场景——高频量化交易信号生成、即时反欺诈拦截、智能竞价以及实时交互对话。而当这种能力被带到生死攸关的手术辅助和医学影像分析中时,AI 速度不再只是一个效率指标——它成为与死亡赛跑中的一枚筹码。在手术台上,AI 在完成病灶分析和风险预测上每节省一秒,就为外科医生多争取一度自由。这让我们更加坚信,速度的终极意义不仅仅是提升生产力,而是让技术帮助人类生活得更好。

4. 极致的模型-系统协同设计

用 1T 旗舰模型实现 1000+ tokens/s 的生成速度,并非某一项技术的突破——而是 MiMo 模型团队与 TileRT 系统团队深度协作、极致协同设计(Codesign)的成果。业界目前实现类似极致速度的做法,通常依赖专用硬件——Cerebras 的晶圆级集成,或 Groq 的纯片上 SRAM 定制架构。我们选择了一条不同的路径:仅通过模型与系统的协同设计,在通用 GPU上实现更令人瞩目的推理速度。

在模型侧,我们针对通用硬件的带宽瓶颈应用了FP4 量化,大幅缩小模型体积并降低内存访问开销;同时,我们引入了DFlash,一种基于块级掩码并行预测的高效投机解码方法,显著提升了每次验证步骤中被接受的 token 长度。在系统侧,TileRT 完美适配这些算法的动态特性,提供了专门针对这一全新量化与投机解码流水线优化的定制编译引擎和计算内核。通过这种极致的协同设计,我们仅用一台标准的 8-GPU 通用节点,就实现了 1T 模型 1000+ tokens/s 的输出。

4.1 FP4 量化

在万亿参数(1T)规模下,传统的 8 位(FP8 / INT8)乃至 16 位推理会带来难以承受的显存占用和带宽压力。降低参数字宽可直接提升解码速度。因此,我们采用了经过广泛验证、几乎无损的 FP4(MXFP4)量化格式[1]。

然而,若将 FP4 简单粗暴地应用于整个模型,会导致复杂推理、逻辑和代码生成能力下降。鉴于小米 MiMo-V2.5-Pro 采用 MoE(混合专家)架构——其中专家模块占据了绝大多数参数,且对量化具有最高的容忍度——我们选择性地仅将 MoE 专家模块量化为 FP4,同时对所有其他模块保留原始精度。通过 FP4 QAT(量化感知训练),我们大幅缩减了模型体积,并最大化硬件带宽利用率,同时使模型的整体能力与原始模型基本持平,如下所示:

Model capability comparison between FP4 quantization (MoE Experts only) and FP8 across benchmarks, with overall capability essentially on par with the original model
FP4 量化(仅 MoE 专家模块)与 FP8 在各基准测试上的模型能力对比,整体能力与原始模型基本持平

4.2 DFlash 投机解码

传统的投机解码依赖一个小型草稿模型来"猜测"后续 token,再由大模型进行验证。这将自回归生成(每次前向传播生成 1 个 token)转变为并行的多 token 生成,并在验证阶段通过拒绝采样确保输出质量无损。然而,其瓶颈在于草稿模型的质量决定了接受率,而更强的草稿模型会带来更高的计算开销——这是一对根本性的矛盾。

为了打破这一僵局,我们采用了 DFlash,这是来自研究社区的一种创新的块级掩码并行预测方法[2]:草稿模型在单次前向传播中填充整个掩码位置的块,从根本上消除了“自回归起草”的串行约束。

我们将这一方法部署在 MiMo-V2.5-Pro 上,并针对万亿级 MoE 和长上下文场景进行了定制优化。借助 Muon 二阶优化器和模型自蒸馏,我们确保紧凑的掩码块仍能提供理想的接受率,同时将草稿阶段的开销压缩至接近其理论最小值:

  • 草稿模型完全采用滑动窗口注意力(SWA),与 MiMo-V2 系列的 SWA 设计天然契合。这消除了对完整前缀的依赖,将每次预测的计算量从随上下文长度线性增长降至恒定。
  • 在训练期间,掩码信号采样被下推至 GPU 本地分片,使单条序列能在一步内产生数万个独立的训练信号,覆盖多样化的上下文位置——这与 MiMo-V2 系列的长上下文能力相契合,同时避免了跨设备通信开销。

在结果方面,我们的并行预测投机解码在高价值的智能体和编程场景中实现了显著的接受长度提升,这意味着大模型每轮验证可以“一口气”确认更多内容。此外,我们将块大小限制为 8,以减少验证开销并提高并发度,使高接受长度能够直接转化为高推理吞吐:

场景接受长度
编程6.30
数学 / 推理5.56
智能体4.29

在编程场景中,我们实现了 6.30 的平均接受长度,部分样本最高达到 7.14——这意味着每轮验证的 8 个草稿 token 中有 6–7 个被接受。草稿模型保持轻量,同时将接受率推升至能够带来真实端到端收益的水平。我们还观察到,在语义更加发散、不确定性更高的通用对话场景中,当前的接受率还不够高。我们正在持续优化算法,以探索更高的泛化上限。

4.3 TileRT 超低延迟推理内核 / 系统

如果说 MiMo 的算法创新解开了百亿和万亿参数模型的带宽束缚,那么 TileRT 推理系统则将商用 GPU 的物理潜力压榨到微秒级。

在 1000 tokens/s 的运行频率下,每个算子的生命周期被压缩到微秒级,传统推理系统的“算子边界”成为核心瓶颈——每一次算子启动、硬件同步和全局内存往返都会在微秒尺度上打断执行流,暴露出可见的“执行间隙”。

TileRT 范式级执行模型革命

作为超低延迟推理的基础设施,TileRT 引入了一种全新的执行模型,从根源上消除了算子边界带来的执行间隙:

  • 持久化引擎内核:彻底抛弃传统的逐算子启动范式,让整个计算流水线持续驻留并在 GPU 内流动。这实现了全流水线持续预取——当当前 Tile 仍在 Tensor Cores 上计算时,后续数据已经流经内存层级,实现数据搬运与计算之间的极致重叠。
  • Warp 特化(异构流水线协作):在 Tile 层面,通信、数据搬运和张量计算以更细的粒度被物理分解。打破同构的锁步执行模型,不同的 Warp(线程组)乃至整个 GPU 上的异构执行域独立运行却又精确协调——将 GPU 转变为一个持续流动、精确编排的异构执行系统。

微秒级软硬件深度协同设计(Codesign)

当底层执行模型将硬件性能推向极限时,纯粹的运行时优化开始触及物理边界。在此基础上,TileRT 系统团队与小米 MiMo 团队展开了深度技术共创,打破了传统软件层的边界。为了让模型行为与这条超低延迟执行流水线完美对齐,模型层最终在 MoE Experts 上采用了混合 FP4 量化策略,并在万亿参数架构上部署了 SWA 对齐的 DFlash 投机解码。TileRT 与这些算法特性和量化方案紧密耦合,提供了定制构建的编译引擎和计算内核。两个团队基于硬件物理特性做出了深刻的联合工程权衡,确保执行压力在硬件边界内平稳收敛。

1000 tokens/s 的诞生并非单点优化的巧合。它是世界级系统基础设施与极致算法模型深度相互靠拢、协同演进的必然结果。

TileRT 是一支前沿系统架构团队,专注于下一代 AI 基础设施与超低延迟推理。该团队致力于在前沿大模型的生产环境中实现毫秒级实时响应,以全新的运行时架构打破传统的存储-计算壁垒。团队构思并实现了一种范式级的执行模型。通过在持久化内核、tile 流水线以及异构协同方面的全栈突破,TileRT 在复杂的异构生态系统中实现了极致的计算利用率。作为核心基础设施赋能者,团队积极与行业领先的合作伙伴在软硬件协同设计方面展开合作,为渴求“极致速度”的自主智能时代构建高性能计算基础。如需了解更多 TileRT 技术细节:tilert.ai/blog/breaking-1000-tps.html

5. 更多演示

Build a Snake game in just 10 seconds
仅用 10 秒构建一个贪吃蛇游戏
Recreate a MacOS interface in just 1 minute
仅用 1 分钟重现一个 MacOS 界面

6. 开源与展望

  • 我们已在 HuggingFace 上开源了 MiMo-V2.5-Pro-FP4-DFlash checkpoint,包括 FP4 量化权重和 DFlash 模型参数。欢迎社区使用并反馈:huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash
  • MiMo-V2.5 的 UltraSpeed 支持即将推出——敬请期待。

MiMo × TileRT — 极致的模型-系统协同设计,为万亿参数模型带来 1000 tps 的输出速度。

[1] OCP Microscaling Formats (MX) v1.0 规范:opencompute.org/documents/ocp-microscaling-formats-mx-v1-0-spec-final-pdf

[2] DFlash:arxiv.org/abs/2602.06036

来源:Hacker News 热门(buzzing.cc 中文翻译) · mimo.xiaomi.com