跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-09精选AI 评分70

快手开源 Kwai Keye-VL-2.0-30B-A3B:面向长视频理解与智能体智能的 MoE 多模态模型

Kwai Keye-VL-2.0 Technical Report

AI 导读

快手开源 Kwai Keye-VL-2.0-30B-A3B,一个 MoE 多模态基础模型,激活仅 3B 参数,专为长视频理解和智能体智能设计。模型首次将 DeepSeek Sparse Attention (DSA) 适配到 GQA 多模态架构,实现无损 256K 上下文处理,并通过可扩展视频 I/O、异构 ViT-LM 并行及自定义 DSA 内核优化吞吐与计算开销。引入跨模态多教师在策略蒸馏(MOPD)结合 Context-RL 和 Video-RL,缓解多任务对齐中的灾难性遗忘,原生支持代码、工具、搜索场景下的多智能体协作与多模态自纠正。在 TimeLens、Video-MME-v2、LongVideoBench 等多个基准上达到同类规模 SOTA,模型权重已开源。

推荐理由

Keye-VL-2.0 把长视频理解推到 256K 上下文,还用了 DeepSeek 的稀疏注意力,这是目前我能找到的对长短视频最兼顾的多模态模型,做视频 agent 的该看看。

正文 · AI 翻译
摘要

我们推出 Kwai Keye-VL-2.0-30B-A3B,这是一个开源的混合专家(MoE)多模态基础模型,旨在推进长视频理解与智能体智能。为应对小时级视频中存在的超长上下文、信息冗余以及高昂计算成本等挑战,Keye-VL-2.0 首次将 DeepSeek 稀疏注意力(DSA)适配至基于 GQA 的多模态架构,在捕捉关键帧与长程时序依赖关系的同时,实现了无损的 256K 上下文处理。该架构依托于高度优化的训练与推理基础设施,包括可扩展的视频 I/O、异构 ViT-LM 并行,以及能够显著最大化吞吐量并最小化计算开销的自定义 DSA 内核。此外,为克服多任务对齐过程中灾难性遗忘的算法难题,我们引入了跨模态多教师在线策略蒸馏(MOPD),并结合 Context-RL 与 Video-RL。通过将在线策略 rollout 中密集的 token 级教师反馈蒸馏回仅激活 30 亿参数的 MoE 骨干网络,Keye-VL-2.0 原生赋能了跨代码、工具与搜索场景的高级智能体协作,并具备多模态自我修正能力。在视频理解、时间定位、推理、STEM 及智能体基准测试上的广泛评估表明,Keye-VL-2.0-30B-A3B 在相似规模模型中达到了最先进的性能,尤其在 TimeLens 上的细粒度时间定位以及 Video-MME-v2 和 LongVideoBench 上的长视频理解方面表现卓越。我们开放模型检查点,以加速社区向可扩展且稳健的多模态智能体应用迈进。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 1:Keye-VL-2.0-30B-A3B 性能对比。我们的模型在细粒度时间定位(基于 TimeLens 框架的 ActivityNet、QVHighlights 和 Charades)以及极限长视频理解(LongVideoBench、Video-MME-v2)方面,展现出领先于开源模型(如 Qwen3.5-35B-A3B、Qwen3-VL-235B-A22B)和闭源模型(Gemini-3-Flash)的能力。

引言

近年来,大语言模型(LLM)正快速演进,不断融入更深层次的推理能力,并向复杂的多模态领域拓展。最新进展,如 OpenAI GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 以及 Qwen3.7,均展示了在多模态推理、长上下文理解以及专业化工具执行方面的显著进步。这些模型日益展现出分解复杂问题、处理动态且信息密集的视觉流的能力。

在我们先前工作——Keye-VL 和 Keye-VL-1.5(它们奠定了强大的视觉-语言对齐能力以及业界领先的短视频理解水平)——的坚实基础之上,我们推出了 Kwai Keye-VL-2.0-30B-A3B。在将模型的前沿能力从短时视觉感知拓展至长周期智能体推理的过程中,自然浮现出两大关键障碍。其一是基础设施瓶颈:扩展到极长视频上下文会带来高昂的计算和内存成本。其二是算法困境:整合复杂、异构的智能体任务常常会引发基础推理能力的灾难性遗忘。在本报告中,我们将详细阐述 Keye-VL-2.0 如何通过在架构和对齐方面引入范式级别的改进,优雅地解决了上述双重挑战,并重点关注以下两个关键方面。

通过多模态 DSA 实现极致上下文扩展。将多模态模型扩展至 256K 上下文的一个关键洞察在于,标准密集注意力机制不可避免地会导致 KV 缓存灾难性膨胀和计算瓶颈,迫使模型通过激进的帧下采样来牺牲时间连续性。为了突破这一延迟和可扩展性限制,Keye-VL-2.0 引入了一个 300 亿参数的混合专家(MoE)基础架构,其中仅 30 亿参数处于激活状态,从而确保了卓越的部署效率。至关重要的是,我们率先在视觉领域应用了多模态 DeepSeek 稀疏注意力(DSA)。通过压缩和稀疏化视频特征聚合,DSA 有效抑制了 KV 缓存的线性增长。这一设计使 Keye-VL-2.0 能够无损处理 256K 的极致长视频上下文,将视频理解从受帧数限制的感知转变为全局上下文推理,同时保持高推理效率。

通过跨模态多教师同策略蒸馏解决模态冲突。现有模型常受困于“多模态对齐困境”:直接注入复杂的视频理解与工具使用能力往往会引发灾难性遗忘,削弱模型在基础STEM、数学及语言推理方面的能力。为避免端到端联合优化的模糊性与不稳定性,我们引入了跨模态多教师同策略蒸馏(MOPD)(mimoteam2026v2flash)。通过创新的动态路由机制,MOPD在训练后阶段利用专门的教师模型,针对学生模型在不同模态与任务上生成的轨迹,提供密集的token级反馈。通过监督同策略展开,MOPD有效隔离了任务特定专长,随后将其蒸馏并无缝融合回统一的MoE主干中。这种双向对齐确保Keye-VL-2.0在原生智能体能力(如代码、工具使用、网络搜索)上实现显著跃升,同时稳健保留其通用推理基线。在训练后阶段,我们进一步应用了配备桶式优势缩放的Context-RL(lu2026contextrl)与Video-RL,以稳定长序列决策树并系统性减少视觉幻觉。

如图 1 所示,Keye-VL-2.0-30B-A3B 在与开源及闭源最先进模型的对比中展现出极具竞争力的性能。它在 TimeLens 基准测试(zhang2025timelens)(ActivityNet、QVHighlights、Charades)的细粒度时间定位任务上取得了顶尖结果,在多个时间定位设定上显著优于 Gemini-3-Flash(deepmind2025gemini3flash)等领先模型。此外,在包括 Video-MME-v2(fu2026videomme2)和 LongVideoBench(wu2024longvideobench)在内的极端长上下文评估中,它表现出非线性的能力扩展,证明了其在处理海量时序信息方面的稳健性。通过解决上下文扩展和多任务能力冲突这两大挑战,我们为开源社区提供了一个强大、高效且通用的多模态基础,使研究人员和开发者能够探索、优化并部署可扩展的多模态应用。

模型架构

遵循标准的多模态大语言模型(MLLM)范式,该模型由四个核心组件构成:

  • •

    视觉编码器(ViT):继承自 Keye-VL-1.5-8B(kwaikeye2025vl),用于从图像和视频帧中提取视觉特征。

  • •

    语言解码器(LLM):基于 Qwen3-30B-A3B-Thinking-2507(qwen3)构建,提供强大的通用知识、指令遵循和推理能力。

  • •

    MLP 投影器:随机初始化,并在第 0 阶段(第 3.1 节)进行训练,以将视觉特征与 LLM 表示空间对齐。

  • •

    稀疏注意力模块:一种兼容 GQA 的 DSA 设计,结合了基于全局 MQA 的索引与分组 GQA 聚合,实现了高效的长上下文多模态建模。

在此骨干网络之上,我们引入了三种面向高分辨率和长上下文多模态理解的架构设计:原生分辨率视觉编码器、图像与视频的统一视觉编码策略,以及基于 DSA 的 256K 多模态上下文稀疏注意力机制。

2.1 原生分辨率视觉编码器

多模态大语言模型的视觉编码器已逐渐从复用固定分辨率骨干网络转向原生分辨率建模。传统的固定分辨率 ViT 通常针对对比性图文匹配进行预训练,其粗粒度表征往往不足以应对对细节敏感的 downstream 任务,例如 OCR、细粒度识别、文档理解和视频理解。

针对高分辨率输入,目前主要探索了两种方法。动态拼接方法(如 InternVL3 和 MiniCPM-V)在将大尺寸图像送入固定分辨率编码器之前,会将其分割成较小的图像块。这种方法虽然有效,但可能会破坏全局结构并引入冗余计算。而原生分辨率方法(如 NaViT、Qwen3.5、K2.5 和 MiMO)则保留原始图像尺寸和宽高比。遵循这一方向,Keye-VL-2.0-30B-A3B 以图像和视频的原生分辨率进行编码,避免了不必要的裁剪或拼接,同时保留了全局结构和局部细节。

这种设计对于文档、OCR、图表和视频场景尤为重要,在这些场景中,一个微小的局部区域可能决定最终答案。通过在视觉处理流程中保持原始宽高比,编码器能够保留布局关系、物体几何形状以及细粒度的文本信号,而这些信息在固定尺寸的缩放中很容易失真。

自适应位置编码。

视觉编码器继承了 Keye-VL-1.5 的 ViT 骨干网络,该网络基于 SigLIP-400M-384-14。为了在保留预训练优势的同时支持可变分辨率,我们对固定的绝对可学习位置嵌入进行插值,使其能够随输入尺寸进行缩放。

二维旋转位置编码。

在自适应绝对位置编码的基础上,我们引入了二维旋转位置编码。这增强了跨视觉维度的空间建模和外推能力,尤其适用于极高分辨率的图像。

序列打包。

我们将自适应位置编码和二维旋转位置编码与 NaViT 的 Patch n' Pack 机制及 FlashAttention 相结合。因此,不同尺寸和宽高比的样本可以打包到单个批次中,无需填充浪费,从而在可变分辨率下提高训练吞吐量。

分布对齐的 ViT 预训练。

在 ViT 预训练期间,我们使用 SigLIP 损失函数优化原生分辨率架构,并将其与 SigLIP-400M-384-14 文本塔对齐。为了缩小对比预训练与下游多模态大语言模型任务之间的监督粒度差距,我们在与下游多模态大语言模型相同的数据分布上训练视觉编码器。预训练语料库包含来自大规模开源数据集的 500B 个模型 token,包括 DataComp、LAION、CC12M、PD12M 和 COCO,以及高质量的内部数据。

总体而言,这些升级使视觉编码器能够继承 SigLIP 强大的表示质量,同时获得下游多模态推理任务所需的分辨率灵活性。

2.2 统一视觉编码

为了向语言解码器提供详细的视觉信号,我们对图像和视频采用统一的动态分辨率编码策略。

  • •

    动态分辨率图像编码。静态图像由动态分辨率 ViT 直接编码。视觉 token 的数量根据原始像素尺寸分配,避免了有损缩放或裁剪。

  • •

    动态分辨率视频编码。对于帧率、分辨率和时长各不相同的视频输入,每个采样帧都被视为独立的高分辨率图像,并由相同的视觉编码器进行编码。为了保留时间信息,我们在预处理过程中为每一帧的视觉 token 添加自然语言时间戳。这种显式的时间戳注入有助于大语言模型感知时间顺序、因果关系和绝对时间。

    与设计独立的视频专用编码器相比,这种“帧即图像”的公式化方法保持了视觉路径的简洁与统一。时间戳文本在大语言模型的原生语言空间中提供了时间锚点,使得时间定位和跨帧推理更容易从指令和强化学习数据中学习。

  • •

    自适应视频像素预算。为了平衡信息密度与计算量,我们通过将全局预算平均分配给各视频来设定基础像素预算。在自适应模式下,每个视频的预算会根据时长进行缩放,其中阈值分别为 s、s、s 和 s,对应的缩放因子为 、、 和 。时长超过 s 的视频使用完整的基础预算。这种方法能更积极地压缩短且冗余的视频,同时允许较长的视频保留更多视觉证据,从而将总 token 成本控制在可控范围内。

2.3 用于长上下文多模态建模的 DSA

传统的全注意力机制在序列长度上具有二次复杂度,这使得支持 256K 多模态上下文变得困难。为了解决这一瓶颈,我们将 DeepSeek 稀疏注意力(DSA)集成到解码器注意力路径中。与大多数基于 MLA 改造的现有 DSA 系统不同,Keye-VL-2.0-30B-A3B 将 DSA 与基于 GQA 的多模态大语言模型骨干网络相结合,为 GQA 模型的长上下文扩展提供了一条实用路径。

2.3.1 MQA 风格的闪电索引器

DSA 包含一个闪电索引器和一个细粒度的 token 选择机制。为了提升吞吐量,该索引器遵循 MQA 的键共享设计,并计算当前查询 token 与每个先前 token 之间的全局索引分数:

(1)

此处, 是索引器头的数量, 和 源自 ,而 是源自 的共享键。在获得全局分数后,Top- 个 token 构成稀疏索引集:

(2)

通过在所有查询头之间共享一个键头,该索引器显著减少了计算量和内存流量。结合 FP8 实现和基于 ReLU 的评分函数,即使多模态序列包含数十万个 token,闪电索引器也能保持高效。

2.3.2 GQA 稀疏聚合

在 GQA 骨干网络中,查询头被划分为多个组,每组内的头共享一个组特定的 KV 头。我们对所有组应用相同的稀疏索引集。对于第 组,稀疏注意力输出为:

(3)

所有组的输出被拼接起来,形成最终的注意力表示。我们设定 ,将核心注意力复杂度从 降低至 ,其中 是序列长度,且 。

这种全局 MQA 风格索引与 GQA 聚合相结合的设计,保留了 GQA 骨干网络的表示结构,同时避免了在整个上下文上进行密集注意力计算。因此,模型能够以更低的显存和计算成本执行长距离时空与语义聚合。

2.3.3 密集预热与稀疏适配

我们采用两阶段策略训练 DSA。在密集预热阶段,主模型保持密集 GQA 计算,同时大部分参数被冻结。其目标是初始化索引器,使其全局分布能够覆盖所有 GQA 组的注意力分布。对于查询 token ,我们聚合每组内的密集注意力分数,在视觉和文本 token 上进行归一化,得到目标分布 。预热阶段的损失函数为:

(4)

该阶段使用了约 20 亿多模态 token。

在稀疏适配阶段,所有参数被解冻,训练切换至稀疏模式。索引器继续与主模型的注意力分布保持对齐,但 KL 散度损失仅针对选定的 Top- token 集合进行计算:

(5)

目标分布在 上被截断并重新归一化:

(6)

主模型使用标准的下一 token 预测损失进行优化。为减少梯度干扰,索引器的输入从计算图中分离。最终的目标函数为:

(7)

这种两阶段训练策略避免了稀疏索引器在稀疏监督下从零开始学习。密集预热阶段首先使索引器与原始注意力模型的行为对齐,稀疏适配阶段则训练完整模型学会依赖动态选择的证据。在长上下文评估中,该设计在显著降低推理开销的同时,保留了密集模型的能力。

预训练

Keye-VL-2.0-30B-A3B 通过四个阶段的课程进行预训练。阶段 0 仅训练投影器以初始化视觉-语言映射。阶段 1 在 32K 上下文长度下执行全参数多模态预训练。阶段 2 将上下文扩展至 64K,并注入面向任务的能力,例如 OCR、VQA、STEM、GUI、定位、计数、编码、工具使用和搜索。阶段 3 进一步将上下文扩展至 256K,专注于长视频、多页文档、多文档输入以及长程智能体轨迹。

3.1 阶段 0 — 投影器初始化

阶段 0 建立了视觉编码器与语言模型之间的初始连接。ViT 和 LLM 被冻结,仅训练投影器,将来自 Keye-VL-1.5 ViT 的视觉特征映射到 LLM 表示空间。此阶段使用图像-文本描述数据进行直接的语义对齐,并使用图像-文本交错数据,使投影器能够接触到类似真实文档的上下文,其中图像和文本交替出现。

由于仅更新投影器,阶段 0 在全参数多模态训练之前提供了一个低风险的初始化步骤。它允许 LLM 在兼容的表示空间中接收视觉特征,而不会干扰 ViT 或语言主干已习得的能力。

3.2 阶段 1 — 通用多模态预训练

阶段 1 在大约 1T 个 token 上,以最大序列长度 32K 训练所有参数。目标是建立稳定的视觉-语言对齐、图像感知、视频理解、OCR 识别和通用语言能力。

训练数据包括图像-文本描述、图像-文本交错数据、视频交错数据、纯文本问答和 OCR 数据。对于视频学习,每个视频被分割成 15 秒的片段,每个片段配有一个描述,并组织成交错的多模态序列。这使得模型能够理解时间连续性、场景转换和事件演变。

为了提升来自 LAION、DataComp、COYO 和 CC12M(laion; datacomp; coyo; cc12m)等大规模开源语料库的图文对质量,我们采用了两种策略:重写描述(Recaption)直接使用专业描述模型从图像生成描述,以确保高质量;而改写描述(Remake)则基于原始描述,修正语法和表达错误,但不改变其语义。OCR 数据涵盖了多种类型,例如艺术字体文本、手写文字、LaTeX 公式、代码、图表和文档,这为模型在文本识别和基础感知能力方面奠定了早期基础。

这种数据类型的多样性——涵盖图像描述、交错图文、交错视频-文本、纯文本和 OCR 数据——旨在防止模型在单一输入格式上过度专业化。具体而言,图像描述数据提供了图像与其描述之间密集的语义对齐;交错图文数据让模型接触到网页和文档中图像与文本的组织方式;交错视频-文本数据引入了时间与跨模态结构;而 OCR 数据则从多模态训练的初始阶段就建立了对视觉文本和结构化页面布局的敏感性。

Refer to caption
图 2:Keye-VL-2.0-30B-A3B 预训练流程,遵循从投影仪初始化到 256K 长上下文多模态训练的四阶段课程。

3.3 第二阶段——多任务能力注入

第二阶段继续进行全参数训练,将上下文长度扩展到 64K,并在约 2T 个模型 token 上进行训练。与第一阶段相比,本阶段更强调面向任务和可验证的监督信号。

3.3.1 图像-文本数据

高级 OCR。

我们进一步将 OCR 数据扩展到收据和多种图表类型,利用了真实样本以及从 XML 或结构化模板生成的合成样本。我们应用了模糊、光照变化、褶皱、手写变化和几何畸变等数据增强手段,以提升模型在字段提取、表格读取和图表理解方面的鲁棒性。

真实样本由在真实世界场景中拍摄的图像构成,携带真实的噪声和自然出现的业务布局,而合成样本则提供精确的字段级和结构级标注。将两者结合既能提升鲁棒性,也能增强监督精度。

数学与 STEM。

我们引入了涵盖数学、物理和化学的视觉解题示例,并利用基于大语言模型的验证来确保问答质量,同时剔除低质量样本。这有助于模型从识别公式和图表,进阶到基于这些元素进行推理。覆盖的场景包括几何图形、函数图像、实验装置、公式和科学图表。目标是提升模型在多样化视觉场景中的泛化能力。

保留高质量的字幕数据以维持视觉-语言对齐。一个使用 VCap 训练的 8B 字幕专家模型能够生成详细描述,强调属性、空间关系、主体绑定以及长描述一致性——产出的字幕比第一阶段使用的字幕更全面、更精细、质量更高,甚至超越了更大规模模型生成的字幕。

图形用户界面。

GUI 任务涉及屏幕截图、控制元数据和交互语义,涵盖元素定位、控件识别、页面理解、操作描述和 GUI-QA。GUI 输入与自然图像存在显著差异,其特点是密集的小型文字、图标、规整的布局以及频繁的状态变化。因此,在专门的 GUI 任务上进行训练,为后续基于视觉的点击、导航和任务执行奠定了基础。

定位与计数。

针对定位和计数任务,我们合成了实例粘贴数据。来自 COCO 和 OpenImages 的候选对象经多模态大语言模型验证后,以可控的数量和位置粘贴到背景上,从而生成精确的边界框和计数标注。

通用问答、电子商务与中文扩展。

我们补充了用于物体识别、属性、场景和关系的通用视觉问答数据,并引入了快手电商数据以增强产品理解能力。为提升中文覆盖度,高质量的英文任务数据被翻译成中文,在原始答案约束下重新生成,并经过一致性筛选。

3.3.2 纯文本数据

第二阶段保留纯文本训练,以保持大语言模型在语言、推理、编码、工具使用和指令遵循方面的能力。数据混合涵盖纯文本数学与STEM推理、用于错误修复和竞赛编程的代码语料库、Hermes风格的工具使用轨迹(hermes),以及基于维基百科知识图谱的搜索/检索增强生成示例,包括单文档问答、多文档摘要、证据定位和多跳推理。

纯文本组件可缓解多模态微调过程中基础模型语言侧能力的退化,同时为推理格式、代码生成、工具调用和基于证据的答案合成提供可迁移的先验知识。

3.4 第三阶段——长上下文扩展

第三阶段将最大序列长度扩展至256K,同时继续进行全参数训练。长上下文和短上下文样本按一定比例混合,以提升超长序列建模能力,同时保持对常规输入的性能。

数据涵盖长视频、长文档、多文档输入、长多图像对话、长代码上下文以及长序列智能体轨迹。目标不仅是扩大上下文窗口,更是为了提升对超长多模态输入的检索、聚合和跨位置推理能力。

对于长视频,模型必须追踪关键事件并整合跨多个帧片段的证据。对于长文档和多文档输入,模型必须处理多页OCR、表格、布局和长文本证据。对于智能体轨迹,模型必须在多次工具调用和交互轮次中维持任务状态。

3.5 数据清洗与生产流程

我们构建了一套统一的数据清洗、去重和生产流水线。清洗环节负责移除低质量文本、无效格式、不安全内容、重复样本以及不可靠的图像-文本或视频-文本对。去重采用联合哈希(Hash)+ CLIP 策略:哈希用于识别完全重复或近似重复的内容,而 CLIP 相似度则用于检测语义相似的跨模态重复项。

在生产效率方面,该流水线支持字幕生成、OCR 构建、问答生成、翻译、质量评估、一键部署、任务监控以及基于检查点的断点续跑。一种双队列异步机制将 CPU 端的预处理与 GPU 端的推理解耦,在实际应用中使生产吞吐量提升了 3 到 5 倍。

媒体内容 · 前往原文查看
表 1:各预训练阶段的视频训练配置。
阶段 最大视频时长 视频 Token 数
1 15 秒 24K
2 15 分钟 64K
3 2 小时 180K

3.6 视频预训练课程

为了从短视频理解扩展到高分辨率长视频推理,我们采用了一种多阶段视频课程,总结于表 1。

阶段 1 使用 15 秒的短视频片段进行视频-语言对齐。阶段 2 增加了时长和分辨率,并引入了时间视频定位(TVG)数据。阶段 3 将最大时长延长至 2 小时,要求模型识别稀疏但关键的时刻,并聚合长程证据。在中期训练中,我们保持阶段 3 的配置,同时增加了更丰富的任务,例如视频字幕生成、时间问答、实体识别、场景理解、因果推理、事件排序和视频计数。

Refer to caption
图 3:场景级密集字幕示例。每个视频被分解为多个场景,并标注有时间戳、密集字幕和全局概览。
场景级密集字幕。

我们将密集视频字幕重新定义为结构化的场景级描述,并附带开始和结束时间戳。如图 3 所示,这种表述方式增强了场景边界感知能力以及描述与时间区间之间的对齐。我们训练了一个专家模型以提高标注效率。

多样化的 TVG 数据。

受 ETBench 启发,我们构建了覆盖指代动作识别、视频高光检测、抽取式视频摘要和时序事件匹配的 TVG 数据。这些任务为时序感知与推理提供了互补性的监督信号。

后训练

4.1 监督微调与合成思维链

在多模态预训练之后,我们进行监督微调,将视觉感知和跨模态对齐转化为稳定的指令遵循行为。该阶段使多模态能力适配对话式指令,激活感知、推理、长上下文和智能体能力,并缓解多模态微调过程中的语言退化问题。

监督微调语料库包含约 500B 个模型 token,围绕模态平衡、能力覆盖和长程建模进行组织。它涵盖文本 NLP、视频、感知、推理、智能体和长上下文数据。其中约 40% 的语料为纯文本数据,用于锚定指令遵循、知识问答和文本推理能力。

4.1.1 多模态指令混合

为提升复杂多模态场景下的综合指令遵循能力,我们构建了覆盖视频理解、视觉感知、跨模态推理、智能体导向任务和长上下文建模的多模态指令混合数据集。该混合的目标并非简单增加视觉数据比例,而是促进感知、定位、推理和任务执行等能力的互补发展。

视频数据主要用于强化时序感知和证据定位。部分样本被设计为带线索区间的多项选择题问答任务。模型需在<思考>阶段验证候选时序片段,并以 [[mm, mm], ...] 格式输出最终答案及支撑区间。这种设计促使模型从连续视频内容中定位关键证据,而非仅依赖全局视觉印象。

感知数据涵盖OCR、文档理解、图表理解、通用视觉问答、图像描述、指代定位、计数和图像识别。这些任务提升了模型提取、识别和结构化细粒度视觉信息的能力。推理数据包括K12级别习题、STEM问题及空间推理任务,旨在训练模型在视觉与文本双重约束下执行多步推理。

智能体数据由代码推理与工具使用轨迹构成,使模型能够学习任务分解、执行及反馈整合。长上下文数据聚焦于长文档、长视频、多图像输入及长程问答,目标在于提升模型在扩展上下文中的信息保持、检索及跨片段关联能力。

总体而言,这套指令混合数据旨在促进不同数据源之间的能力协同。视频数据增强连续场景理解与时间证据定位能力;感知数据提升细粒度信息提取能力;推理数据强化跨模态多步推理能力;智能体数据支持任务分解与工具交互;长上下文数据则改善长程信息建模能力。同时,保留纯文本指令数据以维持通用指令遵循与语言推理能力,降低多模态训练过程中纯语言性能退化的风险。

4.1.2 合成思维链

大多数多模态指令数据仅提供最终答案,对显式推理与证据聚合的监督有限。因此,我们从高质量问答对中构建合成思维链数据。由强教师模型生成推理轨迹,随后通过查询级、响应级和过程级质量检查进行筛选。针对数学任务,采用Doubt2Clean二次复核流程,进一步清洗27个数据集中存疑的思维链样本。

最终混合数据将用于 STEM、计数、视频推理和复杂图文问答的较长 <think> 推理数据,与用于通用 VQA、图像描述、OCR 和定位的直接答案数据相结合。这平衡了显式推理与简洁回答,并避免了在简单感知任务上不必要的冗长。

对于连续感知任务,例如计数和视频理解,合成思维链提供了逐对象或逐区间的验证链。例如,模型可能首先在单独区域或候选视频区间中验证局部证据,然后在生成最终答案前汇总证据。对于 STEM 任务,推理轨迹强调规划、符号推导和结果验证。这为模型在有序观察和逻辑推理两方面提供了可学习的监督信号。

除了这些离线推理轨迹,我们还通过强到弱在线策略蒸馏进一步优化模型的推理链,其中更强的教师模型在其自身的在线策略 rollout 上监督学生模型。

4.2 强化学习

4.2.1 合成数据强化学习

细粒度多模态推理需要准确的视觉感知、差异定位和结构化输出生成。然而,自然多模态语料库很少能同时提供细粒度的定位信号、结构化标注和可自动验证的监督信号。为解决这一局限,我们引入了一个基于程序化生成的差异识别任务的合成数据强化学习框架。给定两张通过受控编辑产生差异的图像,模型需要识别这些变化,并以预定义的结构化格式进行报告。由于数据生成过程中编辑操作完全已知,奖励可以通过基于规则的验证来计算,而无需依赖额外的学习奖励模型。

每个样本包含一对图像,其中 是通过一组受控编辑从 获得的。我们以两种形式实例化该框架。对于面向定位的感知任务,模型预测变化区域的归一化边界框。对于结构化推理任务,模型输出与底层编辑相对应的领域特定操作集 DSL。在我们的实现中,结构化任务涵盖几何、坐标感知几何、化学公式和物理电路图。该合成设置既包含带有受控编辑的正样本,也包含无编辑的负样本,使模型能够区分真实变化与未变化的输入,并抑制无依据的预测。为防止模型依赖琐碎的像素级差分,我们引入了与差异无关的重新渲染扰动,这些扰动保留了底层编辑集,包括颜色抖动、布局扰动、槽位打乱、语义无操作变化以及视角变化。

对于感知任务,预测框通过基于 IoU 的匈牙利匹配与真实框进行匹配。奖励函数为:

(8)

其中 表示匹配集, 是第 个匹配对的 IoU, 是基于软匹配的 F 分数, 惩罚重复预测。对于负样本,空预测获得奖励,而无依据的预测则受到惩罚。对于结构化领域,奖励通过将预测的操作集和真实操作集规范化,然后执行基于规则的匹配来计算。对于坐标感知任务,我们进一步使用基于软距离的相似度来容忍较小的数值偏差。这种奖励设计轻量、可扩展且独立于学习到的奖励模型,同时鼓励视觉定位、结构正确性、抗幻觉行为以及规范的结构化输出生成。

4.2.2 通用强化学习

在 SFT 和知识蒸馏之后,通用强化学习能够提升多模态及纯文本场景下的推理能力、答案可靠性和鲁棒性。与偏好导向的对齐强化学习不同,通用强化学习专注于具有可验证真实答案的任务,包括通用视觉问答、STEM、图表理解、数学推理、逻辑推理以及纯文本问答。

数据构建。

我们从开源和内部来源收集多模态及纯文本问答数据,包括 FineVision (finevision)、MMK12 和 MM-Eureka (mm_eureka)、Thyme (thyme)、mini O3 (minio3)、Open-R1 (openr1)、自我认知数据以及业务导向数据 (kuaimod)。数据流水线包括基准去污染、使用强模型和评判模型进行交叉验证,以及基于准确性的过滤,以移除初始策略已能解决的样本。

基准去污染会移除在视觉或语义上与公开评估实例过于接近的样本。交叉验证会对多个候选解决方案进行采样,并要求评判模型选出可靠的正面样本,这些样本随后被用作 ContextRL 奖励的参考解决方案。基于准确性的过滤则将强化学习聚焦于既非琐碎也非过于嘈杂的样本,从而提升数据效率。

奖励系统。

该奖励系统基于 Qwen2.5-VL-72B-Instruct (qwen2_5_vl),评估格式有效性、结果正确性、过程正确性以及与已验证参考解决方案的一致性。此外,针对自我认知任务、业务任务和结构化推理,还使用了特定任务的奖励。

格式奖励确保推理和最终答案字段能够被解析。结果奖励检查最终答案是否与异构答案格式(包括选项、短语、数值答案和完整解决方案)中的真实答案匹配。过程奖励会对事实错误、无效推理、无依据的假设以及不一致的中间步骤进行惩罚。ContextRL 奖励 (lu2026contextrl) 将采样响应与已验证的参考解决方案进行比较,以有效减少因错误推理得出正确答案而导致的误报。

训练算法。

我们采用组序列策略优化(GSPO)(zheng2025gspo)。给定查询后,旧策略对响应进行采样。目标函数为:

(9)
(10)
(11)

我们进一步通过增大生成批次大小来过度采样响应,并过滤掉优势方差为零的组,以提高数据效率。这种过滤机制使训练能够聚焦于不同生成结果可获得可区分奖励的组,从而确保每次更新都包含更强的学习信号。

4.2.3 专项强化学习

专项强化学习增强了图像-文本能力,包括定位、空间理解、数学推理、计数和OCR。所有专家模型均从相同的通用强化学习检查点出发,并使用领域特定数据和奖励。确定性任务采用基于规则的验证性奖励:定位任务使用IoU和二分图匹配,数学任务使用符号等价性,计数任务使用精确数值匹配,OCR任务使用归一化文本匹配。开放式的空间推理则使用带有格式约束的模型评判器。

此阶段的目的是训练出强大的领域专家模型,而非独立的最终模型;这些专家模型后续可通过知识蒸馏和能力整合,提供特定能力的监督信号。

定位专家。

对于定位任务,奖励的设计旨在衡量目标级别的定位质量,同时抑制冗余预测。我们首先将所有边界框归一化到坐标范围,并移除重复的预测框。对于多目标定位,预测框通过以IoU为匹配标准的匈牙利算法与真实边界框进行匹配,确保预测框与目标框之间的一一对应关系。

基于匹配对,奖励同时考虑最差情况和平均定位质量。最小IoU用作阈值信号,确保所有目标在样本进入高奖励区域前达到基本的定位质量,而平均IoU则提供用于优化的连续反馈。此外还引入了重复框惩罚项,以减少冗余输出并防止批量生成边界框。因此,该奖励设计在严格的目标覆盖、平滑的定位反馈和输出紧凑性之间取得了平衡。

空间专家。

空间专家专注于空间关系理解和具身空间推理。与定位或计数不同,许多空间任务并不具备简单的确定性标准,因为答案可能涉及相对位置、方向、交互或场景级常识。因此,我们使用一个生成式模型评判器来评估回答是否满足所需的空间关系和场景约束。该评判器会分配一个离散的正确性分数,该分数与格式奖励相结合,以鼓励空间正确性和合法的答案结构。

数学专家。

数学专家专注于数学和STEM推理。对于具有确定性答案的问题,我们采用符号等价奖励:将模型预测和参考答案解析为规范形式,当它们在数学上等价时,给予正向奖励。该奖励受所需的 `<think>` 和 `<answer>` 结构控制,从而鼓励模型生成有效的推理和最终答案格式。对于难以规范化的开放式解答,我们则退而使用生成式模型评判器。这种设计在强调答案正确性的同时,避免了对特定推理路径的过拟合。

计数专家。

计数专家专为视觉计数任务设计,其目标输出通常是一个离散整数。由于正确性标准是明确的,我们在格式控制下使用精确数字匹配奖励。只有当预测数字与真实计数完全匹配时,才给予正向奖励。这提供了一个清晰且确定性的学习信号,鼓励模型将视觉感知与精确的数值输出对齐。

OCR专家。

OCR专家专注于文本识别、文档阅读和基于图像的文本理解。我们使用归一化文本匹配奖励,即在规范化大小写、空白和标点符号后,对预测结果和参考答案进行比较。该奖励保留了确定性验证,同时允许细微的表面形式差异。它鼓励模型在OCR和文档类任务中提高识别准确率和文本完整性。

4.2.4 视频强化学习

视频强化学习进一步优化了时序对齐、事件追踪以及长程信息聚合。我们从通用强化学习检查点出发,在大约 31K 个视频样本上使用 GSPO 进行训练,同时冻结视觉编码器和视觉-语言投影器。

这些数据涵盖视频时序定位、时序密集描述(vcap)、帧级感知、视频问答、时序排序以及事件计数。TVG 样本选自 TimeIT(timeit),主要来自 DiDeMo(didemo)和 Charades-STA(charades_sta),并以时序 IoU 作为奖励。时序密集描述使用大语言模型作为评判者(LLM-as-Judge)对主体识别、动作描述、场景信息、OCR 文本、时序顺序、模型幻觉和覆盖度进行奖励。FrameForge 合成视频为时间戳定位、计数、前后推理和共现推理提供可规则验证的监督信号。该阶段将通用视频基准性能提升了大约 1 个百分点。

这些任务提供了互补的视频监督信号。TVG 直接优化时序边界定位,密集描述鼓励全视频覆盖和忠实的内容组织,而 FrameForge 则提供了从自然视频中难以获得的低噪声帧级信号。

4.2.5 智能体强化学习

共享训练协议。

智能体强化学习将后训练从单次响应评分扩展到多步骤环境交互。它涵盖代码、工具使用和搜索任务,这些任务的监督信号来自可执行结果或可验证的环境状态,而非静态响应标签。在这些领域中,我们使用基于环境的奖励、轨迹级验证和过滤机制,以剔除无效、未完成、信息量低或验证不充分的展开轨迹。完成的轨迹组使用上述 GSPO 目标进行优化,并在轨迹层面采用基于结果的奖励。为了在长且可变交互周期下提高展开轨迹的利用率,我们采用了一种共享的同地部分展开机制:未完成的轨迹会被缓存并在后续展开步骤中恢复,而完成的轨迹组则立即用于 GSPO 更新。这种共享协议保持了优化目标和展开调度的一致性,同时允许每个任务族定义自己的环境接口和奖励证据。

代码强化学习。

对于代码强化学习,我们同时使用在线评测系统和软件工程环境。在线评测系统任务通过编译和隐藏测试执行来评估独立的程序合成,奖励由通过率和执行失败(如超时或超内存错误)决定。软件工程任务在容器化环境中评估仓库级别的问题解决能力,模型必须检查日志、运行测试、编辑文件并提交补丁。奖励基于测试套件结果、回归检查、轨迹过滤以及提交补丁的辅助裁判验证。对于仓库级任务,候选编辑可能进一步通过一个验证与集成协议,其中多个评审智能体检查提议的更改、执行轨迹和测试结果,然后一个独立的集成智能体在最终补丁接受前整合评审意见。这种设置强化了算法正确性、仓库导航、迭代修复和回归安全的代码修改能力。

工具使用强化学习。

在工具使用强化学习中,模型与覆盖超过150个模拟API领域的多轮有状态环境进行交互。奖励基于有效的工具调用、参数一致性、数据库或环境后置条件,以及通过评判器评估最终状态是否满足用户意图来计算。与代码执行奖励不同,此目标强调正确的状态转换、从工具错误中稳健恢复,以及与多轮用户指令的协调配合。随机化的工具和参数名称减少了对记忆API模式的依赖,并鼓励通用的工具调用行为。

搜索强化学习。

对于搜索强化学习,我们在多轮搜索任务上进行训练,模型发出检索动作、读取返回内容,并在一次或多次检索轮次后生成最终答案。这些轨迹会随任务所需的查询优化、结果选择和内容检查程度而变化。奖励是面向结果的:最终答案的正确性是主要信号,当可用时,我们也会对中间搜索结果使用轻量级验证信号,以减少偏离轨道的检索和无依据的答案合成。共享的部分展开机制在此场景中很有用,因为搜索轨迹具有可变的长度;未完成的交互可以在后续展开步骤中恢复,而完成的轨迹组则用于GSPO更新。

4.2.6 跨模态多教师在线策略蒸馏

领域特定的后训练引入了来自纯文本、图像、视频和智能体任务的异构能力。直接混合它们可能会导致干扰,例如在推理强化学习后响应过短,或在智能体训练后出现过多的工具调用格式。为了整合这些能力,Keye-VL-2.0-30B-A3B 使用了跨模态多教师在线策略蒸馏(MOPD)。

MOPD 维护了 13 个经过强化学习训练的领域教师模型。这些教师模型覆盖了完整的能力谱系,包括安全性、纯文本数学、指令遵循、代码、视觉 STEM、OCR、接地、计数、视频以及工具使用等。每个样本会被路由到与其模态和任务类型最匹配的教师模型。给定提示词后,学生模型首先生成一个同策略响应:

(12)

对于状态,被路由的教师模型会提供 token 级别的反馈。我们使用分段提示词-响应重新分词(SPRR)来分别处理提示词和响应,确保教师模型的对数概率与学生模型的响应 token 之间严格对齐。

为了获得稳定的反馈,我们定义了 top- 重叠集合:

(13)

当 非空时,原始优势值为:

(14)
(15)

如果 ,我们设置 。

与在整个词汇表上进行蒸馏相比,重叠估计器将监督集中在教师和学生模型都认为合理的局部分布区域。这避免了在概率极低的 token 上进行不稳定的比较,同时保持了训练的同策略性,因为反馈是在学生模型实际访问的状态上计算的。

学生模型通过一个优势加权策略梯度目标进行优化:

(16)

其中 是有效的响应 token 掩码。我们进一步应用了 token 类别感知的优势缩放,以降低格式 token 的权重,并提升感知或推理 token 的权重。对于长文本生成,重复崩溃会在位置 处被定位,并且仅在崩溃点之后进行惩罚:

(17)

综合来看,动态教师路由、SPRR 对齐、top- 重叠估计、token 类别缩放以及局部化重复惩罚,使得 MOPD 能够整合异构的强化学习教师模型,而无需强制所有领域采用单一的响应风格。

高效的训练与推理基础设施

5.1 预训练系统

5.1.1 ViT–LM 异构并行与负载均衡

为了消除视频解码和帧采样带来的 I/O 瓶颈,我们引入了 ExtraIO,这是一个通过异步管道与训练解耦的水平可扩展 I/O 服务。我们进一步共同设计了 ViT–LM 异构并行和针对长视频及可变长度工作负载的两级负载均衡。

ViT–LM 异构并行。

ViT 和大语言模型部署在同一 GPU 组上,但每个模块采用各自独立的并行分片策略。这避免了将 ViT 绑定到 LM PP0 所导致的不均衡问题。通过重计算或卸载策略,ViT 的激活内存消耗几乎降至零,从而为长序列腾出更多内存空间。

负载均衡。

由于 ViT 处理图像/帧级别的视觉 token,而大语言模型处理样本级别的多模态序列,因此视觉 token 比例和序列长度都会发生波动。我们在多模态 token 级别和大语言模型样本级别进行负载均衡,使 ViT DP 和 LM DP/PP 之间的计算和内存分配趋于均衡。这使端到端训练吞吐量提升了约 20%。

该设计对于视频密集的批次尤为有用,否则少量长样本可能造成严重的流水线气泡,导致大量设备利用率低下。

5.1.2 变长序列的 DSA 优化

我们使用 FlashInfer (flashinfer) 和 TileLang (tilelang) 对 DSA 进行优化,相比基于开源代码改编的基线方案实现了超过 2 倍的加速。

Top- 内存优化。

在打包模式下,原始索引器得分的形状为 ,由于样本之间相互不可见,导致内存浪费。我们将得分存储缩减为 ,并使用 flashinfer.top_k_ragged_transform 仅对有效的 KV 区域进行计算。在极端情况下,采用分块索引器作为受内存限制的备用方案。

短序列优化。

在长序列 SFT 过程中,许多样本是短序列。当位置索引满足 条件时,索引器反向传播和稀疏注意力核仅遍历因果可注意的 KV 条目,而非扫描固定的 top- 范围,从而带来 1.5 倍的端到端加速。

索引器损失。

我们不在各层存储完整的索引器和注意力得分,而是在前向传播中仅保留 top- 后的索引器得分,并在稀疏注意力反向传播核内部恢复注意力得分。这复用了 FlashAttention 风格的反向重计算 (flashattention),避免了额外的计算开销,并提前释放了各层的中间结果。

关键观察在于,稀疏注意力反向传播已经会重新计算 softmax 后的注意力矩阵。通过在反向传播内核中提取并归约所需的分数,索引器损失可以在不实例化逐层中间结果的情况下计算出来。

5.2 训练后系统

5.2.1 面向强化学习的 DSA 适配

在使用 DSA 进行强化学习训练时,我们重点关注一致性和内存。为避免训练与推理时 Top- 结果不匹配,我们采用确定性 Top- 计算。flashinfer.topk 替代了 torch.topk,在保持确定性的同时实现了 2–3 倍的加速。对于变长强化学习批次,分块 DSA 索引器沿序列维度对分数矩阵进行划分,逐块执行 Top- 操作,然后汇总结果,以降低峰值内存。

5.2.2 同策略蒸馏系统

OPD 系统支持异构多专家教师调度、多模态对齐以及 Top- 蒸馏。样本被路由到特定领域的教师模型,例如数学、接地、OCR 和 LAN-Instruct,而共享权重的领域则复用同一服务器实例。为了对齐学生与教师的预处理流程,教师端使用其原生处理器重建序列,并验证视觉 token 数量、位置编码以及多模态文本边界。Top- 蒸馏支持重叠、仅学生和教师对学生三种模式。

严格的多模态对齐至关重要,因为图像 token 数量、视频帧采样、对话模板或 mRoPE 位置上的微小不匹配,都可能导致 KL 信号偏移到错误的响应 token 上。因此,该系统将对齐验证视为训练流程的一部分,而非离线调试步骤。

5.3 GQA+DSA 的高效推理

针对超长视频推理,我们引入了三项优化。

  • •

    分块 ViT:视频帧被分割成多个块,由 ViT 依次处理,然后再合并,从而在不改变模型输出的情况下降低峰值内存。

  • •

    稀疏注意力优化:相邻查询通常会选择相似的 Top-KV 集合。我们对相邻查询的 Top-KV 集合进行去重,并在注意力核内部使用一种 MMA 线程布局感知掩码。在 128K 上下文长度下,16 个相邻查询仅需约 8K 有效 KV token。

  • •

    解码优化:与 128K 上下文下的全注意力相比,DSA 特有的解码优化可将预填充成本降低超过 3 倍,并将解码成本降低超过 5 倍。

在 H800 GPU 上进行的实验,假设每 GPU 小时成本为 2 美元,展示了图 4 所示的推理效率。

Refer to caption
图 4:Keye-VL-2.0-30B-A3B 的推理成本。在相同的 H800 定价假设下,DSA 特有的预填充和解码优化降低了超长视频推理相对于密集注意力的成本。

综合评估

在呈现针对特定基准的分析之前,图 5 提供了 Keye-VL-2.0-30B-A3B 在视频理解、编程、智能体工具使用、数学与科学推理、指令遵循以及通用视觉语言基准上的紧凑概览。我们与具有相似及更大规模的代表性开源和闭源基线模型进行了比较,包括 Qwen3.5、InternVL3.5、GPT-5-mini 和 Qwen3-VL。以下小节将给出这一总体视图背后的基准定义、评估协议和详细结果。

Refer to caption
图 5:Keye-VL-2.0-30B-A3B 的总体评估总结。该图总结了在视频理解、编程、智能体工具使用、数学与科学推理、指令遵循以及通用视觉语言基准上的代表性结果。橙色分数标记了每行中的领先结果,“–”表示分数不可用或无法直接比较。除非相应基准另有规定,否则分数越高越好;详细的基准描述和引用见下文各小节。

6.1 视频理解

我们从三个互补方面评估 Keye-VL-2.0-30B-A3B 的视频理解能力:长视频综合理解、细粒度时间定位以及视频知识获取。

6.1.1 基准

长视频综合理解。

Video-MME-v2(fu2026videomme2)评估全模态信息聚合、长程时间理解与复杂推理能力。该基准同时报告平均准确率与基于组的非线性得分,其中 表示一组四个关联问题中的正确回答数量。LongVideoBench(longvideobench)通过指代性查询评估长上下文视频语言推理。MLVU(mlvu)涵盖从3分钟到2小时的多任务长视频理解。Video-MME(video_mme)评估短、中、长三类视频;我们报告无字幕设置下的结果。

这些基准共同测试模型是否能够从长视频中检索相关片段、维持事件顺序、整合跨片段证据,并在不依赖字幕捷径的情况下回答问题。

时间定位。

我们采用TimeLens框架(zhang2025timelens),该框架对ActivityNet Captions、QVHighlights和Charades-STA进行了重新标注以减少标注噪声。我们报告ActivityNet-TimeLens、QVHighlights-TimeLens和Charades-TimeLens上的mIoU。

经过清理的标注使TimeLens比原始旧版标注成为更可靠的细粒度时间对齐探测工具,因为旧版标注中噪声边界会扭曲模型排名。

视频知识获取。

Video-MMMU(videommmu)评估模型能否从涵盖30个子学科和6大领域的教学视频中学习并应用领域知识。

其问题涵盖感知、理解和适应三个层面,要求模型识别讲座中的信息、理解底层概念,并将其应用于新场景。

6.1.2 结果

媒体内容 · 前往原文查看
表2:Keye-VL-2.0-30B-A3B与代表性基线的视频理解评估。粗体标记每行最佳结果,下划线标记次优结果,“–”表示无可比分数。
类别 基准 Keye-VL-2.0 30B-A3B Qwen3.5 35B-A3B InternVL3.5 241B-A28B GPT-5-mini 2025-08-07 Qwen3-VL 30B-A3B Thinking Qwen3-VL 32B Thinking Qwen3-VL 235B-A22B Thinking
长视频综合 LongVideoBench 74.1 61.6 67.1 – – – 70.5
Video-MME-v2 ACC(64 / 512帧) 35.3 / 42.4 32.6 / 28.5 – – – – 33.3 / 36.8
Video-MME-v2 非线性(64 / 512 帧) 18.5 / 24.2 15.6 / 12.2 – – – – 26.3 / 28.1
MLVU 82.8 85.6 78.2 83.3 78.9 82.3 83.8
Video-MME(无字幕) 78.3 82.5 72.9 78.9 73.3 77.3 79.0
时间定位(TimeLens) ActivityNet-TimeLens 58.5 53.2 – – – – 52.1
QVHighlights-TimeLens 70.1 65.7 – – – – 64.6
Charades-TimeLens 58.4 49.1 – – – – 47.8
视频知识获取 Video-MMMU 80.0 80.4 – 82.5 75.0 79.0 80.0

Keye-VL-2.0 在 LongVideoBench 和 Video-MME-v2 准确率上取得了最佳结果,并在 MLVU 和 Video-MME 等成熟基准上保持竞争力。在 Video-MME-v2 上,其在 64 帧和 512 帧两种设置下均表现出强劲的准确率,表明该模型能够从更密集的视觉上下文中受益,同时不丧失长程聚合能力。该模型还在所有三个 TimeLens 子集上取得了最佳 mIoU,验证了场景级密集描述、多样化 TVG 数据以及以 tIoU 为中心的 Video RL 的有效性。此外,对于 TimeLens 基准,Qwen3-VL-235B-A22B Thinking 的分数直接取自论文,其评估采用 2 FPS 帧采样。对于 Qwen3.5-35B-A3B,目前尚无官方 TimeLens 分数。考虑到此前 Qwen 系列在 TVG 基准上的评估采用 4 FPS 设置,我们以 4 FPS 的密集帧采样对主要对比模型(包括 Qwen3.5 35B-A3B、Gemini 和 Keye-VL-2.0)进行评估,以实现公平比较。在 Video-MMMU 上,它达到了 80.0,与强大的开源基线模型持平,并接近闭源的 GPT-5-mini。

6.2 智能体能力评估

6.2.1 代码智能体评估

我们在 LiveCodeBench v6、OJBench 和 SWE-bench Verified 上评估了编码和软件工程能力。LiveCodeBench v6 提供抗污染的程序设计评估,OJBench 测试在线评测风格的算法正确性,SWE-bench Verified 评估仓库级别的问题解决能力。

媒体内容 · 前往原文查看
表 3:Keye-VL-2.0-30B-A3B 与代表性基线模型的代码智能体评估。每行最佳结果以粗体标记,次优结果以下划线标记,“–”表示无可比的可用分数。
基准 Keye-VL-2.0 30B-A3B Qwen3.5 35B-A3B InternVL3.5 241B-A28B GPT-5-mini 2025-08-07 Qwen3-VL 30B-A3B 思考型 Qwen3-VL 32B 思考型 Qwen3-VL 235B-A22B 思考型
LiveCodeBench v6 64.2 62.8 – 51.5 – – –
OJBench 71.5 70.2 – 58.7 – – –
SWE-bench Verified 62.0 63.5 – 55.5 – – –

Keye-VL-2.0-30B-A3B 在 LiveCodeBench v6 和 OJBench 上取得了优异成绩,展现了强大的算法推理能力和基于执行的自我修正能力。该模型在 SWE-bench Verified 上也获得了具有竞争力的分数,表明模型能够将其部分编码能力从孤立的算法问题迁移到仓库级别的软件工程任务中。

6.2.2 工具使用评估

我们在 BFCL-V4 (bfcl)、-Bench (tau2bench) 和 VitaBench (vitabench) 上评估了函数调用和多轮工具使用能力。这些基准测试涵盖了单轮和多轮函数调用、双控状态交互,以及包含异构工具的复杂生活服务场景。

媒体内容 · 前往原文查看
表 4:Keye-VL-2.0-30B-A3B 与代表性基线模型的工具使用和函数调用评估。每行最佳结果以粗体标记,次优结果以下划线标记,“–”表示无可比分数。
基准测试 Keye-VL-2.0 30B-A3B Qwen3.5 35B-A3B InternVL3.5 241B-A28B GPT-5-mini 2025-08-07 Qwen3-VL 30B-A3B 思考型 Qwen3-VL 32B 思考型 Qwen3-VL 235B-A22B 思考型
BFCL-V4 65.7 67.3 – 55.5 – – –
-Bench 82.6 81.2 – 69.8 – – –
VitaBench 33.1 31.9 – 13.9 – – –

Keye-VL-2.0-30B-A3B 在 -Bench 和 VitaBench 上取得了最佳结果,在 BFCL-V4 上排名第二。这些结果表明,该模型在多轮环境中具备强大的工具选择、参数填充、状态跟踪和恢复能力。

6.3 通用视觉语言评估

我们在面向感知和推理的基准测试上评估了通用视觉语言能力。

面向感知的基准测试涵盖 OCR 和文档理解、定位、计数、空间理解以及抗幻觉能力。OCRBench (ocrbench) 和 OmniDocBench (omnidocbench) 侧重于以文本为中心的视觉理解和文档智能。RefCOCO (refcoco) 评估指代表达定位,FSC-147 (fsc_147) 和 PixMoCount (pixmo) 衡量计数能力,EmbSpatial-Bench (embspatialbench) 评估以自我为中心的空间关系,HallusionBench (hallusionbench) 则诊断感知可靠性。

推理导向的基准测试涵盖了视觉数学、动态推理鲁棒性、专家级多模态理解以及视觉不可或缺的推理。WeMath、MathVista 和 DynaMath 评估了视觉数学推理的互补方面,而 MMMU 和 MMStar 则在减少纯文本捷径机会的条件下测试专家级多模态推理。总体而言,Keye-VL-2.0-30B-A3B 在保持强大通用多模态性能的同时,在长视频理解、时间定位、抗幻觉能力和视觉数学推理方面表现尤为突出。

结论与未来工作

我们推出了 Kwai Keye-VL-2.0-30B-A3B,这是一个开源、30B 级别的 MoE 多模态基础模型,仅有 3B 活跃参数。通过将 DeepSeek 稀疏注意力引入基于 GQA 的多模态骨干网络,Keye-VL-2.0 将有效上下文建模扩展至 256K 个模型 token,并在可控的训练和推理成本下实现了小时级视频理解的实用性。结合原生分辨率视觉编码、统一的图像-视频处理、ViT-LM 异构并行、DSA 内核以及 Chunk ViT 推理,该系统不仅旨在提升基准测试准确率,还支持可部署的长视频应用。

后训练流程进一步解决了感知、推理、长上下文理解与智能体行为协同优化时出现的能力冲突问题。跨模态多教师同策略蒸馏、上下文强化学习、视频强化学习以及专业领域强化学习,使得异构教师模型和奖励信号能够整合到单个MoE模型中,同时不牺牲核心推理能力。评估结果显示,Keye-VL-2.0在长视频理解与细粒度时间定位方面达到了同规模领先水平,同时在代码、工具使用、OCR、文档理解、视觉数学及抗幻觉基准测试中保持竞争力。总体而言,这些结果表明,稀疏长上下文建模与精心分阶段的多模态强化学习可以结合到单个可部署的MoE系统中,而无需牺牲通用推理能力。

未来工作将超越以排行榜为导向的优化,转向在真实业务场景中更深入的部署。首先,我们将进一步把细粒度的长视频感知和图文理解整合到核心产品管线中,包括生成式推荐、内容生态治理和商业定向。在这些场景下,Keye-VL 有望为推荐匹配、内容质量评估和细粒度广告标签提供更密集的语义信号,从而将多模态理解转化为可衡量的产品和商业价值。其次,我们将开发结合精准多模态理解与自动化编排的视频智能体工作流。该模型将从被动理解视频内容,演变为主动协调生产环节,包括大规模视频检索、高光片段提取、自动剪辑包装,以及面向创作者和商业场景的营销文案生成。第三,以 Keye-VL-2.0-30B-A3B 作为经过验证的基础,我们将继续强化底层基础设施,从基于 DSA 的计算优化、可扩展的数据飞轮、以及基于上下文强化学习的后训练,迈向原生多模态建模和更深入的端到端融合。在这一方向上,基准测试的提升只是诊断手段而非最终目标;长期目标是将长上下文多模态智能转化为可靠、可扩展的基础设施,服务于真实世界的应用。

参考文献

附录 A 案例研究

以下定性示例展示了 Keye-VL-2.0 在代表性文本、图像、视频和智能体服务任务上的最终面向用户响应。由于 Keye-VL-2.0 默认采用思考导向策略,我们省略了内部推理轨迹,并且在案例研究中不单独显示思考或答案标签。

案例一:逻辑约束求解

媒体内容 · 前往原文查看
图 6:逻辑约束求解的文本案例。Keye-VL-2.0 通过识别单个被破坏的证据节点、构建有效的槽位分配方案,并对照最终序列验证每一条陈述,从而解决了一个多约束符号谜题。

案例二:室内布局中的空间推理

输入图像

媒体内容 · 前往原文查看
图 7:空间布局理解的图像案例。给定一张带标注的俯视室内场景图,Keye-VL-2.0 能够识别物体朝向、以自我为中心的左右关系、家具位置,以及移动某个物体所需的方向。

案例三:解剖学推理与错误检测

输入图像

媒体内容 · 前往原文查看
图 8:解剖图理解的图像案例。给定一张带标注的心脏示意图,包含血流箭头和解释性文字,Keye-VL-2.0 能够识别心脏腔室,解读富氧与贫氧血液循环,定位二尖瓣,重建肺循环到体循环的通路,并检测出错误的文字描述。

案例四:逐场景历史视频理解

输入视频

媒体内容 · 前往原文查看
图 9:长视频场景级理解的视频案例。Keye-VL-2.0 通过将视频分割成连贯的场景,追踪从乡村风景和旅行镜头到传统医学、甲骨文发现、安阳考古发掘、专家讨论以及汉字演变的过渡,来总结一段历史纪录片的片段。

案例五:日常 Vlog 与马术课程理解

输入视频

媒体内容 · 前往原文查看
图 10:场景级日常 Vlog 理解的视频案例。Keye-VL-2.0 跟随一段长篇个人 Vlog,内容涵盖上学准备、打包零食、马术课、校园课程、家庭惊喜以及晚间健康习惯,同时保留了时间边界和细致的生活细节。

案例六:多领域服务智能体

媒体内容 · 前往原文查看
图 11:多领域服务编排的智能体案例。Keye-VL-2.0 在酒店、外卖和店内服务等多个领域之间,协调个性化推荐、搜索、地理定位、配送时间估算、预订、支付、推荐和订单创建等操作。

附录 B 贡献者名单(按字母顺序排列)

边斌,刘昌毅,宋成儒,饶崇林,张国王,李涵,范浩楠,鞠恒瑞,陈建康,陈嘉鹏,袁嘉伟,杨凯旋,江凯宇,盖坤,周灵芝,聂娜,孙娜,张天科,高婷婷,郑轩宇,陈宇龙

主要作者:范阳、高海轩、杨乐乐、刘明桥、刁慕溪、张琦、苏启乐、陈伟、洪文韬、陆星宇、龙彦成、杨彦凯、李颖欣、范一洋、夏宇、陈宇哲、赖子良

活跃作者:易川、贾浩楠、梁天明、徐伟鑫、马晓霞、田阳、韩宇飞

支持贡献者

韩峰、李航、王静、贾景辉、陈俊敏、石俊宇、张瑞林

[Uncaptioned image]

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org