跳到正文
北京时间
原文
Apple Machine Learning Research(RSS)·· 2026-07-02精选AI 评分56

VideoFlexTok:可变长度粗到细视频分词

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

AI 导读

VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。

推荐理由

把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

正文 · AI 翻译

作者:Andrei Atanov+**、Jesse Allardice、Roman Bachmann+、Oğuzhan Fatih Kar+、Devon Hjelm、David Griffiths、Peter Fu、Afshin Dehghan、Amir Zamir+

视觉 tokenizer 将高维原始像素映射为压缩表示,以供下游建模使用。除了压缩之外,tokenizer 还决定了哪些信息被保留以及如何组织。视频 tokenization 的事实标准做法是将视频表示为 token 的时空 3D 网格,每个 token 捕获原始信号中对应的局部信息。这要求消费这些 token 的下游模型(例如文本到视频模型)学会“逐像素”预测所有低级细节,而不论视频本身的固有复杂度如何,从而导致较高的学习复杂度。我们提出 VideoFlexTok,它用可变长度的 token 序列来表示视频,并以从粗到细的方式组织——其中最初的 token(自发地)捕获抽象信息,例如语义和运动,后续 token 则补充细粒度细节。生成式流解码器能够从任意 token 数量实现逼真的视频重建。这种表示结构允许根据下游需求调整 token 数量,并在相同预算下编码比基线更长的视频。我们在类别条件和文本到视频生成任务上评估 VideoFlexTok,并表明与 3D 网格 token 相比,它能带来更高效的训练,例如以 5 倍更小的模型(1.1B 对 5.2B)达到可比的生成质量(gFVD 和 ViCLIP Score)。最后,我们展示了 VideoFlexTok 如何通过仅在 672 个 token 上训练一个 10 秒 81 帧视频的文本到视频模型,实现长视频生成而不产生过高的计算成本,这比可比的 3D 网格 tokenizer 少 8 倍。

  • + 洛桑联邦理工学院(EPFL)
  • ** 在 Apple 任职期间完成的工作

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com