跳到正文
北京时间
原文
Black Forest Labs:Blog·· 2026-08-05精选AI 评分73

Black Forest Labs 发布 FLUX 3 Video:支持最长 20 秒 HD 视频与原生音频

FLUX 3 Video, Part 1: Generation

AI 导读

Black Forest Labs 宣布 FLUX 3 Video 的生成能力正式开放,可通过 BFL API 和部分合作伙伴使用。

推荐理由

官方公布了 FLUX 3 Video 的具体能力清单和与 Seedance 2.0 等模型的对比结果,读者可据此评估它在当前视频生成工具中的位置。

正文 · AI 翻译

从今天起,FLUX 3 Video 的初始版本可通过 BFL API 和部分合作伙伴普遍使用,支持从文本和图像生成视频。该模型可生成最长 20 秒的高清分辨率片段,并通过超分输出全高清画质,同时原生生成与视频同步的音频。

FLUX 3 是我们用于生成和预测视频、音频、图像及动作的前沿多模态模型。通过此次发布,其视频生成能力首次面向大众开放。有关 FLUX 3 的更多详情见此处。

视频模型必须是现实模型。

现实本质上是多模态的;但每一种快照式表征(例如图像、视频、声音)都只捕捉到它的一个片段。没有任何单一碎片本身是完整的。这就是为什么 FLUX 3——一个旨在尽可能准确地建模现实的模型——是原生多模态的,并且其设计目标是建模现实,而不坍缩为某种单一的子集或风格。其结果是,视频输出不局限于电影美学,还可以呈现粗粝、自然、俏皮、怀旧或怪异的风格。

这使 FLUX 3 成为内容创作中高度灵活且可控的模型。FLUX 3 能够处理简单和复杂的提示词,并对世界有深入理解。它可以在单次生成中切换场景和镜头角度,将文字排版作为场景的自然组成部分来渲染,并生成多种语言的对话,具备自然口音和唇形同步。同一个模型可以产出个人化且自然的内容、高度风格化且电影化的内容,或者仅仅是娱乐有趣的内容。

FLUX 3 Video——生成能力

我们今天将 FLUX 3 Video 面向大众开放。在其初始形态下,FLUX 3 Video 可以创建最长 20 秒、带原生音频的视频片段。我们以高清(720p)和全高清(1080p)分辨率发布该模型,并且今天提供以下能力:

  • 文本到视频:用简单语言或详细提示词描述一个场景。FLUX 3 在生成自然运动、场景逻辑和音频的同时,遵循复杂指令。
  • 图像到视频与关键帧:从一张图像开始,指定结束帧,或在片段中设置多个关键帧。FLUX 3 Video 按顺序连接这些内容,同时遵循预期的视觉语言。
  • 视频续写:向 FLUX 3 Video 提供最长四秒的现有视频和音频,并告诉它接下来应该发生什么。模型会同时考虑这两个组成部分,在视频接缝处延续运动、镜头行为、对话和音频。
  • 创建多个镜头:在单个视频中创建多个场景和镜头角度,同时保持序列连贯。
  • 音频与对话:在生成各个帧的同时生成对话、音效和环境音。
  • 多语言:FLUX 3 Video 旨在成为面向许多不同族裔和语言的强大工具。支持的语言包括英语(多种方言)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语等,并具备精确的唇形同步。
  • 世界知识与接地:FLUX 3 Video 将预训练中获得的世界知识与实时接地相结合,使其成为纪录片和短视频教育内容的强大工具,只需在简短提示中输入寥寥数词即可实现。

草稿模式:轻松探索创意方向。草稿生成以极低的成本快速预览你的提示,让你可以反复迭代想法,而不必每次都等待完整的高质量生成。当草稿令人满意时,FLUX 3 会以完整质量渲染视频。它包含相同的主题、相同的构图和相同的运动,因此最终输出与你认可的版本一致。

FLUX 3 Video 提供 SOTA 视频体验

FLUX 3 Video 在文本生成视频和图像生成视频方面均提供 SOTA 能力。我们针对现有最先进的模型对我们发布的模型进行了广泛评估。自首次发布以来,FLUX 3 的视频能力已进一步提升。人工评分者认为它是文本生成视频和图像生成视频中更受青睐的模型。

ELO rating chart: FLUX 3 T2V leads the all-vs-all at 1135

在我们的内部评估中,FLUX 3 在文本生成视频方面以明显优势超越现有 SOTA 模型。在图像生成视频方面,它与 Seedance 2.0 持平,并超越所有其他现有 SOTA 模型。

负责任的开发与部署保障

我们致力于负责任地开发和部署 AI 模型,并在发布前、发布中和发布后应用多层缓解措施,以防范滥用风险。我们与值得信赖的第三方合作伙伴Cinder合作,在发布前对 FLUX 3 Video 进行了一系列风险评估,以验证我们在所有支持模态下的缓解措施,包括未经同意的私密影像(NCII)和儿童性虐待材料(CSAM)。

下一步计划

我们接下来的发布将扩展 FLUX 3 Video,以增强可控性,并推出面向新模态的能力。我们将支持通过图像、视频和音频参考的组合来生成视频。我们的路线图还包括用于图像生成和编辑的 FLUX 3 Image,以及作为开放权重变体的 FLUX 3 Dev。

用 FLUX 3 创造。

FLUX 3 Video 现已通过 BFL API 和部分合作伙伴提供。我们期待看到你的作品。

了解有关 FLUX 3 的更多信息 → https://bfl.ai/models/flux-3
文档在此 → https://docs.bfl.ai/flux_3

来源:Black Forest Labs:Blog · bfl.ai