跳到正文
北京时间

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

139条精选相关主题图像生成多模态语音与音频

最新精选

第 1–20 条 · 共 139 条
9月24日周四
  1. 公众号:火山引擎67

    Seedance 2.5 API 上线 Draft 模式,480P 试错后 1080P 一次成片

    火山引擎为 Seedance 2.5 API 推出 Draft(样片)模式,先用 480P 快速生成样片验证创意,选中后再通过样片 ID 生成 1080P 成片,复用提示词、参考素材、seed、ratio、duration 等参数保证一致性。

    推荐理由:官方给出了具体的成本节约数字和两阶段工作流说明,创作者可以据此判断是否把 Draft 模式接入自己的视频生成管线。

  2. 公众号:火山引擎68

    火山引擎对话《后西游记》主创,揭秘首部AI长剧登陆湖南卫视黄金档

    国内首部AI长剧《后西游记》8月31日登陆湖南卫视黄金档,60集规划、每集约40分钟,全剧无摄影机拍摄,视频生成100%由 Seedance 实现,上线一周芒果TV正片播放量突破1.5亿次。剧集由芒果TV出品、伯璟文化承制,依托芒果灵创平台,5月立项到播出仅半年、制作周期3个月;总导演李东珅以一场动作戏为例,小组制作耗时10天、成本约十几万元,真人实拍则可能需300至400万元。

    推荐理由:官方复盘给出了AI长剧从立项到播出的创作流程和成本对比,读者可以了解AIGC长篇叙事的实际生产方式。

9月18日周五
  1. Qwen:Blog Retrieval(API)78

    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

    推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

9月15日周二
  1. 公众号:生数科技(Vidu·视频)67

    生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频

    生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。

    推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。

9月9日周三
  1. OpenRouter:Announcements(RSS)71

    OpenRouter 评测 Seedance 2.5:长镜头与已有素材编辑的场景及成本解析

    OpenRouter 发布对 ByteDance Seedance 2.5 视频模型的评测,该模型自 2026 年 8 月 7 日上线其视频 API,生成 4 到 30 秒、480p 或 720p 的片段,支持图像、视频、音频引用和首尾帧控制,音频同趟生成不加价。

    推荐理由:原文基于自家端点数据给出 Seedance 2.5 的计费公式、能力边界和与 Seedance 2.0、Wan 3.0、Veo 3.1 的逐项对比,便于按需求选型。

  2. Runway:News(网页)63

    Runway 推出 Adobe 插件,Premiere Pro 和 After Effects 内可直接生成和编辑

    Runway 发布 Runway Plugins,面板可直接嵌入 Premiere Pro 和 After Effects,无需导出导入即可在时间线内生成图像和视频、重渲染片段并一键放置结果。

    推荐理由:原文给出了插件的功能范围、付费条件与下载方式,剪辑工作流用户可据此评估是否把生成环节搬进时间线。

9月2日周三
  1. Google DeepMind:Blog(RSS)72

    Google DeepMind 为 Gemini 推出 agentic 视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

    推荐理由:官方说明列出 token、成本与准确率三项数字和开启方式,开发者可据此评估长视频分析是否换用该模式。

8月31日周一
8月28日周五
  1. LMSYS:Blog(Chatbot Arena 团队)65

    MiniMax-H3 在 8×H200 上基准测试:无损加速 1.95×,最高 6.24×(SSIM 0.76–0.91)

    SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行基准测试,其密集无损路径较 Diffusers 快 1.85–1.95×,无近似损失。

    推荐理由:把视频生成加速的取舍量化成可复现配置,质量优先时 Cache-DiT 单独使用比叠加稀疏注意力更划算。

  2. Google DeepMind:Blog(RSS)70

    Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制

    Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。

    推荐理由:360p 预览的成本降到 720p 的三分之一并提速最多 60%,让视频生成的前期探索可以低成本多版本比较,改变的是创意工具迭代的节奏。

8月26日周三
  1. OpenRouter:Announcements(RSS)66

    OpenRouter 视频生成 API:一份代码优先的接入指南

    OpenRouter 推出统一的异步视频生成 API,通过 POST /api/v1/videos 提交任务、轮询状态并下载 MP4,支持 Seedance、Veo、Wan 等模型,切换模型只需更改 model 标识符。

    推荐理由:将视频生成抽象为提交、轮询、下载的异步作业,模型切换只改标识符,同时覆盖幂等、webhook 与并发控制,可迁移到其他异步生成 API 的集成。

8月20日周四
  1. 公众号:MiniMax(稀宇科技)61

    MiniMax Design 发布:从操作像素到操作语义和表达意图

    MiniMax 推出 MiniMax Design,一款将多模态模型能力转化为生产力的 Harness,可理解目标、拆解任务并调用模型与 Skills,完成从素材处理到最终交付的完整流程。该产品围绕原生多模态视频模型 H3 构建,擅长处理目标明确的商业内容任务,并提供 Agent 3D 导演台、自动剪辑与字幕功能,支持接入 ComfyUI 等开源生态工作流。

    推荐理由:意图先行与三维导演台将视频试错从生成后移到分镜前,这会改变需要批量产出多平台广告素材的团队在工具切换和返工上的成本。

  2. Hao AI Lab71

    一段 5 秒 480P 视频,完全在 Mac 上生成,耗时 30 秒。无需 CUDA,无需云端,仅占用 3.9 GiB 内存。 FastMetal 将 FastWan-QAD 系列带到 Apple Silicon。DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8。 三个模型:1.3B 支持 480P,5B 支持 720P,14B 追求画质。 📷 博客:http://haoailab.com/blogs/fastmetal 📷 代码:http://github.com/hao-ai-lab/FastVideo 📷 模型:http://huggingface.co/collections/FastVideo/fastmetal

    推荐理由:在Apple Silicon本地生成视频,把云端视频生成的计算依赖降到了消费级硬件,为需要数据隐私或低成本原型创作的工作流提供了替代路径。

8月15日周六
  1. HuggingFace Daily Papers(社区热门论文)72

    MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族

    MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。

    推荐理由:把视觉 token 放在解码序列之外,并用门控交叉注意力让模型边生成边接收画面,给低延迟多模态交互提供了一个具体架构参考。

8月12日周三
  1. IT之家(RSS)71

    LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI

    LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。

    推荐理由:生成速度比同类快数倍,且开放权重允许微调,对需要高频出片或自定义视觉风格的应用,其自托管成本可能低于调用闭源API。

8月11日周二
  1. MarkTechPost(RSS)72

    用 ComfyUI API 实现 MiniMax-H3 多模态视频与音频生成流水线

    本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。

    推荐理由:用 Python 编程替代 ComfyUI 图形界面,在 Colab 上搭建 MiniMax-H3 视频生成管道,并自动适配不同 GPU 显存方案,教程提供的全流程代码可直接复用。

8月9日周日
  1. 公众号:卡尔的AI沃茨72

    Seedance 2.5 上线一周新增六种创意玩法

    Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别“AI 油腻感”,动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。

    推荐理由:把时间静止、口香糖广告等创意拆成可复用的镜头语言和提示词,直接降低同类效果的试错成本。

8月7日周五
  1. Runway75

    Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。 点击下方链接立即开始。

    推荐理由:支持最多50个角色引用和30秒带对话的片段,从单镜头生成迈向构建完整场景,更适合需要连贯叙事的视频创意。