推荐理由:AI视频生成速度突破实时阈值,单GPU秒级出片可直接上手体验
AI 视频
全部主题AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
最新精选
第 121–139 条 · 共 139 条
Hao AI Lab@haoailab精选
Hao AI Lab@haoailab精选AI 评分6565推荐理由:视频生成从「等一分钟看结果」变成「边看边改」,这个交互范式转变比模型本身更值得关注。做内容创作工具的产品人,这个 demo 值得花五分钟体验一下实时迭代的手感。
Runway:News(网页)精选 Runway 推出 Characters:单图实时生成可对话虚拟角色 API
Runway 推出 Characters API,基于 GWM-1 世界模型,支持用单张图片零微调生成实时可对话虚拟角色。支持自定义外观风格、声音、性格及知识库,具备自然表情、眼神、口型同步和手势。面向客户支持、培训教育和品牌营销等企业场景,已获 BBC 等采用。开发者可通过 API 集成,消费者也可在网页端体验预设角色。
推荐理由:Runway推出实时视频Agent,单图生成可对话数字人,拓展AI交互形态
Saining Xie@sainingxie精选
引用Oscar Michel@ojmichel4📢当前的世界模型并没有真正在建模世界;它们建模的是某一个智能体对世界的视角。部分观测 ≠ 世界状态。 未来的世界模型将独立于任何单个智能体的视角。你将能够在任意时间点“放入”任意数量的智能体,而一个持久的世界状态将随着它们的交互而演化。想象一个神经 MMORPG 服务器。🧵[1/10]
推荐理由:从单视角到共享全局状态,开源多智能体世界模型或改变AI训练范式
字节 Seed:Research Feed(网页内嵌数据)精选 Seedance 2.0 正式发布
Seedance 2.0 视频生成模型正式发布,综合性能达业界 SOTA 水平。新版本支持多模态输入,可同时参考 9 张图片、3 段视频、3 段音频及文本指令,精准迁移构图、动作、运镜与音效。模型支持 15 秒高质量多镜头生成,集成双声道立体声技术,并新增视频延长与编辑功能,可定向修改片段、角色及剧情。目前已在即梦 AI、豆包及火山方舟平台上线,适用于影视、广告、电商等工业级内容创作场景。
推荐理由:字节Seedance 2.0发布,支持多模态输入与物理稳定生成,已上线豆包即梦
FireRedTeam:原创语音与多模态项目精选AI 评分6363 FireRedTeam 开源 FireRed-OpenStoryline 对话式视频创作工具
FireRedTeam 于 2026-02-10 正式开源 FireRed-OpenStoryline,将视频创作变为自然语言对话,支持素材搜索下载、脚本生成、BGM 与配音字体推荐,以及全流程剪辑。
推荐理由:官方开源的对话式视频剪辑项目,覆盖素材检索、脚本生成到剪辑全流程,并可直接通过 Claude Code 等 Agent Skills 安装使用。
OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)精选AI 评分6262 MOVA 发布:32B MoE 端到端同步视频-音频生成模型全栈开源
OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。
推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。
xAI:News(网页)精选 xAI发布Grok Imagine API
xAI推出Grok Imagine API,提供文本/图像转视频及高精度编辑功能,支持物体增删、风格转换与原生音频生成。在Artificial Analysis和LMArena基准测试中排名首位,720p视频生成延迟与成本均低于Veo 3和Sora 2;在IVEBench评测中整体表现超越Kling o1与Runway Aleph。API已开放xAI及第三方平台接入。
推荐理由:xAI发布Grok Imagine视频生成API,性能宣称超越Sora与Veo,支持端到端视频创作工作流
Hugging Face:Blog(RSS)精选AI 评分7373 Overworld发布实时交互式视频扩散模型Waypoint-1
Overworld推出实时交互式视频扩散模型Waypoint-1,用户可通过文本、鼠标和键盘实时控制生成可步入的虚拟世界。该模型基于帧因果校正流变换器架构,在1万小时游戏视频及对应控制数据上训练,从一开始就专注于交互体验,支持零延迟的自由操控。其配套的高性能推理库WorldEngine在消费级硬件上可实现流畅运行,例如Waypoint-1-Small在RTX 5090上能以30 FPS(4步去噪)或60 FPS(2步去噪)生成画面。模型采用扩散强制预训练和自我强制后训练来确保生成长序列的稳定性。
推荐理由:零延迟交互式视频生成,游戏和创意应用开发者的福音。
MiniMax:Blog(网页)精选 MiniMax 发布 Hailuo 2.3 / 2.3 Fast 视频模型
MiniMax 推出 Hailuo 2.3 视频生成模型,在物理动作流畅度、艺术风格化(支持动漫、水墨、游戏 CG)及角色微表情方面显著提升,维持 Hailuo 02 原价,Fast 版本批量创作成本降低 50%。Hailuo Video Agent 同步升级为 Media Agent,支持多模态一键视频生成与分步自定义创作,已全平台上线并开放免费试用。
推荐理由:MiniMax 发布 Hailuo 2.3 视频模型及 Media Agent,支持多模态一键生成
Together AI 研究与产品博客(RSS)精选AI 评分6666 Together AI 上线 40 多个图像与视频生成模型,新增视频生成 API
Together AI 宣布扩展模型库,通过 Runware 合作集成 20 多个视频模型(含 OpenAI Sora 2、Google Veo 3、Minimax Hailuo、Kling v2.1)和 15 个以上图像模型(含 Google Imagen 4.0 Ultra、Nano Banana、Qwen Image),共 40 多个。
推荐理由:Together AI 官方给出了 40 多个图像与视频模型的名称、时长和逐模型定价,开发者可据此评估能否用一个平台替代多家供应商。
蚂蚁 inclusionAI:GitHub 新仓库精选AI 评分6666 Ming-VideoMAR:基于连续令牌的自回归视频生成模型
Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS 2025接收。
推荐理由:蚂蚁把自回归视频生成的训练成本砍到 Cosmos 的 0.2% 还能赢,这个效率信号比分数本身更值得关注,做视频生成的团队该认真看看它的课程学习和渐进分辨率策略。
Sam Altman:Blog(RSS)精选 Sora 2
OpenAI发布Sora应用,集成Sora 2模型,支持快速创作、分享和观看视频,团队称其为"创意领域的ChatGPT时刻"。核心功能包括cameo客串特性,可保持角色一致性并将用户及朋友置入视频。团队同时表达对成瘾性和低质内容("slop feed")风险的担忧,提出四项产品原则:优化长期用户满意度、赋予用户信息流控制权、优先鼓励创作、帮助实现长期目标,并配备深度伪造防护和情绪健康监测等安全措施。
推荐理由:OpenAI 正式发布 Sora 2 应用,定位「创意领域的 ChatGPT时刻」
Google DeepMind@GoogleDeepMind精选Veo 3 与 Veo 3 Fast 现已在 Gemini API 开放规模化生产使用,新增支持 16:9 1080p 高清视频及 9:16 竖屏视频格式。


推荐理由:Google Veo 3 视频生成 API 正式开放,支持 1080p 高清和竖屏格式。
Jim Fan@DrJimFan精选引用Jim Fan@DrJimFan如果机器人能在视频生成模型内部做梦会怎样?我们推出 DreamGen,这是一种全新引擎,它不依赖成群的人类操作员,而是借助以像素为单位的数字梦境来规模化机器人学习。DreamGen 生成海量的神经轨迹——即与电机动作标签配对的逼真机器人视频——并解锁了对新名词、新动词和新环境强大的泛化能力。无论你是人形机器人(GR1)、工业机械臂(Franka),还是一个可爱的小机器人(HuggingFace SO-100),DreamGen 都能让你做梦。 像 Sora 和 Veo 这样的视频生成模型本质上是神经物理引擎。通过压缩数十亿条互联网视频,它们学习到了一个包含无数可能的未来的多重宇宙——即从任意初始图像帧出发,世界可能如何展开的叠加态。DreamGen 通过一个简单的四步方案利用了这种能力: 1. 在目标机器人上微调一个 SOTA 视频模型; 2. 用多样化的语言提示词提示模型,模拟平行世界:你的机器人在新场景中会如何行动。过滤掉那些不遵循指令的坏梦(哈!); 3. 利用逆动力学或潜在动作模型恢复伪动作; 4. 在經過大规模增强的神经轨迹数据集上训练机器人基础模型。 就这么简单。只是更多的数据,以及纯粹的旧式监督学习。很简单,对吧? 令人惊叹的是它的效果能走多远。仅从一个单任务的“拾取-放置”数据集出发,我们的人形机器人学会了 22 种新行为,例如倒水、折叠、舀取、熨烫和锤击,尽管它从未见过这些动词。更棒的是,我们可以把机器人从实验室带出来,放到 NVIDIA 总部咖啡馆里,让 DreamGen 施展它的魔法。我们展示了真正的从零到一的泛化:新动词的成功率从 0% 提升到超过 43%,在未见过的环境中从 0% 提升到 28%。 与传统的图形引擎相比,DreamGen 并不在乎场景是否涉及可变形物体、流体、半透明材质、高接触交互或疯狂的光照。手工构建这些场景可不容易。对于 DreamGen,每个世界都只是通过扩散神经网络的一次前向传播。无论梦境多复杂,展开它所需的计算时间都是恒定的。 立即阅读我们的博客和论文!我们计划在未来几周内完全开源整个管道。链接在帖子中。
推荐理由:NVIDIA提出用视频生成模型为机器人“造梦”合成训练数据,实现零样本技能泛化
Hao AI Lab@haoailab精选AI 评分6767
引用Hao AI Lab@haoailab(1/n) 🚀 借助 FastVideo,你现在可以在单块 H200 GPU 上于 5 秒内生成一段 5 秒的视频! 隆重推出 FastWan 系列,这是一个快速视频生成模型家族,通过我们称为“稀疏蒸馏”的全新配方训练而成,可将视频去噪时间加速 70 倍! 🖥️ 在线演示:https://fastwan.fastvideo.org/(感谢 @gmicloud 的支持!) 🔗 博客:https://hao-ai-lab.github.io/blogs/fastvideo_post_training/ 🔓 我们以 Apache-2.0 许可证完全开源我们的模型、代码和数据
推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。
Jim Fan@DrJimFan精选
推荐理由:NVIDIA 提出 DreamGen:让机器人在视频生成模型中「做梦」合成训练数据,实现强零样本泛化,将开源
Google DeepMind:Blog(RSS)精选 以全新生成式媒体模型与工具激发创意
发布新一代生成式媒体模型 Veo 3 与 Imagen 4,以及专为电影制作打造的工具 Flow,支持更高质量的视频与图像生成及专业影视创作流程。
推荐理由:Google发布Veo 3与Imagen 4生成模型及电影制作工具Flow
Runway:News(网页)精选 Runway 与 Lionsgate 达成合作
Runway 与 Lionsgate 达成首创性合作,基于后者超过 20,000 部作品的专有片库定制训练 AI 视频生成模型,供电影制作人在前期和后期流程中增强创作。该模型可生成电影级视频并支持迭代编辑,双方未来计划向个人创作者开放模型授权。
推荐理由:Runway与好莱坞大厂达成首个定制模型合作,标志AI视频正式进入主流影视工业化流程