跳到正文
北京时间

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

139条精选相关主题图像生成多模态语音与音频

最新精选

第 41–60 条 · 共 139 条
7月16日周四
  1. 公众号:昆仑万维(天工)68

    天工短剧工作台发布“Agent智能分镜+无限画布”双轨创作模式

    天工短剧工作台推出双轨创作模式,通过导演Agent自动解析剧本、规划站位与机位,并支持多视细节图生成,解决AI短剧角色变脸和站位漂移问题。该工具内置影视级提示词模板、720°全景图及3D导演台,实现可控生产。已有三部作品上线DramaWave 7天实现百万美元级营收。

    推荐理由:天工短剧工作台把导演思维实打实地做进了产品,站位置图和3D导演台专门根治角色乱变脸的痼疾,是短剧工具从随机抽卡迈向可控生产的关键一步,创作者值得细看。

  2. 公众号:昆仑万维(天工)66

    天工短剧工作台推出“Agent智能分镜+无限画布”双轨创作模式,告别AI短剧“随机抽卡”

    天工短剧工作台(SkyProduction)推出“Agent智能分镜+无限画布”双轨创作模式,将导演思维拆解为六个可干预环节,通过站位图锁定和多视细节图生成解决角色漂移、变脸问题。该工作台支持720°全景图、3D导演台、多账号分级管理及数据中心,并原生支持英文短剧全流程处理。其三部精品短剧上线DramaWave仅7天,均实现百万美元级营收。

    推荐理由:天工短剧工作台把导演思维拆解成可干预的站位、光影和调度环节,降低了从单镜头到连续叙事的落差,适合需要稳定产出精品短剧的团队。

7月14日周二
  1. 公众号:卡尔的AI沃茨75

    实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由

    LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。

    推荐理由:LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。

  2. TechCrunch:AI(RSS)70

    视频生成创企 PixVerse 完成 4.39 亿美元 C 轮扩展融资,估值超 20 亿美元

    新加坡视频生成初创公司 PixVerse 完成 C 轮扩展融资,共筹集 4.39 亿美元,估值突破 20 亿美元。公司提供 V 系列(消费者及 API)、C 系列(专业影视)及今年初发布的 R 系列世界模型(游戏开发)。用户可生成最高 4k 分辨率并自带音频的视频,消费端注册用户超 1.5 亿,月活超 1500 万,图生视频每分钟 4.80 美元。本轮投资者包括阿里巴巴等。公司计划今年推出新 V 系列模型及新版世界模型,并全球拓展企业客户。

    推荐理由:4.39亿美元让视频生成赛道又添一把火,PixVerse押注的字节系数据标注经验,比模型参数更值得产品人关注,虽然市场挤,但估值翻倍是真实信心。

7月12日周日
  1. Hacker News 热门(buzzing.cc 中文翻译)75

    Ghost Font:一种人类能读懂但AI无法识别的反AI字体

    Ghost Font 是一种利用运动、视频、噪点和诱饵来隐藏文字的反AI字体。用户输入文字后可生成并下载视频片段,视频中的字母由与背景完全相同的点组成,单帧截图无法显示任何信息。该字体生成的视频被传递给Claude Fable和GPT Sol 5.6 Ultra等前沿模型时,这些模型即使具备编程能力也无法解码移动信息,直到被提示具体技术。视频中还包含一条诱饵信息,使模型误以为找到真实内容。项目灵感来自2013年Sang Mun设计的ZXX字体,但现代AI已能轻松读取ZXX。Ghost Font目前为本地原型,数据不发送至任何服务器。作者计划未来将视频生成代码开源,并探索将其用于CAPTCHA系统或AI视觉感知基准测试。

    推荐理由:这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。

7月8日周三
  1. HuggingFace Daily Papers(社区热门论文)73

    AlayaWorld:长程可玩视频世界生成

    AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。

    推荐理由:AlayaWorld 把生成世界从 demo 变成了可交互的全栈开源框架,放出了完整 pipeline,对做游戏和具身智能的团队来说是一套可以立刻跑起来的工具链,值得落地尝试。

  2. AI at Meta75

    Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。

    推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月7日周二
  1. Ethan Mollick75

    MIRA是一个可玩、多人的世界模型,被形容为“火箭联盟的梦”。它基于10k小时公开机器人收集的数据训练,学习四玩家游戏动态,根据按键实时生成画面,帧率达20 FPS。模型由General Intuition与Kyutai Labs联合构建,Epic Games提供协作。Ethan Mollick称从最早的扩散DOOM玩过来,多人20 FPS效果出色。演示、技术报告及开源代码已公开,在ICML Booth 111现场展示。

    引用General Intuition@gen_intuition

    介绍 MIRA。 一个可游玩、多人联机的世界模型。 一个 Rocket League 的梦想。 MIRA 基于用公开可用的机器人收集的 1 万小时数据进行训练,学习了一场四人游戏的动态。该模型根据你和其他玩家按下的按键,以 20 fps 实时运行。 由 General Intuition 和 @kyutai_labs 打造,并与 Epic Games 合作。未用于开发 Rocket League。 ▶️ 在 http://generalintuition.com/mira 游玩演示、阅读技术报告,并探索开源代码。 在 ICML 吗?来 111 号展位亲自体验,并与团队一起深入探讨结果。

    推荐理由:世界模型终于跑通了实时多人游戏,20 FPS 的 Rocket League 梦境能直接上手玩,代码和报告都开源,做游戏和交互的值得试试。

7月3日周五
  1. 公众号:生数科技(Vidu·视频)70

    生数科技发布 Vidu S1,推动视频生成迈向“实时交互”新时代

    7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。

    推荐理由:Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。

  2. Apple Machine Learning Research(RSS)56

    VideoFlexTok:可变长度粗到细视频分词

    VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。

    推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

  3. IT之家(RSS)71

    快手可灵AI获初始投资者20.28亿美元注资,投后估值180亿美元

    快手在港交所公告,21名初始投资者同意以138.24亿元人民币(20.28亿美元)现金注资北京可灵,后者将持有可灵AI相关资产。同日15名额外投资者追加出资52.235亿元人民币(7.6639亿美元),认购总上限为204.471亿元(30亿美元),对应北京可灵扩大后注册资本的16.67%。投后估值180亿美元。快手预计未来12个月内启动可灵AI赴港上市,募资用于扩充算力、建设数据中心及人才引进。

    推荐理由:可灵AI这轮180亿美元估值融资,是AI视频赛道迄今最重量级的资本动作之一,也是中国AI公司分拆上市的标杆事件,值得关注后续上市进程。

7月2日周四
  1. 公众号:可灵AI(快手·视频)71

    戛纳金狮首设AI子赛道:可灵制作斩获1银2铜,它们为何打动评委?

    戛纳国际创意节今年首次设立AI Craft子赛道,两部使用可灵AI生成的广告作品获奖:《L'Ultimo Uomo Reale》拿下Classic单元Film银奖及Craft单元Film Craft铜奖,《Lorem Ipsum》获得Classic单元Film铜奖。

    推荐理由:《L’Ultimo Uomo Reale》和《Lorem Ipsum》用可灵完成从人物表演到视觉奇观的全部画面,戛纳金狮的认可使AI视频生成进入商业交付级评价体系,广告公司的「技术已就绪」主张因此有了第三方权威参考。

7月1日周三
  1. NotebookLM68

    NotebookLM 正式向 Web 英文用户全量推出 Short Video Overviews(短视频概览)功能。该功能可将复杂资料自动转化为 60 秒竖屏视频,深入讲解任意概念。此前,这一功能已面向 Google AI Ultra 和 Pro 订阅者(移动端及 Web)推出,免费用户即将可用。

    引用NotebookLM@NotebookLM

    刷末日信息流,但让它变得有教育意义 🤓 隆重推出 NotebookLM 的短视频概览!把你最复杂的资料变成 60 秒的竖屏视频,深入讲解任何概念。 现正向移动端和网页端的 Google AI Ultra 和 Pro 订阅用户推出(免费用户很快也能用上!)

    推荐理由:NotebookLM 把资料源变成 60 秒竖屏视频,想法不新但落地很实用,学生和内容创作者可能会高频用上,只是颠覆性谈不上。

6月26日周五
  1. Runway:News(网页)65

    Runway发布Agent 2.0

    Runway发布Agent 2.0,帮助营销人员创建、测试和优化广告、视频及营销活动。品牌营销人员可在对话中开发活动概念、生成变体并自动本地化;绩效营销人员可上传创意并导入Meta、YouTube、TikTok或Google广告数据,由Agent分析后生成下一轮待测广告。社交媒体营销人员可一次性生成一周内容,自动裁切为9:16、16:9、1:1等格式;产品营销人员可借助Agent确定定位角度并构建活动资产。Agent 2.0面向所有用户开放。

    推荐理由:Runway的Agent 2.0不只是生成视频,它试图打通从广告数据分析到全平台素材生成的闭环,做增长和社交内容的团队可以观望一下。

6月25日周四
  1. HuggingFace Daily Papers(社区热门论文)70

    Causal-rCM:自回归视频扩散蒸馏的统一教师强制与自强制开源方案

    Causal-rCM将扩散蒸馏框架rCM扩展至自回归视频扩散,提出教师强制(TF)与自强制(SF)互补训练范式,并发布统一开源算法与基础设施。通过自定义掩码FlashAttention-2 JVP内核,首次实现基于教师强制的连续时间一致性模型(sCM/MeanFlow)用于自回归视频扩散,收敛速度比离散时间版本快10倍。蒸馏后的2步因果Wan2.1-1.3B模型在仅1或2步采样下取得VBench-T2V分数84.63,仅使用合成数据即达到帧级和块级流式视频生成SOTA。该方法还应用于Cosmos 3全模态世界基础模型,实现动作条件生成的交互式世界模型。

    推荐理由:把自回归视频扩散蒸馏到1-2步采样,VBench冲到84.63,这个配方让实时视频生成和交互世界模型从论文走进了工程落地,做视频产品的该看。

6月24日周三
  1. Hao AI Lab73

    Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。

    推荐理由:单张 RTX 5090 上 1.8 秒生成 5 秒视频,把消费级延迟压到了‘即时生成’的临界点,做短视频和互动应用的开发者可以认真把这个模型放进技术栈。

6月23日周二
  1. Runway:News(网页)59

    Aleph 2.0 现已集成到 Figma Weave

    Aleph 2.0 是 Runway 的旗舰视频编辑模型,现已在 Figma Weave 中上线。它是一个基于上下文的视频编辑模型,通过关键帧工作:从视频中提取一帧,重新设计风格并附上时间戳连接回 Aleph 2.0 节点,即可将该编辑传递到主体出现的每一帧,同时保持其他内容不变。支持最长 30 秒、1080p 的片段,可跨多镜头序列应用编辑,无需逐镜头处理。

    推荐理由:Runway 把旗舰视频编辑模型直接接入了 Figma 的创意画布,对设计师和视频团队来说,这意味着帧级编辑不用切换工具,协作流程可能大幅简化。

  2. TechCrunch:AI(RSS)70

    Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具

    Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购 Ben Affleck 的 AI 工具公司 Interpositive,亚马逊 MGM 工作室也在去年设立了影视 AI 部门。

    推荐理由:Google DeepMind 首次在影视内容创作上投入 7500 万美元,与 A24 合作开发 AI 工具,这标志着顶尖 AI 实验室开始直接渗透好莱坞核心创意流程,做文娱 AI 工具的人和关注产业交叉点的人应该留意。