Meta 发布 Muse Realtime Avatar,将实时语音转化为可交互的动态化身
Bringing Your Muse to Life
Meta 发布 Muse Realtime Avatar,将 Muse Realtime Voice 的语音流实时转化为带表情、手势和全身动作的交互化身,可基于参考图像驱动人像、插画、动物或日常物品。
原文给出了蒸馏方案、延迟数字和与商业系统的对比结果,读者可以据此评估其实时化身生成的技术路线和落地水平。
* AI 研究
* AI 开发者
让你的缪斯活起来
2026年9月23日·10分钟阅读
播放 动画角色解释 Muse Realtime Avatar 如何结合 Muse Spark 和 Muse Presence 来产生富有表现力、反应灵敏的个性。播放
显示字幕 动画角色解释 Muse Realtime Avatar 如何结合 Muse Spark 和 Muse Presence 来产生富有表现力、反应灵敏的个性。显示字幕 静音 动画角色解释 Muse Realtime Avatar 如何结合 Muse Spark 和 Muse Presence 来产生富有表现力、反应灵敏的个性。静音
动画角色解释 Muse Realtime Avatar 如何结合 Muse Spark 和 Muse Presence 来产生富有表现力、反应灵敏的个性。播放位置 0:00 / 0:00
今天,我们推出 Muse Realtime Avatar,这是我们最先进的具身技术,可将 Muse Realtime Voice 转变为富有表现力、可交互的虚拟形象。
以参考媒体为条件,Muse Realtime Avatar 可将任何角色带入实时对话。一张照片肖像通过细微的表情做出回应,而一幅全身插画在说话时会做出手势并变换姿态。动物和日常物品变得富有表现力,同时不失去其独特之处。逐帧来看,虚拟形象的外观和举止在对话的每一轮之间都保持一致。
除了会说话的头像之外,Muse Realtime Avatar 还能实时让任何图像活起来,具有富有表现力的面部、手部和全身动作。
从智能到实时临场感
Muse Realtime Voice 和 Muse Realtime Avatar 构成一个单一的流式系统,连接智能、语音和具身。Muse Realtime Voice 提供对话智能,并产生一串语音 token(VQ),既承载说了什么,也承载如何表达。音频解码器将这些 token 转换为语音,而 Muse Realtime Avatar 消费同一数据流以生成相应的视觉表演。共享这一 token 流可保持语音、唇部动作和表情同步。
Muse Realtime Avatar 是一种音频驱动的 Diffusion Transformer,以语音 token 流、参考媒体和近期视频潜变量的滚动窗口为条件。它以短因果块的形式生成视频。当每个块完成时,其最新生成的潜变量成为下一个块的运动上下文,将虚拟形象的外观和举止向前传递,同时保持计算有界,使生成能够持续到对话结束。
![]()
Muse Realtime Avatar 将流式语音 VQ 转换为同步视频,向前传递生成的上下文,以在整个对话过程中保持连续性。
实时无限视频生成
实时流媒体必须同时解决两个问题:以足够快的速度生成视频以实现实时交互,并在整个对话过程中保持视觉一致而不累积错误。
我们从一个高质量的双向教师模型开始,通过自强制和分布匹配蒸馏,生成一个具有固定长度 KV 缓存的因果学生模型。自强制允许学生模型基于自己生成的上下文进行训练,并教会它在小错误随时间累积时抵抗漂移,匹配其在推理时遇到的条件。
教师模型使用 40 个扩散步和三元无分类器引导(CFG),每步需要三次模型前向,每个片段共需 120 次模型评估。我们精心调优的方案将扩散过程与 CFG 的效果联合蒸馏到一个无引导的两步学生模型中。通过这些技术,学生模型能够在两次无引导评估中复现教师模型在 120 次有引导评估中逐步精炼的结果,实现了 60 倍的缩减,同时很好地保持了教师模型的质量。
![]()
蒸馏将每个片段的推理从 120 次神经函数评估减少到 2 次,实现了 60 倍的缩减,同时在整体偏好上取得了接近均分的结果。
最先进的虚拟形象体验
为了解 Muse Realtime Avatar 在实时对话中的表现,我们将其与 Runway Characters 和 HeyGen LiveAvatar 这两个领先的商业虚拟形象系统进行了对比,使用各产品原生的实时通话体验。评分者使用匹配的虚拟形象身份与每个系统进行了两到三分钟的对话,然后从视觉质量、同步性、角色一致性和举止等方面对体验进行比较。下图报告了整体偏好,评分者更常偏好 Muse Realtime Avatar。
![]()
评分者在整体以及每个评估维度上都更偏好 Muse Realtime Avatar。与 Runway Characters 在举止方面的比较在统计上与持平无法区分。
在 Meta 规模下以亚秒级延迟提供服务
Muse Realtime Avatar 在实时对话进行时持续生成虚拟形象的视频。要在 Meta 规模下提供这种体验,既需要交互式延迟,也需要高并发。为实现这一点,我们从底层重新设计了 Meta 的实时 AI 推理栈,并将其与为高度优化的实时视频推理和服务而构建的内部定制引擎相结合。
具有内存感知位置编码的持久 KV 缓存使我们能够在解码时智能地跨片段复用上下文。缓存感知路由和延迟感知动态批处理高效地分配并发会话。四位量化感知训练在降低推理成本的同时保持质量,而融合内核和 NVIDIA CUDA Graph 捕获则减少了内存流量和调度开销。我们与 NVIDIA 合作进行了多项模型优化,以最小化模型前向传播的成本。整个系统,包括底层基础设施,都经过端到端优化,以确保流畅的用户体验。
Muse Realtime Avatar 以每秒 25 帧的速度流式传输 448x768 的竖屏视频,从用户发言结束到收到同步语音和视频响应的第一个字节,延迟约为 870 毫秒。在 GB200 上的单个会话中,每个生成步骤在 20 毫秒内生成八帧,对应 320 毫秒的播放时长,即每帧有效模型时间为 2.5 毫秒。
上述优化加上语音和视频之间的智能编排,使服务容量相对于两步 BF16 基线提升了 8 倍,在单个 GB200 上可支持 12 个并发的实时视频生成会话。
播放 Muse Realtime Avatar 对话示例 1 播放
取消静音 Muse Realtime Avatar 对话示例 1 取消静音
Muse Realtime Avatar 对话示例 1 播放位置 0:00 / 0:00
显示对话 1
显示对话 2
显示对话 3
显示对话 4
显示对话 5
显示对话 6
显示对话 7
显示对话 8
显示对话 9
上一张幻灯片 下一张幻灯片
转到对话 1 转到对话 2 转到对话 3 转到对话 4 转到对话 5 转到对话 6 转到对话 7 转到对话 8 转到对话 9
浏览与 Muse Realtime Avatar 的对话,以交互式、亚秒级延迟呈现。
负责任地构建具身 AI
我们在整个体验过程中执行严格的安全要求,以降低滥用风险并保护人们。为使生成的媒体可追溯,Muse Realtime Avatar 使用 Meta Video Seal 在生成的视频中嵌入持久、不可见的水印,且不会为实时体验增加延迟。随着具身 AI 的发展,我们将继续加强这些保护措施。本博文中的所有示例仅用于说明模型能力,并不都反映 Muse 应用中可用的虚拟形象。Muse 面向 18 岁及以上用户。
Meta AI
开发者
模型
法律
Meta © 2026
来源:Meta AI:Research Blog(网页) · research.meta.ai