概述

Runtime MetaHuman Lip Sync 是一个插件,可为 MetaHuman 和自定义角色提供实时、离线及跨平台的口型同步。它允许你根据多种来源的音频输入来驱动角色嘴唇动画,包括:
- 通过 Runtime Audio Importer 的 可捕获声波 进行麦克风输入
- 来自 Runtime Text To Speech 或 Runtime AI Chatbot Integrator 的合成语音
- 以 多种格式 通过 Runtime Audio Importer 流式传输或导入的音频数据
- 任何 float PCM 格式的音频数据(浮点采样数组)
该插件根据音频输入在内部生成视位(音素的视觉表示)。由于它直接处理音频数据而非文本,该插件支持多语言输入,包括但不限于英语、西班牙语、法语、德语、日语、中文、韩语、俄语、意大利语、葡萄牙语、阿拉伯语和印地语。实际上支持任何语言,因为口型同步是基于音频音素生成的,而非特定语言的文本处理。
Standard Model 生成 14 个视位,并使用预设姿势资产执行口型同步动画。相比之下,Realistic Models(仅适用于基于 MetaHuman 和 ARKit 的角色)生成 81 个面部控制变化,无需依赖预设姿势资产,因此面部动画更加逼真。
角色兼容性
尽管名字如此,Runtime MetaHuman Lip Sync 适用于多种角色,而不仅仅是 MetaHuman:
热门商业角色系统
- Daz Genesis 8/9 角色
- Reallusion Character Creator 3/4 (CC3/CC4) 角色
- Mixamo 角色
- ReadyPlayerMe 虚拟形象
动画标准支持
- 基于FACS的混合变形系统
- Apple ARKit混合变形标准
- Preston Blair音素集
- 3ds Max音素系统
- 任何带有自定义面部表情变形目标的角色
对于使用 Standard Model 的非 MetaHuman 角色,请参阅 自定义角色设置指南。对于使用 Realistic Models 的 基于 ARKit 的角色,请参阅 变形目标集选择。
动画预览
查看这些短视频,了解插件在不同角色类型和模型上生成的口型同步动画质量:
主要功能
- 基于麦克风输入的实时口型同步
- 支持离线音频处理
- 跨平台兼容性,并针对不同模型提供相应的平台支持
- 支持多种角色系统和动画标准
- 面向自定义角色的灵活视位映射
- 通用语言支持——通过音频分析适用于任何口语
- 情绪感知面部动画增强表现力
- 可配置的输出类型(全脸或仅嘴部控制)
- 可选的眼部动画辅助工具,用于眨眼和视线跟踪
口型同步模型
该插件提供多种口型同步模型,以满足不同项目需求:
- 标准模型
- 写实模型
- 支持情绪的逼真模型
标准口型同步模型提供高效、跨平台的性能,并具有广泛的角色兼容性:
- 适用于 MetaHumans 和所有自定义角色类型
- 针对实时性能优化
- 更低的资源需求
- 平台支持:Windows、Android、基于 Android 的平台(包括 Meta Quest)
要使用 Standard Model,您需要安装额外的扩展插件。请参阅 前提条件部分 获取安装说明。
逼真的口型同步模型可显著提升 MetaHuman 角色的视觉保真度:
- 兼容基于 MetaHuman 和 ARKit 的角色,支持高级面部动画(81 个面部控制项)
- 更高的视觉质量,嘴巴动作更自然
- 性能要求略高
- 面向实时应用的流式音频处理
- 非常适合影视级体验和近距离角色互动
- 三个优化级别:Original、Semi-Optimized 和 Highly Optimized
- 可配置的变形目标集(参见 变形目标集选择)
- 平台支持:Windows、Mac、iOS、Linux、Android、基于 Android 的平台(包括 Meta Quest)
Realistic Model 包含在主插件中,使用时无需任何额外扩展。
具备情绪控制功能的逼真模型可为MetaHuman角色提供情绪感知面部动画:
- 兼容基于 MetaHuman 和 ARKit 的角色,支持情绪响应式面部动画(81 个面部控制)
- 12 种不同的情绪类型(中性、快乐、悲伤、自信等)
- 可配置的情绪强度(0.0 到 1.0)
- 可调整的前瞻时间,用于改善同步(20 毫秒至 200 毫秒)
- 可选择的输出类型:全脸控制或仅嘴部控制
- 用于实时应用的流式音频处理
- 可配置的形态目标集(参见 形态目标集选择)
- 平台支持:Windows、Mac、iOS、Linux、Android、基于 Android 的平台(包括 Meta Quest)
支持情绪的真实模型随主插件附带,无需任何额外扩展即可使用。
您可以根据项目需求选择合适的模型,以满足性能、角色兼容性、视觉质量、目标平台和功能需求。
工作原理
插件按以下方式处理音频输入:
- 音频数据以浮点 PCM 格式 接收,带有指定的 声道 和 采样率
- 插件处理音频以生成面部控制数据或视素,具体取决于模型
- 对于支持情绪感知的模型,情绪上下文会被应用到面部动画中
- 动画数据实时驱动角色的面部运动
性能架构
Runtime MetaHuman Lip Sync 仅使用 CPU 推理,可提供一致、低延迟的口型同步结果,适用于实时应用。默认情况下,插件每 10 毫秒执行一次口型同步处理(可调整——有关所有可用设置,包括处理块大小、线程数及其他性能参数,请参阅插件配置)。
模型架构概述
口型同步模型使用紧凑的基于Transformer的神经网络,通过梅尔频谱分析处理音频。这种轻量级架构专为实时性能而设计,具有高效的CPU推理和最小的内存占用。
为什么使用 CPU 推理?
对于小型、频繁的推理操作(如实时口型同步),CPU 处理比 GPU 具有更优的延迟特性。在批大小为 1、推理间隔为 10-100 毫秒的情况下,PCIe 传输和内核启动带来的 GPU 开销往往超过实际计算时间。此外,在游戏引擎中,GPU 已被渲染、着色器和物理计算占满,由此产生的资源争用会引入不可预测的延迟峰值。
硬件兼容性
该插件在大多数中端及以上的 CPU 上都能高效运行,无需专用图形硬件,即可在桌面、移动和 VR 平台上提供实时性能。对于性能较弱的硬件,您可以将模型类型调整为 Semi-Optimized 或 Highly Optimized,或增加**处理块大小**,以略微降低响应速度来保持实时性能。
快速开始
以下是为您的角色启用口型同步的基本设置:
- 对于 MetaHuman 角色,请遵循设置指南
- 对于自定义角色,请遵循自定义角色设置指南
- 选择并配置您首选的口型同步模型
- 在您的 Blueprint 中设置音频输入处理
- 在 Animation Blueprint 中连接相应的口型同步节点
- 播放音频并观看您的角色同步动画
可选的眼睛动画
该插件还提供用于 MetaHuman 的可选辅助功能,包括 自动眨眼 和 视线追踪。它们与口型同步相互独立,既可以单独使用,也可以叠加在其之上。请参阅眼部动画辅助工具。
附加资源
📦 下载与链接
演示项目:
有两个现成的演示项目可用——查看专门的演示项目页面,获取完整详情、下载和操作指南:
- 完整 AI 对话 NPC 工作流 - 语音识别 + LLM 聊天机器人 + TTS + 口型同步
- 基础口型同步演示 - 麦克风输入、音频文件、TTS
两个演示均为跨平台(Windows、Mac、Linux、iOS、Android、Meta Quest),并提供打包构建和完整的 UE 5.6+ 源代码项目。
🎥 视频教程
精选演示:
写实模型(高质量)教程:
- 高质量口型同步(来自音频文件/缓冲区)
- 高质量口型同步(带情绪控制与本地TTS)
- 高质量口型同步(支持ElevenLabs与OpenAI TTS)
- 高质量实时麦克风口型同步
- 高质量ARKit角色口型同步
标准模型教程:
通用设置:
💬 支持
- 定制开发: [email protected](为团队和组织量身定制的解决方案)