概述

Runtime MetaHuman Lip Sync 是一個外掛程式,可為 MetaHuman 與自訂角色提供即時、離線且跨平台的口型同步。它能讓您依據各種來源的音訊輸入,驅動角色的嘴唇動畫,包括:
- 透過 Runtime Audio Importer 的 可擷取聲波 進行麥克風輸入
- 由 Runtime Text To Speech 或 Runtime AI Chatbot Integrator 合成的語音
- 透過 Runtime Audio Importer 以多種格式串流或匯入的音訊資料
- 任何以浮點 PCM 格式(即浮點樣本陣列)表示的音訊資料。
此外掛程式會根據音訊輸入,在內部產生視位(音素的視覺化表現)。由於它直接以音訊資料而非文字運作,此外掛程式支援多語言輸入,包括但不限於英語、西班牙語、法語、德語、日語、中文、韓語、俄語、義大利語、葡萄牙語、阿拉伯語與印地語。實際上任何語言都受支援,因為口型同步是根據音訊中的音素產生,而非特定語言的文字處理。
Standard Model 會產生 14 個視位,並使用預先定義的姿勢資產來執行口型同步動畫。相比之下,Realistic Models(僅限於 MetaHuman 與以 ARKit 為基礎的角色)會產生 81 個臉部控制變化,且無需依賴預先定義的姿勢資產,因此能呈現出顯著更為逼真的臉部動畫。
角色相容性
儘管名稱如此,Runtime MetaHuman Lip Sync 適用於各種角色,而不僅限於 MetaHuman:
熱門商業角色系統
- Daz Genesis 8/9 角色
- Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) 角色
- Mixamo 角色
動畫標準支援
- 基於 FACS 的混合變形系統
- Apple ARKit 混合變形標準
- Preston Blair 音素集
- 3ds Max 音素系統
- 任何具有用於臉部表情的自訂形變目標的角色
許多熱門系統,包括 Reallusion CC4/CC5 與 Daz Genesis 8.1/9,也能轉換為使用符合 ARKit 標準的混合變形名稱。這讓您可以為這些角色使用 寫實模型,以其更高品質的面部動畫,作為標準模型手動視素對應的替代方案。詳情請參閱 將角色轉換為 ARKit 混合變形。
動畫預覽
看看這些簡短動畫,了解外掛程式在不同角色類型與模型上所產生的口型同步動畫品質:
主要特色
- 從 麥克風輸入 進行即時口型同步
- 離線音訊處理 支援
- 跨平台相容性與模型特定的平台支援
- 支援多種角色系統與動畫標準
- 適用於自訂角色的彈性口型對應
- 通用語言支援 - 透過音訊分析,適用於任何口說語言
- 情緒感知的臉部動畫,以增強表現力
- 可設定的輸出類型(全臉或僅嘴部控制)
- 可選的眼睛動畫輔助工具,用於眨眼與視線追蹤
口型同步模型
該外掛程式提供多種口型同步模型,以滿足不同專案需求:
- 標準模型
- 寫實模型
- 具情緒功能的逼真模型
標準口型同步模型提供高效率的跨平台效能,並具備廣泛的角色相容性:
- 適用於 MetaHuman 與所有自訂角色類型
- 專為即時效能最佳化
- 更低的資源需求
- 平台支援:Windows、Android 與基於 Android 的平台(包括 Meta Quest)
若要使用 Standard Model,您需要安裝額外的擴充外掛程式。請參閱先決條件一節以取得安裝說明。
逼真的口型同步模型能為 MetaHuman 角色提供增強的視覺保真度:
- 與 MetaHuman 和基於 ARKit 的角色相容,具備進階臉部動畫(81 個臉部控制)
- 更高的視覺品質與更自然的口部動作
- 效能需求略高
- 串流音訊處理,適用於即時應用
- 非常適合電影級體驗與近距離角色互動
- 三種最佳化等級:Original、Semi-Optimized 與 Highly Optimized
- 可設定的形變目標組合(參閱 形變目標組合選擇)
- 平台支援:Windows、Mac、iOS、Linux、Android、Android 基礎平台(包括 Meta Quest)
Realistic Model 已包含在主外掛中,無需任何額外擴充功能即可使用。
具備情緒功能的寫實模型可為 MetaHuman 角色提供情緒感知的面部動畫:
- 與 MetaHuman 和基於 ARKit 的角色相容,具備情緒反應式臉部動畫(81 個臉部控制)
- 12 種不同的情緒類型(中性、快樂、悲傷、自信等)
- 可設定的情緒強度(0.0 至 1.0)
- 可調整的前瞻時間以改善同步(20 毫秒至 200 毫秒)
- 可選擇的輸出類型:完整臉部或僅嘴部控制
- 用於即時應用的串流音訊處理
- 可設定的變形目標集(參見 變形目標集選擇)
- 平台支援:Windows、Mac、iOS、Linux、Android,以及基於 Android 的平台(包含 Meta Quest)
具備情緒功能的擬真模型包含在主插件中,使用時無需任何額外擴充功能。
您可以根據專案需求,選擇合適的模型,以符合效能、角色相容性、視覺品質、目標平台與功能需求。
運作方式
此外掛程式以下列方式處理音訊輸入:
- 音訊資料以浮點 PCM 格式接收,並附帶指定的通道數與取樣率
- 外掛程式會處理音訊,依所選模型產生臉部控制資料或視位
- 針對具情緒功能的模型,會將情緒情境套用至臉部動畫
- 動畫資料會即時驅動角色的臉部動作
效能架構
Runtime MetaHuman Lip Sync 僅使用 CPU 進行推論,以提供一致、低延遲的 Lip Sync 結果,適合即時應用程式。預設情況下,外掛程式每 10 毫秒 執行一次 Lip Sync 處理(可調整 - 請參閱 外掛程式設定 以取得所有可用設定,包括 處理區塊大小、執行緒數 及其他效能參數)。
模型架構總覽
口型同步模型採用基於 Transformer 的緊湊型神經網路,透過梅爾頻譜圖分析來處理音訊。這種輕量級架構專為即時效能所設計,具備高效的 CPU 推論能力與極低的記憶體佔用。
為什麼使用 CPU 推論?
對於即時口型同步這類小規模、頻繁進行的推論操作,CPU 處理提供了比 GPU 更佳的延遲特性。在 batch size 為 1、推論間隔為 10–100 毫秒的情況下,PCIe 傳輸與 kernel 啟動所造成的 GPU 開銷,往往超過實際的運算時間。此外,在遊戲引擎中,GPU 早已被渲染、著色器與物理運算佔滿,造成資源爭用,進而引入難以預測的延遲尖峰。
硬體相容性
此外掛程式在大多數中階及更高階 CPU 上皆能高效運作,無需專用圖形硬體,即可在桌上型電腦、行動裝置與 VR 平台上提供即時效能。若硬體效能較弱,您可以將模型類型調整為 Semi-Optimized 或 Highly Optimized,或增大**處理區塊大小**,以維持即時效能,但回應速度會略微降低。
快速入門
以下是為您的角色啟用口型同步的基本設定:
- 若使用 MetaHuman 角色,請依照設定指南
- 若使用自訂角色,請依照自訂角色設定指南
- 選擇並設定您偏好的口型同步模型
- 在您的 Blueprint 中設定音訊輸入處理
- 在 Animation Blueprint 中連接適當的口型同步節點
- 播放音訊,即可看到您的角色同步產生動畫
可選的眼睛動畫
此外掛程式也提供用於 MetaHuman 自動眨眼與視線追蹤的選用輔助工具。這些工具與口型同步無關,可獨立使用,也可疊加於口型同步之上。請參閱 眼睛動畫輔助工具。
其他資源
📦 下載與連結
示範專案:
提供兩個立即可用的示範專案——如需完整詳細資訊、下載內容與逐步解說,請參閱專屬的示範專案頁面:
- 完整 AI 對話式 NPC 工作流程 - 語音辨識 + LLM 聊天機器人 + TTS + 口型同步
- 基本口型同步示範 - 麥克風輸入、音訊檔案、TTS
兩個示範專案皆為跨平台(Windows、Mac、Linux、iOS、Android、Meta Quest),並以打包建置版本及完整的 UE 5.6+ 源碼專案形式提供。
🎥 影片教學
精選示範:
寫實模型(高品質)教學:
- 從音訊檔案/緩衝區進行高品質口型同步
- 結合情緒控制與本機 TTS 進行高品質口型同步
- 使用 ElevenLabs 與 OpenAI TTS 進行高品質口型同步
- 透過即時麥克風進行高品質口型同步
- 為 ARKit 角色進行高品質口型同步
標準模型教學:
一般設定:
💬 支援
- 客製化開發: [email protected] (為團隊與組織量身打造的解決方案)