プラグイン設定
モデル設定
Realistic および Mood-Enabled Realistic モデルで確実に動作させるには、長い無音をまたいでジェネレータを再利用せず、新しいオーディオ再生の前にジェネレータを再作成してください。詳細については、トラブルシューティングの ジェネレータの再作成 を参照してください。
標準モデル構成
Create Runtime Viseme Generator ノードは、ほとんどのシナリオでうまく機能するデフォルト設定を使用します。構成は、Animation Blueprint のブレンドノードのプロパティを介して処理されます。
Animation Blueprint の設定オプションについては、以下の リップシンク設定 セクションを参照してください。
リアルなモデル設定
Create Realistic MetaHuman Lip Sync Generator ノードは、オプションの Configuration パラメータを受け付け、ジェネレーターの動作をカスタマイズできます:
モデルタイプ
モデルの種類設定は、どのバージョンのリアルなモデルを使用するかを決定します:
| モデルタイプ | パフォーマンス | 視覚品質 | ノイズ耐性 | 推奨ユースケース |
|---|---|---|---|---|
| 高度に最適化(デフォルト) | 最高のパフォーマンス、最低のCPU使用率 | 良好な品質 | 背景ノイズや非音声サウンドがあると、目立つ口の動きが見られる場合があります | クリーンなオーディオ環境、パフォーマンスが重要なシナリオ |
| 準最適化 | 良好なパフォーマンス、中程度のCPU使用率 | 高品質 | ノイズのあるオーディオでの安定性が向上 | パフォーマンスと品質のバランス、混合オーディオ環境 |
| オリジナル | 最新のCPUでのリアルタイム使用に適しています | 最高品質 | 背景ノイズや非音声サウンドに対して最も安定 | 高品質な制作物、ノイズの多いオーディオ環境、最大の精度が必要な場合 |
パフォーマンス設定
内部操作スレッド: 内部モデル処理操作に使用されるスレッド数を制御します。
- 0 (デフォルト/自動): 自動検出を使用します(通常、利用可能なCPUコアの1/4、最大4)
- 1-16: スレッド数を手動で指定します。値が大きいとマルチコアシステムでのパフォーマンスが向上する場合がありますが、CPUをより多く使用します。
Inter Opスレッド: 異なるモデル操作の並列実行に使用されるスレッド数を制御します。
- 0(デフォルト/自動): 自動検出を使用します(通常、利用可能なCPUコアの1/8、最大2)
- 1-8: スレッド数を手動で指定します。通常、リアルタイム処理のために低めに設定されます。
処理チャンクサイズ
処理チャンクサイズ は、各推論ステップで処理されるサンプル数を決定します。デフォルト値は 160 サンプル(16kHz での 10ms のオーディオ)です:
- 値が小さいほど更新が頻繁になりますが、CPU使用率が増加します。
- 値が大きいほどCPU負荷が軽減されますが、リップシンクの応答性が低下する可能性があります。
- 最適なアライメントのためには、160の倍数を使用することを推奨します。

ムード対応モデル設定
Create Realistic MetaHuman Lip Sync With Mood Generator ノードは、基本的なリアリスティックモデルに加えて、追加の設定オプションを提供します:
基本設定
先読み時間(ミリ秒): リップシンク精度向上のためのミリ秒単位の先読みタイミング。
- デフォルト: 80ms
- 範囲: 20ms〜200ms(20で割り切れる必要があります)
- 値が大きいほど同期精度は向上しますが、レイテンシが増加します。
出力タイプ: 生成されるフェイシャルコントロールを制御します。
- 顔全体: 81すべてのフェイシャルコントロール(眉、目、鼻、口、顎、舌)
- 口のみ: 口、顎、舌に関連するコントロールのみ
パフォーマンス設定: 通常のリアリスティックモデルと同じIntra Op ThreadsおよびInter Op Threads設定を使用します。
ムード設定
利用可能なムード:
- 中立, 喜び, 悲しみ, 嫌悪, 怒り, 驚き, 恐怖
- 自信, 興奮, 退屈, 遊び心, 混乱
ムード強度: ムードがアニメーションに与える影響の強さを制御します(0.0~1.0)
ランタイム ムード コントロール
以下の関数を使用して、ランタイム中にムード設定を調整できます。
- ムード設定: 現在のムードタイプを変更します
- ムード強度設定: ムードがアニメーションに与える影響の強さを調整します(0.0〜1.0)
- 先読み時間(ms)設定: 同期のための先読みタイミングを変更します
- 出力タイプ設定: 全顔コントロールと口のみコントロールを切り替えます

ムード選択ガイド
コンテンツに基づいて適切なムードを選択してください:
| Mood | 最適な用途 | 標準的な強度範囲 |
|---|---|---|
| ニュートラル | 一般的な会話、ナレーション、デフォルト状態 | 0.5 - 1.0 |
| 喜び | ポジティブな内容、明るい会話、お祝いの場面 | 0.6 - 1.0 |
| 悲しみ | 憂鬱な内容、感情的なシーン、陰鬱な瞬間 | 0.5 - 0.9 |
| 嫌悪 | 否定的な反応、不快な内容、拒絶 | 0.4 - 0.8 |
| 怒り | 攻撃的な会話、対立するシーン、フラストレーション | 0.6 - 1.0 |
| 驚き | 予期しない出来事、明かされる真実、衝撃的な反応 | 0.7 - 1.0 |
| 恐怖 | 脅威的な状況、不安、緊張した会話 | 0.5 - 0.9 |
| 自信 | プロフェッショナルなプレゼンテーション、リーダーシップのある会話、自己主張の強い話し方 | 0.7 - 1.0 |
| 興奮 | エネルギッシュな内容、発表、熱意あふれる会話 | 0.8 - 1.0 |
| 退屈 | 単調な内容、無関心な会話、疲れた話し方 | 0.3 - 0.7 |
| 遊び心 | カジュアルな会話、ユーモア、気楽なやり取り | 0.6 - 0.9 |
| 困惑 | 質問の多い会話、不確かさ、当惑 | 0.4 - 0.8 |
Animation Blueprint 設定
リップシンク設定
- スタンダードモデル
- リアルなモデル
Blend Runtime MetaHuman Lip Sync ノードのプロパティパネルには設定オプションがあります:
| プロパティ | デフォルト | 説明 |
|---|---|---|
| 補間速度 | 25 | リップの動きがビジーム間で遷移する速さを制御します。値が高いほど、より速く、より急激な遷移になります。 |
| リセット時間 | 0.2 | リップシンクがリセットされるまでの秒単位の時間です。オーディオが停止した後もリップシンクが継続するのを防ぐのに役立ちます。 |
笑いアニメーション
また、オーディオ内で検出された笑い声に動的に反応する笑いアニメーションを追加することもできます:
Blend Runtime MetaHuman Laughterノードを追加しますRuntimeVisemeGenerator変数をViseme Generatorピンに接続します- すでにリップシンクを使用している場合:
Blend Runtime MetaHuman Lip Syncノードの出力をBlend Runtime MetaHuman LaughterノードのSource Poseに接続します。Blend Runtime MetaHuman Laughterノードの出力をOutput PoseのResultピンに接続します。
- リップシンクなしで笑い声のみを使用する場合:
- ソースポーズを
Blend Runtime MetaHuman LaughterノードのSource Poseに直接接続してください。 - 出力を
Resultピンに接続してください。
- ソースポーズを

音声で笑い声が検出されると、キャラクターはそれに応じて動的にアニメーションします:
笑い設定
Blend Runtime MetaHuman Laughter ノードには独自の設定オプションがあります:
| プロパティ | デフォルト | 説明 |
|---|---|---|
| 補間速度 | 25 | リップの動きが笑いアニメーション間で遷移する速さを制御します。値が高いほど、遷移はより速く、より急激になります。 |
| リセット時間 | 0.2 | 笑いがリセットされるまでの秒単位の時間です。オーディオが停止した後も笑いが続くのを防ぐのに役立ちます。 |
| 最大笑いウェイト | 0.7 | 笑いアニメーションの最大強度をスケーリングします(0.0 - 1.0)。 |
注記: 笑い声検出は現在、標準モデルでのみ利用可能です。
Blend Realistic MetaHuman Lip Sync ノードのプロパティパネルには、設定オプションがあります:
| プロパティ | デフォルト | 説明 |
|---|---|---|
| 補間速度 | 30 | アクティブな発話中に表情が遷移する速さを制御します。値が高いほど、遷移が速く急になります。 |
| アイドル補間速度 | 15 | 表情がアイドル状態/ニュートラル状態に戻る速さを制御します。値が低いほど、休息ポーズへのスムーズで緩やかな復帰になります。 |
| リセット時間 | 0.2 | リップシンクがアイドル状態にリセットされるまでの時間(秒)です。オーディオ停止後に表情が続くのを防ぐのに役立ちます。 |
| アイドル状態を保持 | false | 有効にすると、アイドル期間中に最後の感情状態を保持し、ニュートラルにリセットしません。 |
| 目の表情を保持 | true | アイドル状態中に目関連のフェイシャルコントロールを保持するかどうかを制御します。「アイドル状態を保持」が有効な場合のみ効果があります。 |
| 眉の表情を保持 | true | アイドル状態中に眉関連のフェイシャルコントロールを保持するかどうかを制御します。「アイドル状態を保持」が有効な場合のみ効果があります。 |
| 口の形状を保持 | false | アイドル状態中に口の形状コントロール(舌や顎などの発話に固有の動きを除く)を保持するかどうかを制御します。「アイドル状態を保持」が有効な場合のみ効果があります。 |
アイドル状態の保存
アイドル状態の保持機能は、Realisticモデルが無音期間をどのように扱うかに対応します。個々のバイジームを使用し、無音中は常にゼロ値に戻るStandardモデルとは異なり、Realisticモデルのニューラルネットワークは、MetaHumanのデフォルトのレストポーズとは異なる微妙な顔の位置を維持することがあります。
有効にするタイミング:
- 発話セグメント間で感情表現を維持する
- キャラクターの性格特性を維持する
- シネマティックシーケンスで視覚的な連続性を確保する
地域コントロールオプション:
- 目の表情: 目の細め、見開き、まぶたの位置を保持します
- 眉の表情: 眉と額の位置を維持します
- 口の形: 口の全体的な曲線を保ちつつ、発話動作(舌、顎)をリセットできるようにします
既存のアニメーションとの組み合わせ
読むより見る方が好きですか?この正確なセットアップを扱ったビデオチュートリアルをチェックしてください。
既存のボディアニメーションやカスタムフェイシャルアニメーションを上書きせずに、リップシンクと笑いを適用するには:
このセットアップは、フェイス用Animation Blueprintに適用されます。リップシンクはボディ用Animation Blueprintの一部ではないためです。カスタムボディアニメーション(例: トルソー、腕、その他の体の動き)については、Sequence Player を介してアニメーションシーケンスをボディ用Animation Blueprintの出力ポーズに直接接続するだけです。追加のセットアップは必要ありません。
- ボディアニメーションと最終出力の間に
Layered blend per boneノードを追加します。Use Attached Parentが true であることを確認してください。 - レイヤー設定を構成します。
Layer Setup配列に 1つの項目 を追加- レイヤーの
Branch Filtersに、次のBone Nameを持つ 3つの項目 を追加:FACIAL_C_FacialRootFACIAL_C_Neck2RootFACIAL_C_Neck1Root
- カスタムフェイシャルアニメーションに重要:
カーブブレンドオプションで "最大値を使用" を選択してください。これにより、カスタムフェイシャルアニメーション(表情、感情など)をリップシンクの上に適切に重ねることができます。 - 接続を行ってください:
- カスタムアニメーション(通常は目的のアニメーションシーケンスアセットを使用した
Sequence Player)→Base Pose入力 - フェイシャルアニメーション出力(リップシンクおよび/または笑いノードから)→
Blend Poses 0入力 - レイヤードブレンドノード → 最終
Resultポーズ
- カスタムアニメーション(通常は目的のアニメーションシーケンスアセットを使用した

モーフターゲットセットの選択
- 標準モデル
- リアルなモデル
標準モデルは、カスタムポーズアセットのセットアップを通じて、あらゆるモーフターゲットの命名規則を本質的にサポートするポーズアセットを使用します。追加の設定は必要ありません。
Blend Realistic MetaHuman Lip Sync ノードには、顔のアニメーションに使用するモーフターゲットの命名規則を決定する モーフターゲットセット プロパティが含まれています:
| モーフターゲットセット | 説明 | 使用例 |
|---|---|---|
| MetaHuman(デフォルト) | 標準のMetaHumanモーフターゲット名(例:CTRL_expressions_jawOpen) | MetaHumanキャラクター |
| ARKit | Apple ARKit互換の名前(例:JawOpen、MouthSmileLeft) | ARKitベースのキャラクター |
リップシンク動作の微調整
特定のリップシンクカーブのスケーリング
リップシンクによって生成される個々の顔の動きは、Modify Curve ノードを使用して減衰(または増幅)できます。これは、特定のカーブがオーディオコンテンツやキャラクターに対して目立ちすぎる場合に役立ちます。
セットアップ:
- リップシンクのブレンドノードの後に、
Modify Curveノードを追加します - ノードを右クリックして Add Curve Pin を選択し、スケールしたいカーブ名を入力します
- ノードの Apply Mode プロパティを Scale に設定します
- Value パラメータを設定します: 1.0 未満の値は動きを減衰させ、1.0 を超える値は動きを増幅します(例: 0.8 = 20% 減少)
よくスケールされるカーブ:
| カーブ名 | 目的 | 適用対象 | 一般的な調整 |
|---|---|---|---|
CTRL_expressions_tongueOut | 特定の音素における舌の前方突出 | 標準モデル | 突出を減らすには0.8 |
CTRL_expressions_jawOpen | 顎の開口範囲 | リアリスティックモデル | 顎の動きを減らすには0.9 |
同じ Modify Curve ノードに複数のカーブピンを追加することで、一度に複数のカーブをスケールできます。
ムード別ファインチューニング
ムード対応モデルでは、特定の感情表現を微調整できます:
眉毛コントロール:
CTRL_expressions_browRaiseInL/CTRL_expressions_browRaiseInR- 眉毛の内側を上げるCTRL_expressions_browRaiseOuterL/CTRL_expressions_browRaiseOuterR- 眉毛の外側を上げるCTRL_expressions_browDownL/CTRL_expressions_browDownR- 眉毛を下げる
目の表情コントロール:
CTRL_expressions_eyeSquintInnerL/CTRL_expressions_eyeSquintInnerR- 目を細めるCTRL_expressions_eyeCheekRaiseL/CTRL_expressions_eyeCheekRaiseR- 頬を上げる
モデルの比較と選択
モデルの選択
プロジェクトでどのリップシンクモデルを使用するかを決める際は、以下の要素を考慮してください:
| 検討事項 | 標準モデル | リアリスティックモデル | ムード対応リアリスティックモデル |
|---|---|---|---|
| キャラクター互換性 | MetaHumans およびすべてのカスタムキャラクタータイプ | MetaHumans(およびARKit)キャラクター | MetaHumans(およびARKit)キャラクター |
| ビジュアル品質 | 効率的なパフォーマンスで良好なリップシンク | より自然な口の動きによるリアリズムの向上 | 感情表現によるリアリズムの向上 |
| パフォーマンス | モバイル/VRを含むすべてのプラットフォーム向けに最適化 | より高いリソース要件 | より高いリソース要件 |
| 機能 | 14のビゼーム、笑い声検出 | 81のフェイシャルコントロール、3つの最適化レベル | 81のフェイシャルコントロール、12のムード、設定可能な出力 |
| プラットフォーム対応 | Windows、Android、Quest | Windows、Mac、iOS、Linux、Android、Quest | Windows、Mac、iOS、Linux、Android、Quest |
| ユースケース | 一般的なアプリケーション、ゲーム、VR/AR、モバイル | シネマティックな体験、クローズアップでのインタラクション | 感情的なストーリーテリング、高度なキャラクターインタラクション |
エンジンバージョン互換性
Unreal Engine 5.2 を使用している場合、UEのリサンプリングライブラリのバグにより、リアリスティックモデルが正しく動作しない可能性があります。信頼性の高いリップシンク機能を必要とするUE 5.2ユーザーは、代わりに標準モデルを使用してください。
この問題はUE 5.2に固有のものであり、他のエンジンバージョンには影響しません。
パフォーマンス推奨事項
- ほとんどのプロジェクトでは、Standard Model が品質とパフォーマンスの優れたバランスを提供します。
- MetaHuman キャラクターに最高の視覚的忠実度が必要な場合は、Realistic Model を使用してください。
- アプリケーションにとって感情表現の制御が重要な場合は、Mood-Enabled Realistic Model を使用してください。
- モデルを選択する際は、ターゲットプラットフォームのパフォーマンス能力を考慮してください。
- さまざまな最適化レベルをテストして、特定のユースケースに最適なバランスを見つけてください。
トラブルシューティング
よくある問題
Realistic Models 用ジェネレーターの再作成:
Realistic Models で確実かつ一貫した動作を行うには、一定期間非アクティブな状態が続いた後に新しいオーディオデータを入力する際は、毎回ジェネレーターを再作成することをお勧めします。これは ONNX runtime の動作に起因するもので、無音状態が続いた後にジェネレーターを再利用すると、リップシンクが機能しなくなる可能性があります。
たとえば、Play Sound 2D を呼び出すときや、その他の方法でサウンドウェーブの再生とリップシンクを開始するときなど、再生を開始するたびにリップシンクジェネレーターを再作成できます:

Runtime Text To Speech 統合用プラグインの場所: Runtime MetaHuman Lip Sync を Runtime Text To Speech と一緒に使用する場合(両方のプラグインは ONNX Runtime を使用します)、プラグインがエンジンの Marketplace フォルダにインストールされていると問題が発生する可能性があります。この問題を修正するには:
- UEインストールフォルダ内の
\Engine\Plugins\Marketplaceにある両方のプラグインを見つけます(例:C:\Program Files\Epic Games\UE_5.6\Engine\Plugins\Marketplace) RuntimeMetaHumanLipSyncとRuntimeTextToSpeechの両フォルダを、プロジェクトのPluginsフォルダに移動します- プロジェクトに
Pluginsフォルダがない場合は、.uprojectファイルと同じディレクトリに作成します - Unreal Editor を再起動します
これは、エンジンのMarketplaceディレクトリから複数のONNX Runtimeベースのプラグインが読み込まれる際に発生する可能性がある互換性の問題に対処します。
パッケージ構成 (Windows): パッケージ化したプロジェクトでWindows上でリップシンクが正しく動作しない場合、Development構成の代わりにShippingビルド構成を使用していることを確認してください。Development構成では、パッケージ化されたビルドでリアルなモデル用のONNXランタイムに問題が発生する可能性があります。
これを修正するには:
- プロジェクト設定 → パッケージングで、ビルド構成を Shipping に設定します
- プロジェクトを再パッケージしてください。

一部の Blueprint のみのプロジェクトでは、Shipping が選択されている場合でも、Unreal Engine が Development 構成でビルドされることがあります。この場合は、C++ クラスを少なくとも 1 つ追加して(空のクラスでも構いません)、プロジェクトを C++ プロジェクトに変換してください。これを行うには、UE エディタのメニューで ツール → 新しい C++ クラス に移動し、空のクラスを作成します。これにより、プロジェクトは Shipping 構成で正しくビルドされるようになります。プロジェクトの機能は Blueprint のみのままで問題ありません。C++ クラスはビルド構成を適切にするために必要なだけです。
リップシンクの応答性の低下: ストリーミングサウンドウェーブまたはキャプチャラブルサウンドウェーブを使用する際に、リップシンクの応答性が時間の経過とともに低下する場合、これはメモリの蓄積が原因である可能性があります。既定では、新しいオーディオが追加されるたびにメモリが再割り当てされます。この問題を防ぐには、ReleaseMemory 関数を定期的に呼び出して、蓄積されたメモリを解放してください。たとえば、約30秒ごとに呼び出します。
パフォーマンス最適化:
- パフォーマンス要件に応じて、リアリスティックモデルの処理チャンクサイズを調整してください。
- 対象ハードウェアに適したスレッド数を使用してください。
- フルフェイシャルアニメーションが不要な場合は、ムード対応モデルでは口のみ出力タイプの使用を検討してください。