メインコンテンツまでスキップ

概要

Runtime MetaHuman Lip Sync Documentation

Runtime MetaHuman Lip Sync は、MetaHuman とカスタムキャラクターの両方に対して、リアルタイム、オフライン、クロスプラットフォームのリップシンクを可能にするプラグインです。さまざまなソースからのオーディオ入力に応じてキャラクターの唇をアニメーションさせることができ、以下を含みます:

このプラグインは、オーディオ入力に基づいて内部でバイジーム(音素の視覚的表現)を生成します。テキストではなくオーディオデータを直接処理するため、このプラグインは、英語、スペイン語、フランス語、ドイツ語、日本語、中国語、韓国語、ロシア語、イタリア語、ポルトガル語、アラビア語、ヒンディー語を含む(これらに限定されない)多言語入力をサポートしています。文字通り、あらゆる言語がサポートされています。これは、リップシンクが言語固有のテキスト処理ではなく、オーディオの音素から生成されるためです。

Standard Model14 のビジーム を生成し、事前定義されたポーズアセットを使用してリップシンクアニメーションを実行します。一方、Realistic ModelsMetaHuman および ARKit ベースのキャラクター専用)は、事前定義されたポーズアセットに依存せずに 81 のフェイシャルコントロール変更 を生成するため、はるかにリアルなフェイシャルアニメーションが実現します。

キャラクター互換性

その名前にもかかわらず、Runtime MetaHuman Lip Sync はMetaHumanだけでなく、幅広いキャラクターに対応しています:

  • Daz Genesis 8/9 キャラクター
  • Reallusion Character Creator 3/4 (CC3/CC4) キャラクター
  • Mixamo キャラクター
  • ReadyPlayerMe アバター

アニメーション標準サポート

  • FACSベースのブレンドシェイプシステム
  • Apple ARKitブレンドシェイプ標準
  • Preston Blair音素セット
  • 3ds Maxの音素システム
  • 顔の表情用のカスタムモーフターゲットを持つ任意のキャラクター

MetaHuman以外のキャラクターでStandard Modelを使用する場合は、カスタムキャラクターセットアップガイドを参照してください。ARKitベースのキャラクターRealistic Modelsを使用する場合は、モーフターゲットセットの選択を参照してください。

アニメーションプレビュー

これらの短いアニメーションで、このプラグインが生成するリップシンクアニメーションの品質を、さまざまなキャラクタータイプとモデルにわたってご覧ください:

MetaHumanキャラクターを使用したリアルなモデル
標準モデルとMetaHumanキャラクター
標準モデルとカスタムキャラクター
標準モデルとカスタムキャラクター

主な特徴

リップシンクモデル

このプラグインは、さまざまなプロジェクトのニーズに合わせて複数のリップシンクモデルを提供しています:

標準のリップシンクモデルは、効率的なクロスプラットフォームパフォーマンスと幅広いキャラクター互換性を提供します:

  • MetaHumansおよびすべてのカスタムキャラクタータイプに対応
  • リアルタイムパフォーマンス向けに最適化
  • より低いリソース要件
  • プラットフォーム対応: Windows、Android、Androidベースのプラットフォーム(Meta Questを含む)
拡張プラグインが必要です

Standard Model を使用するには、追加の拡張プラグインをインストールする必要があります。インストール手順については、前提条件セクション を参照してください。

プロジェクトの要件に基づいて、パフォーマンス、キャラクターの互換性、ビジュアル品質、ターゲットプラットフォーム、機能のニーズに応じて適切なモデルを選択できます。

動作の仕組み

プラグインは、以下の方法でオーディオ入力を処理します。

  1. 音声データは、指定されたチャンネルサンプルレートを持つfloat PCM形式として受信されます。
  2. プラグインはオーディオを処理して、モデルに応じてフェイシャルコントロールデータまたは視素を生成します。
  3. ムード対応モデルでは、感情コンテキストがフェイシャルアニメーションに適用されます。
  4. アニメーションデータは、キャラクターのフェイシャルムーブメントをリアルタイムで駆動します。

パフォーマンスアーキテクチャ

Runtime MetaHuman Lip Sync はCPUのみの推論を使用し、リアルタイムアプリケーションに適した一貫性のある低遅延のリップシンク結果を提供します。デフォルトでは、プラグインは10ミリ秒ごとにリップシンク処理を実行します(調整可能。利用可能なすべての設定については、プラグイン設定を参照してください。そこにはProcessing Chunk Sizeスレッド数、その他のパフォーマンスパラメータが含まれます)。

モデルアーキテクチャ概要

リップシンクモデルは、メルスペクトログラム解析を通じて音声を処理する、コンパクトなトランスフォーマーベースのニューラルネットワークを使用しています。この軽量アーキテクチャは、効率的なCPU推論と最小限のメモリ使用量でリアルタイムパフォーマンスを実現するように特別に設計されています。

なぜCPU推論なのか?

小規模で頻繁な推論処理、例えばリアルタイムのリップシンクのようなケースでは、CPU処理の方がGPUよりも優れたレイテンシ特性を発揮します。バッチサイズ1で10〜100msの推論間隔の場合、PCIe転送やカーネル起動によるGPUのオーバーヘッドが、実際の計算時間を上回ることがよくあります。さらに、ゲームエンジンではGPUはすでにレンダリング、シェーダー、物理演算で飽和状態にあり、リソース競合を引き起こして、予測不可能なレイテンシのスパイクをもたらします。

ハードウェア互換性

このプラグインは、専用グラフィックスハードウェアを必要とせず、ほとんどのミッドレンジ以上のCPUで効率的に動作し、デスクトップ、モバイル、VRプラットフォーム全体でリアルタイム性能を提供します。性能の低いハードウェアでは、モデルタイプ準最適化 または 高度に最適化 に調整するか、処理チャンクサイズ を増やすことで、応答性がやや低下してもリアルタイム性能を維持できます。

クイックスタート

キャラクターでリップシンクを有効にするための基本的な設定は次のとおりです:

  1. MetaHuman キャラクターの場合は、セットアップガイドに従ってください。
  2. カスタムキャラクターの場合は、カスタムキャラクターセットアップガイドに従ってください。
  3. お好みのリップシンクモデルを選択して設定します
  4. Blueprint でオーディオ入力処理を設定します
  5. Animation Blueprint で適切なリップシンクノードを接続します
  6. オーディオを再生し、キャラクターが同期してアニメーションするのを確認します

オプションの目のアニメーション

このプラグインには、MetaHuman向けの自動まばたきおよび視線追跡用のオプションヘルパーも含まれています。これらはリップシンクとは独立しており、単体またはリップシンクの上にレイヤーとして重ねて使用できます。アイアニメーションヘルパーを参照してください。

追加リソース

📦 ダウンロードとリンク

デモプロジェクト:

すぐに使える2つのデモプロジェクトが用意されています。詳細、ダウンロード、ウォークスルーについては、専用のデモプロジェクトページをご覧ください:

両方のデモはクロスプラットフォーム(Windows、Mac、Linux、iOS、Android、Meta Quest)に対応しており、パッケージ版ビルドと完全なUE 5.6+ソースプロジェクトとして提供されます。

🎥 ビデオチュートリアル

注目のデモ:

リアルなモデル(高品質)チュートリアル:

標準モデルチュートリアル:

一般的なセットアップ:

💬 サポート

  • カスタム開発: [email protected] (チームおよび組織向けのオーダーメイドソリューション)
Join our Discord
online · support