Aller au contenu principal

Vue d'ensemble

Runtime MetaHuman Lip Sync Documentation

Runtime MetaHuman Lip Sync est un plugin qui permet la synchronisation labiale en temps réel, hors ligne et multiplateforme, pour les personnages MetaHuman et les personnages personnalisés. Il vous permet d’animer les lèvres d’un personnage en réponse à une entrée audio provenant de diverses sources, notamment :

Le plugin génère en interne des visèmes (représentations visuelles des phonèmes) à partir de l'entrée audio. Puisqu'il travaille directement sur les données audio plutôt que sur le texte, le plugin prend en charge les entrées multilingues, notamment (mais sans s'y limiter) l'anglais, l'espagnol, le français, l'allemand, le japonais, le chinois, le coréen, le russe, l'italien, le portugais, l'arabe et l'hindi. Littéralement, toutes les langues sont prises en charge car la synchronisation labiale est générée à partir des phonèmes audio plutôt que d'un traitement textuel spécifique à la langue.

Le Standard Model produit 14 visèmes et effectue une animation de synchronisation labiale à l’aide d’un asset de pose prédéfini. En revanche, les Realistic Models (exclusifs aux personnages MetaHuman et à ceux basés sur ARKit) génèrent 81 changements de contrôle facial sans s’appuyer sur un asset de pose prédéfini, ce qui donne des animations faciales nettement plus réalistes.

Compatibilité des personnages

Malgré son nom, Runtime MetaHuman Lip Sync fonctionne avec un large éventail de personnages au-delà des seuls MetaHumans :

  • Daz Genesis 8/9 personnages
  • Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) personnages
  • Mixamo personnages

Prise en charge des normes d’animation

  • Systèmes de blendshapes basés sur FACS
  • Standard de blendshapes Apple ARKit
  • Ensembles de phonèmes de Preston Blair
  • Systèmes de phonèmes 3ds Max
  • Tout personnage doté de cibles de morphing personnalisées pour les expressions faciales

De nombreux systèmes populaires, notamment Reallusion CC4/CC5 et Daz Genesis 8.1/9, peuvent également être convertis pour utiliser des noms de blendshapes conformes au standard ARKit. Cela vous permet d'utiliser le Realistic Model pour ces personnages, avec son animation faciale de meilleure qualité, en alternative au mappage manuel des visèmes du Standard Model. Voir Conversion de personnages en blendshapes ARKit pour plus de détails.

Pour les personnages non‑MetaHuman utilisant le Standard Model, reportez‑vous au Guide de configuration des personnages personnalisés. Pour les personnages basés sur ARKit utilisant les Realistic Models, reportez‑vous à Sélection du jeu de cibles de morphing.

Aperçu de l'animation

Découvrez ces courtes animations pour juger de la qualité de l’animation de synchronisation labiale produite par le plugin sur différents types de personnages et modèles :

Modèle réaliste avec personnage MetaHuman
Modèle standard avec personnage MetaHuman
Modèle standard avec personnage personnalisé
Modèle standard avec personnage personnalisé

Fonctionnalités clés

Modèles Lip Sync

Le plugin propose plusieurs modèles de synchronisation labiale pour répondre aux différents besoins des projets :

Le modèle de synchronisation labiale standard offre des performances efficaces et multiplateformes, avec une large compatibilité avec les personnages :

  • Fonctionne avec les MetaHumans et tous les types de personnages personnalisés
  • Optimisé pour les performances en temps réel
  • Exigences réduites en ressources
  • Prise en charge des plateformes : Windows, Android, plateformes basées sur Android (y compris Meta Quest)
Plugin d'extension requis

Pour utiliser le Modèle standard, vous devez installer un plugin d'extension supplémentaire. Consultez la section Prérequis pour les instructions d'installation.

Vous pouvez choisir le modèle approprié en fonction des exigences de votre projet en matière de performances, de compatibilité des personnages, de qualité visuelle, de plateforme cible et de besoins fonctionnels.

Comment ça marche

Le plugin traite l’entrée audio de la manière suivante :

  1. Les données audio sont reçues en format PCM float avec des canaux et une fréquence d'échantillonnage spécifiés.
  2. Le plugin traite l'audio pour générer des données de contrôle facial ou des visèmes selon le modèle.
  3. Pour les modèles compatibles avec l'humeur, le contexte émotionnel est appliqué à l'animation faciale.
  4. Les données d'animation pilotent les mouvements faciaux du personnage en temps réel.

Architecture de performance

Runtime MetaHuman Lip Sync utilise une inférence uniquement sur CPU pour fournir des résultats de synchronisation labiale cohérents et à faible latence, adaptés aux applications en temps réel. Par défaut, le plugin effectue le traitement de synchronisation labiale toutes les 10 millisecondes (réglable - voir Configuration du plugin pour tous les paramètres disponibles, y compris Taille du bloc de traitement, nombre de threads et d'autres paramètres de performance).

Vue d’ensemble de l’architecture du modèle

Les modèles de synchronisation labiale utilisent un réseau neuronal compact basé sur un transformer qui traite l’audio par analyse de spectrogrammes MEL. Cette architecture légère est spécifiquement conçue pour des performances en temps réel, avec une inférence CPU efficace et une empreinte mémoire minimale.

Pourquoi l'inférence CPU ?

Pour les opérations d'inférence petites et fréquentes comme la synchronisation labiale en temps réel, le traitement CPU offre de meilleures caractéristiques de latence que le GPU. Avec une taille de lot de 1 et des intervalles d'inférence de 10 à 100 ms, la surcharge du GPU due aux transferts PCIe et aux lancements de noyaux dépasse souvent le temps de calcul réel. De plus, dans les moteurs de jeu, le GPU est déjà saturé par le rendu, les shaders et la physique, ce qui crée une contention des ressources introduisant des pics de latence imprévisibles.

Compatibilité matérielle

Le plugin fonctionne efficacement sur la plupart des processeurs de milieu de gamme et supérieurs, sans nécessiter de matériel graphique dédié, offrant des performances en temps réel sur les plateformes de bureau, mobiles et VR. Pour les matériels plus faibles, vous pouvez régler le Type de modèle sur Semi-Optimized ou Highly Optimized, ou augmenter la Taille des segments de traitement pour maintenir des performances en temps réel avec une réactivité légèrement réduite.

Démarrage rapide

Voici une configuration de base pour activer la synchronisation labiale sur votre personnage :

  1. Pour les personnages MetaHuman, suivez le Guide de configuration
  2. Pour les personnages personnalisés, suivez le Guide de configuration des personnages personnalisés
  3. Choisissez et configurez votre modèle de synchronisation labiale préféré.
  4. Configurez le traitement de l’entrée audio dans votre Blueprint.
  5. Connectez le nœud de synchronisation labiale approprié dans l’Animation Blueprint.
  6. Jouez l’audio et observez votre personnage s’animer en synchronisation.

Animation oculaire optionnelle

Le plugin inclut également des aides optionnelles pour le clignement automatique et le suivi du regard sur les MetaHumans. Elles sont indépendantes de la synchro labiale et peuvent être utilisées seules ou superposées à celle-ci. Voir Aides d’animation des yeux.

Ressources supplémentaires

📦 Téléchargements & Liens

Projets de démonstration :

Deux projets de démonstration prêts à l’emploi sont disponibles – consultez la page dédiée Projets de démonstration pour tous les détails, les téléchargements et les procédures pas à pas :

Les deux démos sont multiplateformes (Windows, Mac, Linux, iOS, Android, Meta Quest) et sont fournies sous forme de builds packagés et de projets source complets UE 5.6+.

🎥 Tutoriels vidéo

Démos en vedette :

Tutoriels pour le modèle réaliste (haute qualité) :

Tutoriels du modèle standard :

Configuration générale :

💬 Assistance

  • Développement personnalisé : [email protected] (solutions sur mesure pour équipes et organisations)
Join our Discord
online · support