Aller au contenu principal

Configuration du plugin

Configuration du modèle

Recréez des générateurs de modèles réalistes pour chaque lecture

Pour un fonctionnement fiable avec les modèles Realistic et Mood-Enabled Realistic, recréez le générateur avant chaque nouvelle lecture audio plutôt que de le réutiliser pendant de longues périodes de silence. Consultez Recréation du générateur dans Dépannage pour plus de détails.

Configuration du modèle standard

Le nœud Create Runtime Viseme Generator utilise des paramètres par défaut qui fonctionnent bien dans la plupart des scénarios. La configuration est gérée via les propriétés du nœud de blend de l'Animation Blueprint.

Pour les options de configuration d'Animation Blueprint, consultez la section Configuration de la synchronisation labiale ci-dessous.

Configuration de modèle réaliste

Le nœud Create Realistic MetaHuman Lip Sync Generator accepte un paramètre Configuration facultatif qui vous permet de personnaliser le comportement du générateur :

Type de modèle

Le paramètre Type de modèle détermine quelle version du modèle réaliste utiliser :

Type de modèlePerformancesQualité visuelleGestion du bruitCas d'utilisation recommandés
Très optimisé (par défaut)Performances maximales, utilisation CPU la plus faibleBonne qualitéPeut présenter des mouvements de bouche visibles avec un bruit de fond ou des sons non vocauxEnvironnements audio propres, scénarios critiques en termes de performances
Semi-optimiséBonnes performances, utilisation CPU modéréeHaute qualitéMeilleure stabilité avec un audio bruyantÉquilibre entre performances et qualité, conditions audio mixtes
OriginalAdapté à une utilisation en temps réel sur les CPU modernesQualité la plus élevéeLe plus stable avec un bruit de fond et des sons non vocauxProductions de haute qualité, environnements audio bruyants, lorsqu'une précision maximale est requise

Paramètres de performance

Threads intra-op : Contrôle le nombre de threads utilisés pour les opérations internes de traitement du modèle.

  • 0 (Défaut/Automatique) : Utilise la détection automatique (généralement 1/4 des cœurs CPU disponibles, maximum 4)
  • 1-16 : Spécifiez manuellement le nombre de threads. Des valeurs plus élevées peuvent améliorer les performances sur les systèmes multicœurs mais utilisent plus de CPU.

Inter Op Threads : Contrôle le nombre de threads utilisés pour l'exécution parallèle de différentes opérations du modèle.

  • 0 (Défaut/Automatique) : Utilise la détection automatique (généralement 1/8 des cœurs CPU disponibles, maximum 2)
  • 1-8 : Spécifier manuellement le nombre de threads. Généralement maintenu bas pour le traitement en temps réel

Taille des blocs de traitement

La taille de bloc de traitement détermine combien d’échantillons sont traités à chaque étape d’inférence. La valeur par défaut est 160 échantillons (10 ms d’audio à 16 kHz) :

  • Des valeurs plus petites fournissent des mises à jour plus fréquentes mais augmentent l'utilisation du CPU
  • Des valeurs plus grandes réduisent la charge du CPU mais peuvent diminuer la réactivité de la synchro labiale
  • Il est recommandé d'utiliser des multiples de 160 pour un alignement optimal

Setting Processing Chunk Size

Configuration du modèle activée par l'humeur

Le nœud Create Realistic MetaHuman Lip Sync With Mood Generator fournit des options de configuration supplémentaires au-delà du modèle réaliste de base :

Configuration de base

Anticipation (ms) : Délai d'anticipation en millisecondes pour une meilleure précision de la synchronisation labiale.

  • Par défaut: 80ms
  • Plage: 20ms à 200ms (doit être divisible par 20)
  • Des valeurs plus élevées offrent une meilleure synchronisation mais augmentent la latence.

Type de sortie : Détermine quels contrôles faciaux sont générés.

  • Visage complet : Les 81 contrôles faciaux (sourcils, yeux, nez, bouche, mâchoire, langue)
  • Bouche uniquement : Uniquement les contrôles liés à la bouche, à la mâchoire et à la langue.

Paramètres de performance : Utilise les mêmes paramètres Intra Op Threads et Inter Op Threads que le modèle réaliste standard.

Paramètres d’humeur

Humeurs disponibles :

  • Neutre, Heureux, Triste, Dégoût, Colère, Surprise, Peur
  • Confiant, Excité, Ennuyé, Espiègle, Confus

Intensité de l'humeur : Contrôle à quel point l'humeur affecte l'animation (0.0 à 1.0)

Contrôle de l’humeur à l’exécution

Vous pouvez ajuster les paramètres d'humeur pendant l'exécution à l'aide des fonctions suivantes :

  • Définir l'humeur: Changer le type d'humeur actuel
  • Définir l'intensité de l'humeur: Ajuster la force avec laquelle l'humeur affecte l'animation (0.0 à 1.0)
  • Définir le lookahead ms: Modifier le timing de lookahead pour la synchronisation
  • Définir le type de sortie: Basculer entre les contrôles Visage complet et Bouche seule

Mood Configuration

Guide de sélection de l’humeur

Choisissez les humeurs appropriées en fonction de votre contenu :

MoodIdéal pourPlage d'intensité typique
NeutreConversation générale, narration, état par défaut0.5 - 1.0
HeureuxContenu positif, dialogue joyeux, célébrations0.6 - 1.0
TristeContenu mélancolique, scènes émouvantes, moments sombres0.5 - 0.9
DégoûtRéactions négatives, contenu déplaisant, rejet0.4 - 0.8
ColèreDialogue agressif, scènes de confrontation, frustration0.6 - 1.0
SurpriseÉvénements inattendus, révélations, réactions de choc0.7 - 1.0
PeurSituations menaçantes, anxiété, dialogue nerveux0.5 - 0.9
ConfiantPrésentations professionnelles, dialogue de leadership, discours affirmé0.7 - 1.0
ExcitéContenu énergique, annonces, dialogue enthousiaste0.8 - 1.0
EnnuyéContenu monotone, dialogue désintéressé, discours fatigué0.3 - 0.7
EnjouéConversation décontractée, humour, interactions légères0.6 - 0.9
ConfusDialogue riche en questions, incertitude, perplexité0.4 - 0.8

Configuration Animation Blueprint

Configuration de la synchronisation labiale

Le nœud Blend Runtime MetaHuman Lip Sync possède des options de configuration dans son panneau de propriétés :

PropriétéPar défautDescription
Vitesse d'interpolation25Contrôle la vitesse à laquelle les mouvements des lèvres passent d'un visème à l'autre. Des valeurs plus élevées entraînent des transitions plus rapides et plus brusques.
Temps de réinitialisation0.2La durée en secondes après laquelle la synchronisation labiale est réinitialisée. Cela est utile pour empêcher la synchronisation labiale de continuer après l'arrêt de l'audio.

Animation de rire

Vous pouvez également ajouter des animations de rire qui répondront dynamiquement aux rires détectés dans l’audio :

  1. Ajoutez le nœud Blend Runtime MetaHuman Laughter
  2. Connectez votre variable RuntimeVisemeGenerator à la broche Viseme Generator
  3. Si vous utilisez déjà la synchro labiale :
    • Connectez la sortie du nœud Blend Runtime MetaHuman Lip Sync à la broche Source Pose du nœud Blend Runtime MetaHuman Laughter
    • Connectez la sortie du nœud Blend Runtime MetaHuman Laughter à la broche Result du nœud Output Pose
  4. Si vous utilisez uniquement le rire sans synchronisation labiale :
    • Connectez votre pose source directement à la Source Pose du nœud Blend Runtime MetaHuman Laughter
    • Connectez la sortie à la broche Result

Blend Runtime MetaHuman Laughter

Lorsque des rires sont détectés dans l'audio, votre personnage s'animera dynamiquement en conséquence :

Configuration du rire

Le nœud Blend Runtime MetaHuman Laughter possède ses propres options de configuration :

PropriétéDéfautDescription
Vitesse d'interpolation25Contrôle la vitesse à laquelle les mouvements des lèvres passent d'une animation de rire à l'autre. Des valeurs plus élevées entraînent des transitions plus rapides et plus abruptes.
Temps de réinitialisation0.2La durée en secondes après laquelle le rire est réinitialisé. Cela permet d'éviter que le rire se poursuive après l'arrêt de l'audio.
Poids maximal du rire0.7Ajuste l'intensité maximale de l'animation de rire (0.0 - 1.0).

Remarque : La détection du rire n’est actuellement disponible qu’avec le modèle standard.

Combinaison avec les animations existantes

Tutoriel vidéo

Vous préférez regarder plutôt que lire ? Consultez le tutoriel vidéo couvrant cette configuration exacte.

Pour appliquer la synchronisation labiale et les rires en plus des animations corporelles existantes et des animations faciales personnalisées sans les remplacer :

Animations du corps

Cette configuration s’applique à l’Animation Blueprint du visage, car la synchronisation labiale ne fait pas partie de l’Animation Blueprint du corps. Pour les animations de corps personnalisées (par ex. torse, bras et autres mouvements du corps), connectez simplement votre séquence d’animation (via un Sequence Player) directement à la pose de sortie dans l’Animation Blueprint du corps. Aucune configuration supplémentaire n’est nécessaire à cet endroit.

  1. Ajoutez un nœud Layered blend per bone entre vos animations corporelles et la sortie finale. Assurez-vous que Use Attached Parent est défini sur vrai.
  2. Configurez la configuration des couches :
    • Ajouter 1 élément au tableau Layer Setup
    • Ajouter 3 éléments aux Branch Filters pour la couche, avec les Bone Name suivants :
      • FACIAL_C_FacialRoot
      • FACIAL_C_Neck2Root
      • FACIAL_C_Neck1Root
  3. Important pour les animations faciales personnalisées : Dans l'Option de fusion de courbes, sélectionnez "Utiliser la valeur maximale". Cela permet aux animations faciales personnalisées (expressions, émotions, etc.) d'être correctement superposées au lip sync.
  4. Faites les connexions :
    • Votre animation personnalisée (généralement un Sequence Player avec l'asset de séquence d'animation souhaité) → entrée Base Pose
    • Sortie d'animation faciale (provenant des nœuds de synchro labiale et/ou de rire) → entrée Blend Poses 0
    • Nœud de blend en couches → pose finale Result

Layered Blend Per Bone

Sélection de l'ensemble de cibles de morphing

Le Standard Model utilise des ressources de pose qui prennent en charge nativement toute convention de nommage des cibles de morphing via la configuration personnalisée des ressources de pose. Aucune configuration supplémentaire n'est nécessaire.

Réglage fin du comportement de la synchronisation labiale

Mise à l’échelle de courbes Lip Sync spécifiques

Vous pouvez atténuer (ou amplifier) les mouvements faciaux individuels produits par la synchro labiale à l'aide d'un nœud Modify Curve. Cela est utile lorsqu'une courbe particulière semble trop prononcée pour votre contenu audio ou votre personnage.

Configuration :

  1. Après votre nœud de blend de lip sync, ajoutez un nœud Modify Curve
  2. Faites un clic droit sur le nœud, sélectionnez Add Curve Pin, puis saisissez le nom de la courbe que vous souhaitez mettre à l’échelle
  3. Définissez la propriété Apply Mode du nœud sur Scale
  4. Définissez le paramètre Value : les valeurs inférieures à 1.0 atténuent le mouvement, les valeurs supérieures à 1.0 l’amplifient (par exemple, 0.8 = 20 % de réduction)

Courbes couramment mises à l'échelle :

Nom de la courbeObjectifS'applique àAjustement typique
CTRL_expressions_tongueOutProtrusion de la langue vers l'avant pendant certains phonèmesModèle standard0.8 pour réduire la protrusion
CTRL_expressions_jawOpenAmplitude d'ouverture de la mâchoireModèles réalistes0.9 pour réduire le mouvement de la mâchoire

Vous pouvez ajouter plusieurs broches de courbe au même nœud Modify Curve pour mettre à l’échelle plusieurs courbes à la fois.

Réglage fin spécifique à l’humeur

Pour les modèles compatibles avec les humeurs, vous pouvez affiner des expressions émotionnelles spécifiques :

Contrôle des sourcils :

  • CTRL_expressions_browRaiseInL / CTRL_expressions_browRaiseInR - Haussement du sourcil interne
  • CTRL_expressions_browRaiseOuterL / CTRL_expressions_browRaiseOuterR - Haussement du sourcil externe
  • CTRL_expressions_browDownL / CTRL_expressions_browDownR - Abaissement du sourcil

Contrôle de l’expression des yeux :

  • CTRL_expressions_eyeSquintInnerL / CTRL_expressions_eyeSquintInnerR - Plissement des yeux
  • CTRL_expressions_eyeCheekRaiseL / CTRL_expressions_eyeCheekRaiseR - Élévation des joues

Comparaison et sélection de modèles

Choisir entre les modèles

Lorsque vous décidez quel modèle de synchronisation labiale utiliser pour votre projet, tenez compte des facteurs suivants :

ConsidérationModèle standardModèle réalisteModèle réaliste avec humeurs
Compatibilité des personnagesMetaHumans et tous les types de personnages personnalisésPersonnages MetaHumans (et ARKit)Personnages MetaHumans (et ARKit)
Qualité visuelleBonne synchro labiale avec des performances efficacesRéalisme amélioré avec des mouvements de bouche plus naturelsRéalisme amélioré avec des expressions émotionnelles
PerformancesOptimisé pour toutes les plateformes, y compris mobile/VRExigences de ressources plus élevéesExigences de ressources plus élevées
Fonctionnalités14 visèmes, détection du rire81 contrôles faciaux, 3 niveaux d'optimisation81 contrôles faciaux, 12 humeurs, sortie configurable
Prise en charge des plateformesWindows, Android, QuestWindows, Mac, iOS, Linux, Android, QuestWindows, Mac, iOS, Linux, Android, Quest
Cas d'utilisationApplications générales, jeux, VR/AR, mobileExpériences cinématiques, interactions rapprochéesNarration émotionnelle, interaction avancée avec les personnages

Compatibilité des versions du moteur

Problème de compatibilité UE 5.2

Si vous utilisez Unreal Engine 5.2, les modèles réalistes peuvent ne pas fonctionner correctement en raison d'un bug dans la bibliothèque de rééchantillonnage d'UE. Pour les utilisateurs d'UE 5.2 qui ont besoin d'une synchronisation labiale fiable, veuillez utiliser le Modèle standard à la place.

Ce problème est spécifique à UE 5.2 et n'affecte pas les autres versions du moteur.

Recommandations de performance

  • Pour la plupart des projets, le Standard Model offre un excellent équilibre entre qualité et performance
  • Utilisez le Realistic Model lorsque vous avez besoin de la plus haute fidélité visuelle pour les personnages MetaHuman
  • Utilisez le Mood-Enabled Realistic Model lorsque le contrôle de l'expression émotionnelle est important pour votre application
  • Tenez compte des capacités de performance de votre plateforme cible lors du choix entre les modèles
  • Testez différents niveaux d'optimisation pour trouver le meilleur équilibre pour votre cas d'utilisation spécifique

Dépannage

Problèmes courants

Recréation du générateur pour les modèles réalistes : Pour un fonctionnement fiable et cohérent avec les modèles réalistes, il est recommandé de recréer le générateur à chaque fois que vous souhaitez fournir de nouvelles données audio après une période d'inactivité. Cela est dû au comportement d'ONNX runtime qui peut entraîner l'arrêt de la synchronisation labiale lors de la réutilisation des générateurs après des périodes de silence.

Par exemple, vous pourriez recréer le générateur de lip sync à chaque démarrage de la lecture, par exemple lorsque vous appelez Play Sound 2D ou utilisez toute autre méthode pour lancer la lecture audio et la synchronisation labiale :

Recreate Lip Sync Generator On Play Sound

Emplacement du plugin pour l’intégration de Runtime Text To Speech : Lorsque vous utilisez Runtime MetaHuman Lip Sync avec Runtime Text To Speech (les deux plugins utilisent ONNX Runtime), vous pouvez rencontrer des problèmes si les plugins sont installés dans le dossier Marketplace du moteur. Pour corriger cela :

  1. Localisez les deux plugins dans votre dossier d'installation d'UE sous \Engine\Plugins\Marketplace (par exemple, C:\Program Files\Epic Games\UE_5.6\Engine\Plugins\Marketplace)
  2. Déplacez les dossiers RuntimeMetaHumanLipSync et RuntimeTextToSpeech vers le dossier Plugins de votre projet.
  3. Si votre projet n'a pas de dossier Plugins, créez-en un dans le même répertoire que votre fichier .uproject.
  4. Redémarrez Unreal Editor.

Cela résout les problèmes de compatibilité qui peuvent survenir lorsque plusieurs plugins basés sur ONNX Runtime sont chargés depuis le dossier Marketplace du moteur.

Configuration de packaging (Windows) : Si la synchronisation labiale ne fonctionne pas correctement dans votre projet empaqueté sur Windows, assurez-vous d'utiliser la configuration de build Shipping plutôt que Development. La configuration Development peut causer des problèmes avec le runtime ONNX des modèles réalistes dans les builds empaquetés.

Pour corriger ceci :

  1. Dans vos Paramètres du projet → Packaging, définissez la Configuration de build sur Shipping
  2. Repackez votre projet

Shipping Configuration

Projets Blueprint uniquement

Dans certains projets Blueprint-only, Unreal Engine peut encore compiler en configuration Development même lorsque Shipping est sélectionné. Si cela se produit, convertissez votre projet en projet C++ en ajoutant au moins une classe C++ (elle peut être vide). Pour cela, allez dans Outils → Nouvelle classe C++ dans le menu de l'éditeur UE et créez une classe vide. Cela forcera le projet à compiler correctement en configuration Shipping. Votre projet peut rester fonctionnellement Blueprint-only ; la classe C++ est simplement nécessaire pour une configuration de build correcte.

Dégradation de la réactivité de la synchro labiale :

Si vous constatez que la synchro labiale devient moins réactive au fil du temps lors de l’utilisation de Streaming Sound Wave ou de Capturable Sound Wave, cela peut être dû à une accumulation de mémoire. Par défaut, la mémoire est réallouée à chaque fois qu’un nouvel audio est ajouté. Pour éviter ce problème, appelez périodiquement la fonction ReleaseMemory afin de libérer la mémoire accumulée, par exemple toutes les 30 secondes environ.

Optimisation des performances :

  • Ajuster la taille des blocs de traitement pour les modèles Realistic en fonction de vos exigences de performance.
  • Utiliser des nombres de threads appropriés pour votre matériel cible.
  • Envisager d'utiliser le type de sortie Mouth Only pour les modèles prenant en charge l'humeur lorsque l'animation faciale complète n'est pas nécessaire.