Configuration du plugin
Configuration du modèle
Pour un fonctionnement fiable avec les modèles Realistic et Mood-Enabled Realistic, recréez le générateur avant chaque nouvelle lecture audio plutôt que de le réutiliser pendant de longues périodes de silence. Consultez Recréation du générateur dans Dépannage pour plus de détails.
Configuration du modèle standard
Le nœud Create Runtime Viseme Generator utilise des paramètres par défaut qui fonctionnent bien dans la plupart des scénarios. La configuration est gérée via les propriétés du nœud de blend de l'Animation Blueprint.
Pour les options de configuration d'Animation Blueprint, consultez la section Configuration de la synchronisation labiale ci-dessous.
Configuration de modèle réaliste
Le nœud Create Realistic MetaHuman Lip Sync Generator accepte un paramètre Configuration facultatif qui vous permet de personnaliser le comportement du générateur :
Type de modèle
Le paramètre Type de modèle détermine quelle version du modèle réaliste utiliser :
| Type de modèle | Performances | Qualité visuelle | Gestion du bruit | Cas d'utilisation recommandés |
|---|---|---|---|---|
| Très optimisé (par défaut) | Performances maximales, utilisation CPU la plus faible | Bonne qualité | Peut présenter des mouvements de bouche visibles avec un bruit de fond ou des sons non vocaux | Environnements audio propres, scénarios critiques en termes de performances |
| Semi-optimisé | Bonnes performances, utilisation CPU modérée | Haute qualité | Meilleure stabilité avec un audio bruyant | Équilibre entre performances et qualité, conditions audio mixtes |
| Original | Adapté à une utilisation en temps réel sur les CPU modernes | Qualité la plus élevée | Le plus stable avec un bruit de fond et des sons non vocaux | Productions de haute qualité, environnements audio bruyants, lorsqu'une précision maximale est requise |
Paramètres de performance
Threads intra-op : Contrôle le nombre de threads utilisés pour les opérations internes de traitement du modèle.
- 0 (Défaut/Automatique) : Utilise la détection automatique (généralement 1/4 des cœurs CPU disponibles, maximum 4)
- 1-16 : Spécifiez manuellement le nombre de threads. Des valeurs plus élevées peuvent améliorer les performances sur les systèmes multicœurs mais utilisent plus de CPU.
Inter Op Threads : Contrôle le nombre de threads utilisés pour l'exécution parallèle de différentes opérations du modèle.
- 0 (Défaut/Automatique) : Utilise la détection automatique (généralement 1/8 des cœurs CPU disponibles, maximum 2)
- 1-8 : Spécifier manuellement le nombre de threads. Généralement maintenu bas pour le traitement en temps réel
Taille des blocs de traitement
La taille de bloc de traitement détermine combien d’échantillons sont traités à chaque étape d’inférence. La valeur par défaut est 160 échantillons (10 ms d’audio à 16 kHz) :
- Des valeurs plus petites fournissent des mises à jour plus fréquentes mais augmentent l'utilisation du CPU
- Des valeurs plus grandes réduisent la charge du CPU mais peuvent diminuer la réactivité de la synchro labiale
- Il est recommandé d'utiliser des multiples de 160 pour un alignement optimal

Configuration du modèle activée par l'humeur
Le nœud Create Realistic MetaHuman Lip Sync With Mood Generator fournit des options de configuration supplémentaires au-delà du modèle réaliste de base :
Configuration de base
Anticipation (ms) : Délai d'anticipation en millisecondes pour une meilleure précision de la synchronisation labiale.
- Par défaut: 80ms
- Plage: 20ms à 200ms (doit être divisible par 20)
- Des valeurs plus élevées offrent une meilleure synchronisation mais augmentent la latence.
Type de sortie : Détermine quels contrôles faciaux sont générés.
- Visage complet : Les 81 contrôles faciaux (sourcils, yeux, nez, bouche, mâchoire, langue)
- Bouche uniquement : Uniquement les contrôles liés à la bouche, à la mâchoire et à la langue.
Paramètres de performance : Utilise les mêmes paramètres Intra Op Threads et Inter Op Threads que le modèle réaliste standard.
Paramètres d’humeur
Humeurs disponibles :
- Neutre, Heureux, Triste, Dégoût, Colère, Surprise, Peur
- Confiant, Excité, Ennuyé, Espiègle, Confus
Intensité de l'humeur : Contrôle à quel point l'humeur affecte l'animation (0.0 à 1.0)
Contrôle de l’humeur à l’exécution
Vous pouvez ajuster les paramètres d'humeur pendant l'exécution à l'aide des fonctions suivantes :
- Définir l'humeur: Changer le type d'humeur actuel
- Définir l'intensité de l'humeur: Ajuster la force avec laquelle l'humeur affecte l'animation (0.0 à 1.0)
- Définir le lookahead ms: Modifier le timing de lookahead pour la synchronisation
- Définir le type de sortie: Basculer entre les contrôles Visage complet et Bouche seule

Guide de sélection de l’humeur
Choisissez les humeurs appropriées en fonction de votre contenu :
| Mood | Idéal pour | Plage d'intensité typique |
|---|---|---|
| Neutre | Conversation générale, narration, état par défaut | 0.5 - 1.0 |
| Heureux | Contenu positif, dialogue joyeux, célébrations | 0.6 - 1.0 |
| Triste | Contenu mélancolique, scènes émouvantes, moments sombres | 0.5 - 0.9 |
| Dégoût | Réactions négatives, contenu déplaisant, rejet | 0.4 - 0.8 |
| Colère | Dialogue agressif, scènes de confrontation, frustration | 0.6 - 1.0 |
| Surprise | Événements inattendus, révélations, réactions de choc | 0.7 - 1.0 |
| Peur | Situations menaçantes, anxiété, dialogue nerveux | 0.5 - 0.9 |
| Confiant | Présentations professionnelles, dialogue de leadership, discours affirmé | 0.7 - 1.0 |
| Excité | Contenu énergique, annonces, dialogue enthousiaste | 0.8 - 1.0 |
| Ennuyé | Contenu monotone, dialogue désintéressé, discours fatigué | 0.3 - 0.7 |
| Enjoué | Conversation décontractée, humour, interactions légères | 0.6 - 0.9 |
| Confus | Dialogue riche en questions, incertitude, perplexité | 0.4 - 0.8 |
Configuration Animation Blueprint
Configuration de la synchronisation labiale
- Modèle standard
- Modèles réalistes
Le nœud Blend Runtime MetaHuman Lip Sync possède des options de configuration dans son panneau de propriétés :
| Propriété | Par défaut | Description |
|---|---|---|
| Vitesse d'interpolation | 25 | Contrôle la vitesse à laquelle les mouvements des lèvres passent d'un visème à l'autre. Des valeurs plus élevées entraînent des transitions plus rapides et plus brusques. |
| Temps de réinitialisation | 0.2 | La durée en secondes après laquelle la synchronisation labiale est réinitialisée. Cela est utile pour empêcher la synchronisation labiale de continuer après l'arrêt de l'audio. |
Animation de rire
Vous pouvez également ajouter des animations de rire qui répondront dynamiquement aux rires détectés dans l’audio :
- Ajoutez le nœud
Blend Runtime MetaHuman Laughter - Connectez votre variable
RuntimeVisemeGeneratorà la brocheViseme Generator - Si vous utilisez déjà la synchro labiale :
- Connectez la sortie du nœud
Blend Runtime MetaHuman Lip Syncà la brocheSource Posedu nœudBlend Runtime MetaHuman Laughter - Connectez la sortie du nœud
Blend Runtime MetaHuman Laughterà la brocheResultdu nœudOutput Pose
- Connectez la sortie du nœud
- Si vous utilisez uniquement le rire sans synchronisation labiale :
- Connectez votre pose source directement à la
Source Posedu nœudBlend Runtime MetaHuman Laughter - Connectez la sortie à la broche
Result
- Connectez votre pose source directement à la

Lorsque des rires sont détectés dans l'audio, votre personnage s'animera dynamiquement en conséquence :
Configuration du rire
Le nœud Blend Runtime MetaHuman Laughter possède ses propres options de configuration :
| Propriété | Défaut | Description |
|---|---|---|
| Vitesse d'interpolation | 25 | Contrôle la vitesse à laquelle les mouvements des lèvres passent d'une animation de rire à l'autre. Des valeurs plus élevées entraînent des transitions plus rapides et plus abruptes. |
| Temps de réinitialisation | 0.2 | La durée en secondes après laquelle le rire est réinitialisé. Cela permet d'éviter que le rire se poursuive après l'arrêt de l'audio. |
| Poids maximal du rire | 0.7 | Ajuste l'intensité maximale de l'animation de rire (0.0 - 1.0). |
Remarque : La détection du rire n’est actuellement disponible qu’avec le modèle standard.
Le nœud Blend Realistic MetaHuman Lip Sync dispose d'options de configuration dans son panneau de propriétés :
| Propriété | Défaut | Description |
|---|---|---|
| Vitesse d'interpolation | 30 | Contrôle la vitesse de transition des expressions faciales pendant la parole active. Des valeurs plus élevées entraînent des transitions plus rapides et plus brusques. |
| Vitesse d'interpolation au repos | 15 | Contrôle la vitesse à laquelle les expressions faciales reviennent à l'état de repos/neutre. Des valeurs plus faibles produisent des retours plus doux et plus progressifs vers la pose de repos. |
| Temps de réinitialisation | 0.2 | Durée en secondes après laquelle la synchronisation labiale revient à l'état de repos. Utile pour empêcher les expressions de se poursuivre après l'arrêt de l'audio. |
| Préserver l'état de repos | false | Lorsqu'elle est activée, préserve le dernier état émotionnel pendant les périodes de repos au lieu de revenir à l'état neutre. |
| Préserver les expressions des yeux | true | Contrôle si les contrôles faciaux liés aux yeux sont préservés pendant l'état de repos. Efficace uniquement lorsque « Préserver l'état de repos » est activé. |
| Préserver les expressions des sourcils | true | Contrôle si les contrôles faciaux liés aux sourcils sont préservés pendant l'état de repos. Efficace uniquement lorsque « Préserver l'état de repos » est activé. |
| Préserver la forme de la bouche | false | Contrôle si les contrôles de la forme de la bouche (à l'exclusion des mouvements spécifiques à la parole comme la langue et la mâchoire) sont préservés pendant l'état de repos. Efficace uniquement lorsque « Préserver l'état de repos » est activé. |
Préservation de l'état inactif
La fonctionnalité Préserver l’état de repos explique comment le modèle Realistic gère les périodes de silence. Contrairement au modèle Standard, qui utilise des visèmes discrets et revient systématiquement à des valeurs nulles pendant le silence, le réseau neuronal du modèle Realistic peut conserver un subtil positionnement du visage qui diffère de la pose de repos par défaut du MetaHuman.
Quand activer :
- Maintenir les expressions émotionnelles entre les segments de parole
- Préserver les traits de personnalité du personnage
- Assurer la continuité visuelle dans les séquences cinématiques
Options de contrôle régionales :
- Expressions des yeux : Préserve le plissement, l’élargissement et le positionnement des paupières
- Expressions des sourcils : Maintient le positionnement des sourcils et du front
- Forme de la bouche : Conserve la courbure générale de la bouche tout en permettant aux mouvements de parole (langue, mâchoire) de se réinitialiser.
Combinaison avec les animations existantes
Vous préférez regarder plutôt que lire ? Consultez le tutoriel vidéo couvrant cette configuration exacte.
Pour appliquer la synchronisation labiale et les rires en plus des animations corporelles existantes et des animations faciales personnalisées sans les remplacer :
Cette configuration s’applique à l’Animation Blueprint du visage, car la synchronisation labiale ne fait pas partie de l’Animation Blueprint du corps. Pour les animations de corps personnalisées (par ex. torse, bras et autres mouvements du corps), connectez simplement votre séquence d’animation (via un Sequence Player) directement à la pose de sortie dans l’Animation Blueprint du corps. Aucune configuration supplémentaire n’est nécessaire à cet endroit.
- Ajoutez un nœud
Layered blend per boneentre vos animations corporelles et la sortie finale. Assurez-vous queUse Attached Parentest défini sur vrai. - Configurez la configuration des couches :
- Ajouter 1 élément au tableau
Layer Setup - Ajouter 3 éléments aux
Branch Filterspour la couche, avec lesBone Namesuivants :FACIAL_C_FacialRootFACIAL_C_Neck2RootFACIAL_C_Neck1Root
- Ajouter 1 élément au tableau
- Important pour les animations faciales personnalisées : Dans l'
Option de fusion de courbes, sélectionnez "Utiliser la valeur maximale". Cela permet aux animations faciales personnalisées (expressions, émotions, etc.) d'être correctement superposées au lip sync. - Faites les connexions :
- Votre animation personnalisée (généralement un
Sequence Playeravec l'asset de séquence d'animation souhaité) → entréeBase Pose - Sortie d'animation faciale (provenant des nœuds de synchro labiale et/ou de rire) → entrée
Blend Poses 0 - Nœud de blend en couches → pose finale
Result
- Votre animation personnalisée (généralement un

Sélection de l'ensemble de cibles de morphing
- Modèle standard
- Modèles réalistes
Le Standard Model utilise des ressources de pose qui prennent en charge nativement toute convention de nommage des cibles de morphing via la configuration personnalisée des ressources de pose. Aucune configuration supplémentaire n'est nécessaire.
Le nœud Blend Realistic MetaHuman Lip Sync comprend une propriété Morph Target Set qui détermine quelle convention de nommage des cibles de morphing utiliser pour l'animation faciale :
| Ensemble de cibles de morphing | Description | Cas d'utilisation |
|---|---|---|
| MetaHuman (par défaut) | Noms de cibles de morphing MetaHuman standard (p. ex., CTRL_expressions_jawOpen) | Personnages MetaHuman |
| ARKit | Noms compatibles ARKit d'Apple (p. ex., JawOpen, MouthSmileLeft) | Personnages basés sur ARKit |
Réglage fin du comportement de la synchronisation labiale
Mise à l’échelle de courbes Lip Sync spécifiques
Vous pouvez atténuer (ou amplifier) les mouvements faciaux individuels produits par la synchro labiale à l'aide d'un nœud Modify Curve. Cela est utile lorsqu'une courbe particulière semble trop prononcée pour votre contenu audio ou votre personnage.
Configuration :
- Après votre nœud de blend de lip sync, ajoutez un nœud
Modify Curve - Faites un clic droit sur le nœud, sélectionnez Add Curve Pin, puis saisissez le nom de la courbe que vous souhaitez mettre à l’échelle
- Définissez la propriété Apply Mode du nœud sur Scale
- Définissez le paramètre Value : les valeurs inférieures à 1.0 atténuent le mouvement, les valeurs supérieures à 1.0 l’amplifient (par exemple, 0.8 = 20 % de réduction)
Courbes couramment mises à l'échelle :
| Nom de la courbe | Objectif | S'applique à | Ajustement typique |
|---|---|---|---|
CTRL_expressions_tongueOut | Protrusion de la langue vers l'avant pendant certains phonèmes | Modèle standard | 0.8 pour réduire la protrusion |
CTRL_expressions_jawOpen | Amplitude d'ouverture de la mâchoire | Modèles réalistes | 0.9 pour réduire le mouvement de la mâchoire |
Vous pouvez ajouter plusieurs broches de courbe au même nœud Modify Curve pour mettre à l’échelle plusieurs courbes à la fois.
Réglage fin spécifique à l’humeur
Pour les modèles compatibles avec les humeurs, vous pouvez affiner des expressions émotionnelles spécifiques :
Contrôle des sourcils :
CTRL_expressions_browRaiseInL/CTRL_expressions_browRaiseInR- Haussement du sourcil interneCTRL_expressions_browRaiseOuterL/CTRL_expressions_browRaiseOuterR- Haussement du sourcil externeCTRL_expressions_browDownL/CTRL_expressions_browDownR- Abaissement du sourcil
Contrôle de l’expression des yeux :
CTRL_expressions_eyeSquintInnerL/CTRL_expressions_eyeSquintInnerR- Plissement des yeuxCTRL_expressions_eyeCheekRaiseL/CTRL_expressions_eyeCheekRaiseR- Élévation des joues
Comparaison et sélection de modèles
Choisir entre les modèles
Lorsque vous décidez quel modèle de synchronisation labiale utiliser pour votre projet, tenez compte des facteurs suivants :
| Considération | Modèle standard | Modèle réaliste | Modèle réaliste avec humeurs |
|---|---|---|---|
| Compatibilité des personnages | MetaHumans et tous les types de personnages personnalisés | Personnages MetaHumans (et ARKit) | Personnages MetaHumans (et ARKit) |
| Qualité visuelle | Bonne synchro labiale avec des performances efficaces | Réalisme amélioré avec des mouvements de bouche plus naturels | Réalisme amélioré avec des expressions émotionnelles |
| Performances | Optimisé pour toutes les plateformes, y compris mobile/VR | Exigences de ressources plus élevées | Exigences de ressources plus élevées |
| Fonctionnalités | 14 visèmes, détection du rire | 81 contrôles faciaux, 3 niveaux d'optimisation | 81 contrôles faciaux, 12 humeurs, sortie configurable |
| Prise en charge des plateformes | Windows, Android, Quest | Windows, Mac, iOS, Linux, Android, Quest | Windows, Mac, iOS, Linux, Android, Quest |
| Cas d'utilisation | Applications générales, jeux, VR/AR, mobile | Expériences cinématiques, interactions rapprochées | Narration émotionnelle, interaction avancée avec les personnages |
Compatibilité des versions du moteur
Si vous utilisez Unreal Engine 5.2, les modèles réalistes peuvent ne pas fonctionner correctement en raison d'un bug dans la bibliothèque de rééchantillonnage d'UE. Pour les utilisateurs d'UE 5.2 qui ont besoin d'une synchronisation labiale fiable, veuillez utiliser le Modèle standard à la place.
Ce problème est spécifique à UE 5.2 et n'affecte pas les autres versions du moteur.
Recommandations de performance
- Pour la plupart des projets, le Standard Model offre un excellent équilibre entre qualité et performance
- Utilisez le Realistic Model lorsque vous avez besoin de la plus haute fidélité visuelle pour les personnages MetaHuman
- Utilisez le Mood-Enabled Realistic Model lorsque le contrôle de l'expression émotionnelle est important pour votre application
- Tenez compte des capacités de performance de votre plateforme cible lors du choix entre les modèles
- Testez différents niveaux d'optimisation pour trouver le meilleur équilibre pour votre cas d'utilisation spécifique
Dépannage
Problèmes courants
Recréation du générateur pour les modèles réalistes : Pour un fonctionnement fiable et cohérent avec les modèles réalistes, il est recommandé de recréer le générateur à chaque fois que vous souhaitez fournir de nouvelles données audio après une période d'inactivité. Cela est dû au comportement d'ONNX runtime qui peut entraîner l'arrêt de la synchronisation labiale lors de la réutilisation des générateurs après des périodes de silence.
Par exemple, vous pourriez recréer le générateur de lip sync à chaque démarrage de la lecture, par exemple lorsque vous appelez Play Sound 2D ou utilisez toute autre méthode pour lancer la lecture audio et la synchronisation labiale :

Emplacement du plugin pour l’intégration de Runtime Text To Speech : Lorsque vous utilisez Runtime MetaHuman Lip Sync avec Runtime Text To Speech (les deux plugins utilisent ONNX Runtime), vous pouvez rencontrer des problèmes si les plugins sont installés dans le dossier Marketplace du moteur. Pour corriger cela :
- Localisez les deux plugins dans votre dossier d'installation d'UE sous
\Engine\Plugins\Marketplace(par exemple,C:\Program Files\Epic Games\UE_5.6\Engine\Plugins\Marketplace) - Déplacez les dossiers
RuntimeMetaHumanLipSyncetRuntimeTextToSpeechvers le dossierPluginsde votre projet. - Si votre projet n'a pas de dossier
Plugins, créez-en un dans le même répertoire que votre fichier.uproject. - Redémarrez Unreal Editor.
Cela résout les problèmes de compatibilité qui peuvent survenir lorsque plusieurs plugins basés sur ONNX Runtime sont chargés depuis le dossier Marketplace du moteur.
Configuration de packaging (Windows) : Si la synchronisation labiale ne fonctionne pas correctement dans votre projet empaqueté sur Windows, assurez-vous d'utiliser la configuration de build Shipping plutôt que Development. La configuration Development peut causer des problèmes avec le runtime ONNX des modèles réalistes dans les builds empaquetés.
Pour corriger ceci :
- Dans vos Paramètres du projet → Packaging, définissez la Configuration de build sur Shipping
- Repackez votre projet

Dans certains projets Blueprint-only, Unreal Engine peut encore compiler en configuration Development même lorsque Shipping est sélectionné. Si cela se produit, convertissez votre projet en projet C++ en ajoutant au moins une classe C++ (elle peut être vide). Pour cela, allez dans Outils → Nouvelle classe C++ dans le menu de l'éditeur UE et créez une classe vide. Cela forcera le projet à compiler correctement en configuration Shipping. Votre projet peut rester fonctionnellement Blueprint-only ; la classe C++ est simplement nécessaire pour une configuration de build correcte.
Dégradation de la réactivité de la synchro labiale :
Si vous constatez que la synchro labiale devient moins réactive au fil du temps lors de l’utilisation de Streaming Sound Wave ou de Capturable Sound Wave, cela peut être dû à une accumulation de mémoire. Par défaut, la mémoire est réallouée à chaque fois qu’un nouvel audio est ajouté. Pour éviter ce problème, appelez périodiquement la fonction ReleaseMemory afin de libérer la mémoire accumulée, par exemple toutes les 30 secondes environ.
Optimisation des performances :
- Ajuster la taille des blocs de traitement pour les modèles Realistic en fonction de vos exigences de performance.
- Utiliser des nombres de threads appropriés pour votre matériel cible.
- Envisager d'utiliser le type de sortie Mouth Only pour les modèles prenant en charge l'humeur lorsque l'animation faciale complète n'est pas nécessaire.