Configuración del plugin
Configuración del modelo
Para un funcionamiento fiable con los modelos Realistic y Mood-Enabled Realistic, recrea el generador antes de cada nueva reproducción de audio en lugar de reutilizarlo durante silencios largos. Consulta Recreación del generador en Solución de problemas para obtener más detalles.
Configuración del modelo estándar
El nodo Create Runtime Viseme Generator utiliza ajustes predeterminados que funcionan bien en la mayoría de los escenarios. La configuración se gestiona a través de las propiedades del nodo de mezcla de Animation Blueprint.
Para las opciones de configuración de Animation Blueprint, consulta la sección Configuración de Lip Sync a continuación.
Configuración de modelo realista
El nodo Create Realistic MetaHuman Lip Sync Generator acepta un parámetro opcional Configuration que le permite personalizar el comportamiento del generador:
Tipo de modelo
El ajuste Tipo de modelo determina qué versión del modelo realista utilizar:
| Model Type | Rendimiento | Calidad visual | Manejo del ruido | Casos de uso recomendados |
|---|---|---|---|---|
| Altamente optimizado (predeterminado) | Máximo rendimiento, uso de CPU más bajo | Buena calidad | Puede mostrar movimientos de boca notables con ruido de fondo o sonidos que no son de voz | Entornos de audio limpios, escenarios donde el rendimiento es crítico |
| Semioptimizado | Buen rendimiento, uso de CPU moderado | Alta calidad | Mejor estabilidad con audio ruidoso | Rendimiento y calidad equilibrados, condiciones de audio mixtas |
| Original | Adecuado para uso en tiempo real en CPU modernas | Máxima calidad | Más estable con ruido de fondo y sonidos que no son de voz | Producciones de alta calidad, entornos de audio ruidosos, cuando se necesita la máxima precisión |
Configuración de rendimiento
Hilos de intra-op: Controla el número de hilos utilizados para las operaciones internas de procesamiento del modelo.
- 0 (Predeterminado/Automático): Usa detección automática (normalmente 1/4 de los núcleos de CPU disponibles, máximo 4)
- 1-16: Especifica manualmente el número de hilos. Los valores más altos pueden mejorar el rendimiento en sistemas de múltiples núcleos pero usan más CPU.
Hilos entre operaciones: Controla el número de hilos utilizados para la ejecución paralela de diferentes operaciones del modelo.
- 0 (Predeterminado/Automático): Utiliza la detección automática (normalmente 1/8 de los núcleos de CPU disponibles, máximo 2)
- 1-8: Especifica manualmente el número de hilos. Generalmente se mantiene bajo para procesamiento en tiempo real.
Tamaño del bloque de procesamiento
El tamaño del fragmento de procesamiento determina cuántas muestras se procesan en cada paso de inferencia. El valor predeterminado es 160 muestras (10 ms de audio a 16 kHz):
- Los valores más pequeños proporcionan actualizaciones más frecuentes pero aumentan el uso de CPU.
- Los valores más grandes reducen la carga de CPU pero pueden disminuir la capacidad de respuesta de la sincronización de labios.
- Se recomienda usar múltiplos de 160 para una alineación óptima.

Configuración del modelo con soporte de estados de ánimo
El nodo Create Realistic MetaHuman Lip Sync With Mood Generator proporciona opciones de configuración adicionales más allá del modelo realista básico:
Configuración básica
Lookahead Ms: Tiempo de anticipación en milisegundos para mejorar la precisión de la sincronización de labios.
- Predeterminado: 80ms
- Rango: de 20ms a 200ms (debe ser divisible por 20)
- Los valores más altos proporcionan una mejor sincronización pero aumentan la latencia.
Tipo de salida: Controla qué controles faciales se generan.
- Cara completa: Todos los 81 controles faciales (cejas, ojos, nariz, boca, mandíbula, lengua)
- Solo boca: Solo los controles de boca, mandíbula y lengua
Configuración de rendimiento: Utiliza los mismos ajustes de Intra Op Threads e Inter Op Threads que el modelo realista estándar.
Ajustes de ánimo
Estados de ánimo disponibles:
- Neutro, Feliz, Triste, Asco, Ira, Sorpresa, Miedo
- Confiado, Emocionado, Aburrido, Juguetón, Confundido
Intensidad del estado de ánimo: Controla cuán fuertemente el estado de ánimo afecta la animación (0.0 a 1.0)
Control de Estado de Ánimo en Tiempo de Ejecución
Puedes modificar los ajustes de ánimo en tiempo de ejecución mediante las siguientes funciones:
- Establecer Estado de Ánimo: Cambia el tipo de estado de ánimo actual
- Establecer Intensidad de Estado de Ánimo: Ajusta cuán fuertemente el estado de ánimo afecta la animación (0.0 a 1.0)
- Establecer Anticipación (ms): Modifica el tiempo de anticipación para la sincronización
- Establecer Tipo de Salida: Cambia entre los controles de Cara Completa y Solo Boca

Guía de selección de estado de ánimo
Elige estados de ánimo apropiados según tu contenido:
| Mood | Ideal para | Rango de intensidad típico |
|---|---|---|
| Neutral | Conversación general, narración, estado predeterminado | 0.5 - 1.0 |
| Feliz | Contenido positivo, diálogo alegre, celebraciones | 0.6 - 1.0 |
| Triste | Contenido melancólico, escenas emocionales, momentos sombríos | 0.5 - 0.9 |
| Asco | Reacciones negativas, contenido desagradable, rechazo | 0.4 - 0.8 |
| Ira | Diálogo agresivo, escenas de confrontación, frustración | 0.6 - 1.0 |
| Sorpresa | Eventos inesperados, revelaciones, reacciones de impacto | 0.7 - 1.0 |
| Miedo | Situaciones amenazantes, ansiedad, diálogo nervioso | 0.5 - 0.9 |
| Seguro | Presentaciones profesionales, diálogo de liderazgo, discurso asertivo | 0.7 - 1.0 |
| Entusiasmado | Contenido enérgico, anuncios, diálogo entusiasta | 0.8 - 1.0 |
| Aburrido | Contenido monótono, diálogo indiferente, habla cansada | 0.3 - 0.7 |
| Juguetón | Conversación informal, humor, interacciones desenfadadas | 0.6 - 0.9 |
| Confundido | Diálogo repleto de preguntas, incertidumbre, desconcierto | 0.4 - 0.8 |
Configuración de Animation Blueprint
Configuración de sincronización de labios
- Modelo Estándar
- Modelos realistas
El nodo Blend Runtime MetaHuman Lip Sync tiene opciones de configuración en su panel de propiedades:
| Propiedad | Predeterminado | Descripción |
|---|---|---|
| Velocidad de interpolación | 25 | Controla la rapidez con la que los movimientos de los labios realizan la transición entre visemas. Los valores más altos dan lugar a transiciones más rápidas y abruptas. |
| Tiempo de reinicio | 0.2 | La duración en segundos tras la cual se reinicia la sincronización de labios. Esto es útil para evitar que la sincronización de labios continúe después de que el audio se haya detenido. |
Animación de risa
También puedes añadir animaciones de risa que respondan dinámicamente a la risa detectada en el audio:
- Añade el nodo
Blend Runtime MetaHuman Laughter - Conecta tu variable
RuntimeVisemeGeneratoral pinViseme Generator - Si ya estás usando lip sync:
- Conecta la salida del nodo
Blend Runtime MetaHuman Lip Synca laSource Posedel nodoBlend Runtime MetaHuman Laughter - Conecta la salida del nodo
Blend Runtime MetaHuman Laughteral pinResultdeOutput Pose
- Conecta la salida del nodo
- Si se utiliza solo la risa sin sincronización de labios:
- Conecta tu pose de origen directamente al
Source Posedel nodoBlend Runtime MetaHuman Laughter - Conecta la salida al pin
Result
- Conecta tu pose de origen directamente al

Cuando se detecta risa en el audio, tu personaje se animará dinámicamente en consecuencia:
Configuración de risa
El nodo Blend Runtime MetaHuman Laughter tiene sus propias opciones de configuración:
| Propiedad | Predeterminado | Descripción |
|---|---|---|
| Velocidad de interpolación | 25 | Controla la rapidez con la que los movimientos de los labios realizan la transición entre las animaciones de risa. Los valores más altos dan como resultado transiciones más rápidas y abruptas. |
| Tiempo de reinicio | 0.2 | La duración en segundos tras la cual se reinicia la risa. Esto es útil para evitar que la risa continúe después de que el audio se haya detenido. |
| Peso máximo de la risa | 0.7 | Escala la intensidad máxima de la animación de risa (0.0 - 1.0). |
Nota: La detección de risas actualmente solo está disponible con el Modelo Estándar.
El nodo Blend Realistic MetaHuman Lip Sync tiene opciones de configuración en su panel de propiedades:
| Propiedad | Predeterminado | Descripción |
|---|---|---|
| Velocidad de interpolación | treinta | Controla la rapidez con la que las expresiones faciales hacen la transición durante el habla activa. Los valores más altos dan como resultado transiciones más rápidas y abruptas. |
| Velocidad de interpolación en reposo | quince | Controla la rapidez con la que las expresiones faciales vuelven al estado inactivo/neutral. Los valores más bajos crean transiciones más suaves y graduales de regreso a la pose de reposo. |
| Tiempo de reinicio | 0,2 | Duración en segundos tras la cual la sincronización de labios se restablece al estado inactivo. Útil para evitar que las expresiones continúen después de que el audio se detenga. |
| Conservar estado inactivo | falso | Cuando está habilitado, conserva el último estado emocional durante los períodos de inactividad en lugar de restablecerse a neutral. |
| Preservar expresiones oculares | true | Controla si los controles faciales relacionados con los ojos se conservan durante el estado inactivo. Solo tiene efecto cuando la opción Conservar estado inactivo está habilitada. |
| Preservar expresiones de cejas | true | Controla si los controles faciales relacionados con las cejas se conservan durante el estado inactivo. Solo tiene efecto cuando la opción Preservar estado inactivo está habilitada. |
| Conservar la forma de la boca | falso | Controla si los controles de forma de la boca (excluyendo movimientos específicos del habla, como la lengua y la mandíbula) se conservan durante el estado inactivo. Solo tiene efecto cuando la opción Preserve Idle State está habilitada. |
Preservación del estado inactivo
La función Preservar estado inactivo aborda cómo el modelo realista maneja los períodos de silencio. A diferencia del modelo estándar, que utiliza visemas discretos y vuelve sistemáticamente a valores cero durante el silencio, la red neuronal del modelo realista puede mantener una sutil posición facial que difiere de la postura de reposo predeterminada del MetaHuman.
Cuándo habilitar:
- Mantener las expresiones emocionales entre segmentos de habla
- Preservar los rasgos de personalidad del personaje
- Garantizar la continuidad visual en secuencias cinematográficas
Opciones de control regional:
- Expresiones de los ojos: Conserva el entrecerrado de los ojos, el ensanchamiento y la posición de los párpados
- Expresiones de cejas: Mantiene la posición de las cejas y la frente
- Forma de la boca: Conserva la curvatura general de la boca mientras permite que los movimientos del habla (lengua, mandíbula) se restablezcan
Combinando con animaciones existentes
¿Prefieres ver en lugar de leer? Mira el tutorial en video que cubre esta configuración exacta.
Para aplicar la sincronización de labios y la risa junto con las animaciones corporales existentes y las animaciones faciales personalizadas sin sobrescribirlas:
Esta configuración se aplica al Animation Blueprint de la cara, ya que la sincronización de labios no forma parte del Animation Blueprint del cuerpo. Para animaciones corporales personalizadas (p. ej., torso, brazos y otros movimientos del cuerpo), simplemente conecta tu secuencia de animación (a través de un Sequence Player) directamente a la pose de salida en el Animation Blueprint del cuerpo. No se necesita configuración adicional allí.
- Añade un nodo
Layered blend per boneentre las animaciones del cuerpo y la salida final. Asegúrate de queUse Attached Parentesté en true. - Configura el ajuste de capas:
- Agrega 1 elemento al array
Layer Setup - Agrega 3 elementos a los
Branch Filterspara la capa, con los siguientesBone Names:FACIAL_C_FacialRootFACIAL_C_Neck2RootFACIAL_C_Neck1Root
- Agrega 1 elemento al array
- Importante para animaciones faciales personalizadas: En la
Opción de fusión de curvas, selecciona "Usar valor máximo". Esto permite que las animaciones faciales personalizadas (expresiones, emociones, etc.) se superpongan adecuadamente sobre la sincronización de labios. - Haz las conexiones:
- Tu animación personalizada (normalmente un
Sequence Playercon el activo de secuencia de animación deseado) → entradaBase Pose - Salida de animación facial (de los nodos de sincronización de labios y/o risa) → entrada
Blend Poses 0 - Nodo de mezcla por capas → pose final
Result
- Tu animación personalizada (normalmente un

Selección del conjunto de Morph Targets
- Modelo estándar
- Modelos realistas
El modelo estándar utiliza recursos de pose que admiten de forma inherente cualquier convención de nomenclatura de morph targets a través de la configuración personalizada de recurso de pose. No se necesita configuración adicional.
El nodo Blend Realistic MetaHuman Lip Sync incluye una propiedad Morph Target Set que determina qué convención de nomenclatura de morph targets utilizar para la animación facial:
| Conjunto de objetivos de morphing | Descripción | Casos de uso |
|---|---|---|
| MetaHuman (Predeterminado) | Nombres estándar de objetivos de morphing de MetaHuman (p. ej., CTRL_expressions_jawOpen) | Personajes MetaHuman |
| ARKit | Nombres compatibles con Apple ARKit (p. ej., JawOpen, MouthSmileLeft) | Personajes basados en ARKit |
Ajuste Fino del Comportamiento de Sincronización de Labios
Escalado de curvas específicas de sincronización de labios
Puedes atenuar (o amplificar) movimientos faciales individuales producidos por el lip sync usando un nodo Modify Curve. Esto es útil cuando una curva en particular se ve demasiado pronunciada para tu contenido de audio o personaje.
Configuración:
- Después de tu nodo de mezcla de sincronización de labios, agrega un nodo
Modify Curve - Haz clic derecho en el nodo y selecciona Add Curve Pin, luego ingresa el nombre de la curva que deseas escalar
- Configura la propiedad Apply Mode del nodo a Scale
- Configura el parámetro Value: los valores por debajo de 1.0 amortiguan el movimiento, los valores por encima de 1.0 lo amplifican (p. ej., 0.8 = reducción del 20%)
Curvas comúnmente escaladas:
| Curve Name | Propósito | Se aplica a | Ajuste típico |
|---|---|---|---|
CTRL_expressions_tongueOut | Protrusión de la lengua hacia adelante durante ciertos fonemas | Modelo estándar | 0.8 para reducir la protrusión |
CTRL_expressions_jawOpen | Rango de apertura de la mandíbula | Modelos realistas | 0.9 para reducir el movimiento de la mandíbula |
Puedes agregar varios pines de curva al mismo nodo Modify Curve para escalar varias curvas a la vez.
Ajuste fino específico del estado de ánimo
Para modelos que admiten estados de ánimo, puedes ajustar expresiones emocionales específicas:
Control de cejas:
CTRL_expressions_browRaiseInL/CTRL_expressions_browRaiseInR- Elevación interna de cejaCTRL_expressions_browRaiseOuterL/CTRL_expressions_browRaiseOuterR- Elevación externa de cejaCTRL_expressions_browDownL/CTRL_expressions_browDownR- Descenso de ceja
Control de Expresión Ocular:
CTRL_expressions_eyeSquintInnerL/CTRL_expressions_eyeSquintInnerR- Entrecerrar los ojosCTRL_expressions_eyeCheekRaiseL/CTRL_expressions_eyeCheekRaiseR- Elevación de mejillas
Comparación y selección de modelos
Elegir entre modelos
Al decidir qué modelo de sincronización de labios usar para tu proyecto, considera estos factores:
| Consideración | Modelo estándar | Modelo realista | Modelo realista con estados de ánimo |
|---|---|---|---|
| Compatibilidad de personajes | MetaHumans y todos los tipos de personajes personalizados | Personajes de MetaHumans (y ARKit) | Personajes de MetaHumans (y ARKit) |
| Calidad visual | Buena sincronización de labios con rendimiento eficiente | Realismo mejorado con movimientos de boca más naturales | Realismo mejorado con expresiones emocionales |
| Rendimiento | Optimizado para todas las plataformas, incluyendo móvil/VR | Mayores requisitos de recursos | Mayores requisitos de recursos |
| Características | 14 visemas, detección de risa | 81 controles faciales, 3 niveles de optimización | 81 controles faciales, 12 estados de ánimo, salida configurable |
| Soporte de plataformas | Windows, Android, Quest | Windows, Mac, iOS, Linux, Android, Quest | Windows, Mac, iOS, Linux, Android, Quest |
| Casos de uso | Aplicaciones generales, juegos, VR/AR, móvil | Experiencias cinematográficas, interacciones en primer plano | Narración emocional, interacción avanzada con personajes |
Compatibilidad de versiones del motor
Si estás usando Unreal Engine 5.2, es posible que los Realistic Models no funcionen correctamente debido a un error en la biblioteca de remuestreo de UE. Para los usuarios de UE 5.2 que necesiten una funcionalidad de sincronización de labios confiable, usa el Standard Model en su lugar.
Este problema es específico de UE 5.2 y no afecta a otras versiones del motor.
Recomendaciones de rendimiento
- Para la mayoría de los proyectos, el Modelo Estándar ofrece un excelente equilibrio entre calidad y rendimiento
- Use el Modelo Realista cuando necesite la máxima fidelidad visual para los personajes MetaHuman
- Use el Modelo Realista Habilitado para Estados de Ánimo cuando el control de la expresión emocional sea importante para su aplicación
- Considere las capacidades de rendimiento de su plataforma de destino al elegir entre modelos
- Pruebe diferentes niveles de optimización para encontrar el mejor equilibrio para su caso de uso específico
Solución de problemas
Problemas comunes
Recreación del generador para Realistic Models: Para un funcionamiento fiable y consistente con los Realistic Models, se recomienda recrear el generador cada vez que quieras introducir nuevos datos de audio después de un periodo de inactividad. Esto se debe al comportamiento de ONNX runtime, que puede provocar que la sincronización de labios deje de funcionar al reutilizar generadores después de periodos de silencio.
Por ejemplo, podrías recrear el generador de lip sync en cada inicio de reproducción, como cuando llamas a Play Sound 2D o usas cualquier otro método para iniciar la reproducción de ondas de sonido y lip sync:

Ubicación del plugin para la integración de Runtime Text To Speech: Cuando uses Runtime MetaHuman Lip Sync junto con Runtime Text To Speech (ambos plugins usan ONNX Runtime), es posible que experimentes problemas si los plugins están instalados en la carpeta de Marketplace del motor. Para solucionarlo:
- Localiza ambos complementos en tu carpeta de instalación de UE, en
\Engine\Plugins\Marketplace(p. ej.,C:\Program Files\Epic Games\UE_5.6\Engine\Plugins\Marketplace) - Mueve las carpetas
RuntimeMetaHumanLipSyncyRuntimeTextToSpeecha la carpetaPluginsde tu proyecto - Si tu proyecto no tiene una carpeta
Plugins, créala en el mismo directorio que tu archivo.uproject - Reinicia el Unreal Editor
Esto aborda los problemas de compatibilidad que pueden ocurrir cuando se cargan múltiples plugins basados en ONNX Runtime desde el directorio de Marketplace del motor.
Configuración de empaquetado (Windows): Si la sincronización de labios no funciona correctamente en tu proyecto empaquetado en Windows, asegúrate de usar la configuración de compilación Shipping en lugar de Development. La configuración Development puede provocar problemas con el ONNX Runtime para modelos realistas en compilaciones empaquetadas.
Para solucionar esto:
- En tu Configuración del proyecto → Empaquetado, establece la Configuración de compilación en Shipping
- Reempaqueta tu proyecto

En algunos proyectos de solo Blueprint, Unreal Engine puede seguir compilando en configuración Development incluso cuando se selecciona Shipping. Si esto ocurre, convierte tu proyecto en un proyecto de C++ añadiendo al menos una clase de C++ (puede estar vacía). Para ello, ve a Herramientas → Nueva clase de C++ en el menú del editor de UE y crea una clase vacía. Esto obligará a que el proyecto se compile correctamente en configuración Shipping. Tu proyecto puede seguir siendo de solo Blueprint en cuanto a funcionalidad; la clase de C++ solo es necesaria para una configuración de compilación adecuada.
Responsividad degradada de la sincronización de labios: Si experimentas que la sincronización de labios se vuelve menos receptiva con el tiempo al usar Streaming Sound Wave o Capturable Sound Wave, esto puede deberse a la acumulación de memoria. De forma predeterminada, la memoria se reasigna cada vez que se agrega nuevo audio. Para evitar este problema, llama a la función ReleaseMemory periódicamente para liberar la memoria acumulada, por ejemplo cada 30 segundos aproximadamente.
Optimización del rendimiento:
- Ajusta el tamaño de bloque de procesamiento para modelos realistas según tus requisitos de rendimiento
- Utiliza cantidades de hilos adecuadas para tu hardware de destino
- Considera usar el tipo de salida "Solo boca" para modelos con control de estado de ánimo cuando no se necesite animación facial completa.