Saltar al contenido principal

Resumen

Runtime MetaHuman Lip Sync Documentation

Runtime MetaHuman Lip Sync es un plugin que permite la sincronización de labios en tiempo real, sin conexión y multiplataforma, tanto para MetaHuman como para personajes personalizados. Permite animar los labios de un personaje en respuesta a una entrada de audio de diversas fuentes, entre ellas:

El plugin genera internamente visemas (representaciones visuales de los fonemas) a partir de la entrada de audio. Dado que trabaja directamente con los datos de audio en lugar de con texto, el plugin admite entradas multilingües, incluyendo pero sin limitarse a inglés, español, francés, alemán, japonés, chino, coreano, ruso, italiano, portugués, árabe e hindi. Literalmente cualquier idioma es compatible, ya que la sincronización de labios se genera a partir de los fonemas del audio, en lugar de mediante un procesamiento de texto específico del idioma.

El Modelo Estándar produce 14 visemas y realiza la animación de sincronización de labios mediante un pose asset predefinido. En cambio, los Modelos realistas (exclusivos de los personajes basados en MetaHuman y ARKit) generan 81 cambios de control facial sin depender de un pose asset predefinido, lo que da como resultado animaciones faciales notablemente más realistas.

Compatibilidad de personajes

A pesar de su nombre, Runtime MetaHuman Lip Sync funciona con una amplia gama de personajes más allá de solo MetaHumans:

  • Personajes de Daz Genesis 8/9
  • Personajes de Reallusion Character Creator 3/4/5 (CC3/CC4/CC5)
  • Personajes de Mixamo

Soporte de estándares de animación

  • Sistemas de blendshapes basados en FACS
  • Estándar de blendshapes de Apple ARKit
  • Conjuntos de fonemas de Preston Blair
  • Sistemas de fonemas de 3ds Max
  • Cualquier personaje con morph targets personalizados para expresiones faciales.

Muchos sistemas populares, incluidos Reallusion CC4/CC5 y Daz Genesis 8.1/9, también se pueden convertir para utilizar los nombres estándar de blendshapes de ARKit. Esto le permite usar el Realistic Model para estos personajes, con su animación facial de mayor calidad, como alternativa al mapeo manual de visemas del Standard Model. Consulte Conversión de personajes a blendshapes de ARKit para más detalles.

Para personajes no MetaHuman que usan el modelo estándar, consulte la Guía de configuración de personajes personalizados. Para personajes basados en ARKit que usan los modelos realistas, consulte Selección del conjunto de objetivos de morphing.

Vista previa de animación

Echa un vistazo a estas animaciones cortas para ver la calidad de la animación de sincronización de labios producida por el plugin en distintos tipos de personajes y modelos:

Modelo realista con personaje MetaHuman
Modelo estándar con personaje MetaHuman
Modelo estándar con personaje personalizado
Modelo estándar con personaje personalizado

Características principales

Modelos de sincronización de labios

El plugin ofrece múltiples modelos de sincronización de labios para adaptarse a las diferentes necesidades del proyecto:

El modelo estándar de sincronización de labios ofrece un rendimiento eficiente y multiplataforma con una amplia compatibilidad de personajes:

  • Funciona con MetaHumans y todos los tipos de personajes personalizados
  • Optimizado para rendimiento en tiempo real
  • Menores requisitos de recursos
  • Compatibilidad de plataformas: Windows, Android, plataformas basadas en Android (incluida Meta Quest)
Plugin de extensión requerido

Para usar el modelo estándar, necesitas instalar un plugin de extensión adicional. Consulta la sección de requisitos previos para obtener las instrucciones de instalación.

Puede elegir el modelo adecuado según los requisitos de su proyecto en cuanto a rendimiento, compatibilidad de personajes, calidad visual, plataforma objetivo y necesidades de funciones.

Cómo funciona

El plugin procesa la entrada de audio de la siguiente manera:

  1. Los datos de audio se reciben en formato PCM de coma flotante con canales y frecuencia de muestreo especificados.
  2. El plugin procesa el audio para generar datos de control facial o visemas, dependiendo del modelo.
  3. Para los modelos con soporte de estados de ánimo, el contexto emocional se aplica a la animación facial.
  4. Los datos de animación impulsan los movimientos faciales del personaje en tiempo real.

Arquitectura de rendimiento

Runtime MetaHuman Lip Sync usa inferencia exclusivamente con CPU para proporcionar resultados de sincronización de labios consistentes y de baja latencia, adecuados para aplicaciones en tiempo real. Por defecto, el plugin realiza el procesamiento de sincronización de labios cada 10 milisegundos (ajustable; consulte Configuración del plugin para conocer todos los ajustes disponibles, incluidos Tamaño del bloque de procesamiento, número de subprocesos y otros parámetros de rendimiento).

Descripción general de la arquitectura del modelo

Los modelos de sincronización de labios utilizan una red neuronal compacta basada en transformadores que procesa el audio mediante el análisis de mel-espectrogramas. Esta arquitectura ligera está específicamente diseñada para un rendimiento en tiempo real con una inferencia eficiente en CPU y una huella de memoria mínima.

¿Por qué inferencia en CPU?

Para operaciones de inferencia pequeñas y frecuentes, como la sincronización de labios en tiempo real, el procesamiento por CPU ofrece mejores características de latencia que la GPU. Con un tamaño de lote de 1 e intervalos de inferencia de 10-100ms, la sobrecarga de la GPU debida a las transferencias PCIe y los lanzamientos de kernels suele superar el tiempo de cómputo real. Además, en los motores de juego, la GPU ya está saturada con el renderizado, los shaders y la física, lo que crea una contención de recursos que introduce picos de latencia impredecibles.

Compatibilidad de hardware

El plugin funciona de manera eficiente en la mayoría de CPU de gama media y superiores sin requerir hardware gráfico dedicado, proporcionando rendimiento en tiempo real en plataformas de escritorio, móviles y VR. Para hardware menos potente, puedes ajustar el Tipo de modelo a Semi-Optimized o Highly Optimized, o aumentar el Tamaño del bloque de procesamiento para mantener el rendimiento en tiempo real con una capacidad de respuesta ligeramente reducida.

Inicio rápido

Aquí tienes una configuración básica para habilitar la sincronización de labios en tu personaje:

  1. Para personajes MetaHuman, sigue la Guía de configuración
  2. Para personajes personalizados, sigue la Guía de configuración de personajes personalizados
  3. Elige y configura tu modelo preferido de sincronización de labios
  4. Configura el procesamiento de entrada de audio en tu Blueprint
  5. Conecta el nodo de sincronización de labios adecuado en el Animation Blueprint
  6. Reproduce el audio y observa cómo tu personaje se anima en sincronía

Animación de ojos opcional

El plugin también incluye ayudantes opcionales para parpadeo automático y seguimiento de la mirada en MetaHumans. Estos son independientes de la sincronización de labios y pueden usarse de forma autónoma o superpuestos a ella. Consulte Ayudantes de animación ocular.

Recursos adicionales

📦 Descargas y Enlaces

Proyectos de demostración:

Dos proyectos de demostración listos para usar están disponibles; consulta la página dedicada de Proyectos de demostración para obtener todos los detalles, descargas y tutoriales:

Ambas demos son multiplataforma (Windows, Mac, Linux, iOS, Android, Meta Quest) y se distribuyen como compilaciones empaquetadas y proyectos fuente completos de UE 5.6+.

🎥 Tutoriales en video

Demos destacadas:

Tutoriales de Modelo Realista (Alta Calidad):

Tutoriales del modelo estándar:

Configuración general:

💬 Soporte

  • Desarrollo personalizado: [email protected] (soluciones personalizadas para equipos y organizaciones)
Join our Discord
online · support