Pular para o conteúdo principal

Visão Geral

Runtime MetaHuman Lip Sync Documentation

Runtime MetaHuman Lip Sync é um plugin que permite sincronização labial em tempo real, offline e multiplataforma para personagens MetaHuman e personalizados. Ele permite animar os lábios de um personagem em resposta à entrada de áudio de várias fontes, incluindo:

O plugin gera internamente visemas (representações visuais de fonemas) com base na entrada de áudio. Como ele trabalha diretamente com dados de áudio em vez de texto, o plugin oferece suporte à entrada multilíngue, incluindo, mas não se limitando a, inglês, espanhol, francês, alemão, japonês, chinês, coreano, russo, italiano, português, árabe e hindi. Literalmente qualquer idioma é suportado porque a sincronização labial é gerada a partir dos fonemas do áudio em vez de processamento de texto específico de idioma.

O Standard Model produz 14 visemas e executa animação de lip sync usando um asset de pose predefinido. Em contraste, os Realistic Models (exclusivos para personagens MetaHuman e personagens baseados em ARKit) geram 81 alterações de controle facial sem depender de um asset de pose predefinido, resultando em animações faciais significativamente mais realistas.

Compatibilidade de Personagens

Apesar do nome, Runtime MetaHuman Lip Sync funciona com uma grande variedade de personagens além de apenas MetaHumans:

  • Daz Genesis 8/9 personagens
  • Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) personagens
  • Mixamo personagens

Suporte a Padrões de Animação

  • Sistemas de blendshapes baseados em FACS
  • Padrão de blendshapes do Apple ARKit
  • Conjuntos de fonemas de Preston Blair
  • Sistemas de fonemas do 3ds Max
  • Qualquer personagem com morph targets personalizados para expressões faciais

Muitos sistemas populares, incluindo Reallusion CC4/CC5 e Daz Genesis 8.1/9, também podem ser convertidos para usar nomes de blendshapes no padrão ARKit. Isso permite que você use o Modelo Realista nesses personagens, com sua animação facial de maior qualidade, como alternativa ao mapeamento manual de visemas do Modelo Padrão. Consulte Conversão de Personagens para Blendshapes do ARKit para obter detalhes.

Para personagens não MetaHuman que usam o Standard Model, consulte o Guia de Configuração para Personagens Personalizados. Para personagens baseados em ARKit que usam os Realistic Models, consulte a Seleção de Conjunto de Morph Targets.

Pré-visualização de Animação

Confira estas animações curtas para ver a qualidade da animação de lip sync produzida pelo plugin em diferentes tipos de personagens e modelos:

Modelo realista com personagem MetaHuman
Modelo padrão com personagem MetaHuman
Modelo padrão com personagem personalizado
Modelo padrão com personagem personalizado

Principais recursos

Modelos de Lip Sync

O plugin oferece vários modelos de lip sync para atender a diferentes necessidades de projeto:

O modelo padrão de sincronização labial oferece desempenho eficiente e multiplataforma com ampla compatibilidade de personagens:

  • Funciona com MetaHumans e todos os tipos de personagens personalizados
  • Otimizado para desempenho em tempo real
  • Menores requisitos de recursos
  • Suporte a plataformas: Windows, Android, plataformas baseadas em Android (incluindo Meta Quest)
Plugin de Extensão Necessário

Para usar o Standard Model, você precisa instalar um plugin de extensão adicional. Consulte a seção Pré-requisitos para instruções de instalação.

Você pode escolher o modelo apropriado com base nos requisitos do seu projeto quanto a desempenho, compatibilidade de personagens, qualidade visual, plataforma de destino e necessidades de recursos.

Como Funciona

O plugin processa a entrada de áudio da seguinte forma:

  1. Os dados de áudio são recebidos como formato PCM float, com canais e taxa de amostragem especificados
  2. O plugin processa o áudio para gerar dados de controle facial ou visemas, dependendo do modelo
  3. Para modelos com suporte a humor, o contexto emocional é aplicado à animação facial
  4. Os dados de animação orientam os movimentos faciais do personagem em tempo real

Arquitetura de Desempenho

O Runtime MetaHuman Lip Sync usa inferência somente em CPU para fornecer resultados de sincronização labial consistentes e de baixa latência, adequados para aplicações em tempo real. Por padrão, o plugin realiza o processamento de sincronização labial a cada 10 milissegundos (ajustável — consulte Configuração do Plugin para todas as configurações disponíveis, incluindo Tamanho do Bloco de Processamento, número de threads e outros parâmetros de desempenho).

Visão Geral da Arquitetura do Modelo

Os modelos de sincronização labial usam uma rede neural compacta baseada em transformer que processa áudio por meio da análise de espectrograma mel. Essa arquitetura leve é especificamente projetada para desempenho em tempo real, com inferência eficiente em CPU e consumo mínimo de memória.

Por que inferência em CPU?

Para operações de inferência pequenas e frequentes, como sincronização labial em tempo real, o processamento pela CPU oferece melhores características de latência do que a GPU. Com tamanho de lote 1 e intervalos de inferência de 10 a 100 ms, a sobrecarga da GPU devida a transferências PCIe e lançamentos de kernel geralmente excede o tempo real de computação. Além disso, em motores de jogos, a GPU já está saturada com renderização, shaders e física, criando contenção de recursos que introduz picos de latência imprevisíveis.

Compatibilidade de Hardware

O plugin funciona de forma eficiente na maioria das CPUs de nível médio ou superior, sem exigir hardware gráfico dedicado, oferecendo desempenho em tempo real em plataformas desktop, móveis e VR. Para hardware mais fraco, você pode ajustar o Tipo de Modelo para Semi-Optimized ou Highly Optimized, ou aumentar o Tamanho do Bloco de Processamento para manter o desempenho em tempo real com capacidade de resposta ligeiramente reduzida.

Início Rápido

Aqui está uma configuração básica para habilitar o lip sync no seu personagem:

  1. Para personagens MetaHuman, siga o Guia de Configuração
  2. Para personagens personalizados, siga o Guia de Configuração para Personagens Personalizados
  3. Escolha e configure seu modelo de lip sync preferido
  4. Configure o processamento de entrada de áudio no seu Blueprint
  5. Conecte o nó de lip sync apropriado no Animation Blueprint
  6. Reproduza o áudio e veja seu personagem animar em sincronia

Animação opcional dos olhos

O plugin também inclui auxiliares opcionais para piscadas automáticas e rastreamento do olhar em MetaHumans. Eles são independentes do lip sync e podem ser usados isoladamente ou sobrepostos a ele. Consulte Auxiliares de Animação dos Olhos.

Recursos Adicionais

Projetos de Demonstração:

Dois projetos de demonstração prontos para uso estão disponíveis - consulte a página dedicada Projetos de Demonstração para obter detalhes completos, downloads e tutoriais passo a passo:

Ambos os demos são multiplataforma (Windows, Mac, Linux, iOS, Android, Meta Quest) e são fornecidos como builds empacotados e projetos-fonte completos para UE 5.6+.

🎥 Tutoriais em Vídeo

Demos em destaque:

Tutoriais do Modelo Realista (Alta Qualidade):

Tutoriais do Standard Model:

Configuração Geral:

💬 Suporte

  • Desenvolvimento Personalizado: [email protected] (soluções personalizadas para equipes e organizações)
Join our Discord
online · support