Visão Geral

Runtime MetaHuman Lip Sync é um plugin que permite sincronização labial em tempo real, offline e multiplataforma para personagens MetaHuman e personalizados. Ele permite animar os lábios de um personagem em resposta à entrada de áudio de várias fontes, incluindo:
- Entrada de microfone via onda sonora capturável do Runtime Audio Importer
- Fala sintetizada de Runtime Text To Speech ou Runtime AI Chatbot Integrator
- Dados de áudio em streaming ou importados em múltiplos formatos via Runtime Audio Importer
- Quaisquer dados de áudio no formato PCM float (um array de amostras em ponto flutuante)
O plugin gera internamente visemas (representações visuais de fonemas) com base na entrada de áudio. Como ele trabalha diretamente com dados de áudio em vez de texto, o plugin oferece suporte à entrada multilíngue, incluindo, mas não se limitando a, inglês, espanhol, francês, alemão, japonês, chinês, coreano, russo, italiano, português, árabe e hindi. Literalmente qualquer idioma é suportado porque a sincronização labial é gerada a partir dos fonemas do áudio em vez de processamento de texto específico de idioma.
O Standard Model produz 14 visemas e executa animação de lip sync usando um asset de pose predefinido. Em contraste, os Realistic Models (exclusivos para personagens MetaHuman e personagens baseados em ARKit) geram 81 alterações de controle facial sem depender de um asset de pose predefinido, resultando em animações faciais significativamente mais realistas.
Compatibilidade de Personagens
Apesar do nome, Runtime MetaHuman Lip Sync funciona com uma grande variedade de personagens além de apenas MetaHumans:
Sistemas Comerciais Populares de Personagens
- Daz Genesis 8/9 personagens
- Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) personagens
- Mixamo personagens
Suporte a Padrões de Animação
- Sistemas de blendshapes baseados em FACS
- Padrão de blendshapes do Apple ARKit
- Conjuntos de fonemas de Preston Blair
- Sistemas de fonemas do 3ds Max
- Qualquer personagem com morph targets personalizados para expressões faciais
Muitos sistemas populares, incluindo Reallusion CC4/CC5 e Daz Genesis 8.1/9, também podem ser convertidos para usar nomes de blendshapes no padrão ARKit. Isso permite que você use o Modelo Realista nesses personagens, com sua animação facial de maior qualidade, como alternativa ao mapeamento manual de visemas do Modelo Padrão. Consulte Conversão de Personagens para Blendshapes do ARKit para obter detalhes.
Para personagens não MetaHuman que usam o Standard Model, consulte o Guia de Configuração para Personagens Personalizados. Para personagens baseados em ARKit que usam os Realistic Models, consulte a Seleção de Conjunto de Morph Targets.
Pré-visualização de Animação
Confira estas animações curtas para ver a qualidade da animação de lip sync produzida pelo plugin em diferentes tipos de personagens e modelos:
Principais recursos
- Sincronização labial em tempo real a partir da entrada de microfone
- Suporte para processamento offline de áudio
- Compatibilidade multiplataforma com suporte a plataformas específicas por modelo.
- Suporte para múltiplos sistemas de personagens e padrões de animação
- Mapeamento flexível de visemas para personagens personalizados
- Suporte universal a idiomas - funciona com qualquer idioma falado por meio de análise de áudio.
- Animação facial sensível ao humor para maior expressividade
- Tipos de saída configuráveis (controles de rosto completo ou apenas boca)
- Opcionais auxiliares de animação dos olhos para piscadas e rastreamento do olhar.
Modelos de Lip Sync
O plugin oferece vários modelos de lip sync para atender a diferentes necessidades de projeto:
- Standard Model
- Modelo Realista
- Modelo Realista com Suporte a Humor
O modelo padrão de sincronização labial oferece desempenho eficiente e multiplataforma com ampla compatibilidade de personagens:
- Funciona com MetaHumans e todos os tipos de personagens personalizados
- Otimizado para desempenho em tempo real
- Menores requisitos de recursos
- Suporte a plataformas: Windows, Android, plataformas baseadas em Android (incluindo Meta Quest)
Para usar o Standard Model, você precisa instalar um plugin de extensão adicional. Consulte a seção Pré-requisitos para instruções de instalação.
O modelo realista de sincronização labial oferece fidelidade visual aprimorada especificamente para personagens MetaHuman:
- Compatível com personagens baseados em MetaHuman e ARKit, com animação facial avançada (81 controles faciais)
- Maior qualidade visual com movimentos da boca mais naturais
- Requisitos de desempenho ligeiramente superiores
- Processamento de áudio em streaming para aplicações em tempo real
- Ideal para experiências cinematográficas e interações com personagens em close-up
- Três níveis de otimização: Original, Semi-Optimized e Highly Optimized
- Conjuntos de morph targets configuráveis (consulte Seleção de Conjuntos de Morph Targets)
- Suporte a plataformas: Windows, Mac, iOS, Linux, Android e plataformas baseadas em Android (incluindo Meta Quest)
O Realistic Model está incluído no plugin principal e não requer extensões adicionais para uso.
O modelo realista habilitado para humor fornece animação facial consciente das emoções para personagens MetaHuman:
- Compatível com personagens MetaHuman e baseados em ARKit com animação facial responsiva ao humor (81 controles faciais).
- 12 tipos diferentes de humor (Neutro, Feliz, Triste, Confiante, etc.)
- Intensidade de humor configurável (0.0 a 1.0)
- Tempo de antecipação ajustável para melhor sincronização (20ms a 200ms)
- Tipos de saída selecionáveis: rosto completo ou somente controles de boca.
- Processamento de áudio em streaming para aplicações em tempo real
- Conjuntos configuráveis de morph targets (consulte Seleção de Conjuntos de Morph Targets)
- Suporte de Plataformas: Windows, Mac, iOS, Linux, Android, plataformas baseadas em Android (incluindo Meta Quest)
O Modelo Realista com Controle de Humor está incluído no plugin principal e não requer nenhuma extensão adicional para uso.
Você pode escolher o modelo apropriado com base nos requisitos do seu projeto quanto a desempenho, compatibilidade de personagens, qualidade visual, plataforma de destino e necessidades de recursos.
Como Funciona
O plugin processa a entrada de áudio da seguinte forma:
- Os dados de áudio são recebidos como formato PCM float, com canais e taxa de amostragem especificados
- O plugin processa o áudio para gerar dados de controle facial ou visemas, dependendo do modelo
- Para modelos com suporte a humor, o contexto emocional é aplicado à animação facial
- Os dados de animação orientam os movimentos faciais do personagem em tempo real
Arquitetura de Desempenho
O Runtime MetaHuman Lip Sync usa inferência somente em CPU para fornecer resultados de sincronização labial consistentes e de baixa latência, adequados para aplicações em tempo real. Por padrão, o plugin realiza o processamento de sincronização labial a cada 10 milissegundos (ajustável — consulte Configuração do Plugin para todas as configurações disponíveis, incluindo Tamanho do Bloco de Processamento, número de threads e outros parâmetros de desempenho).
Visão Geral da Arquitetura do Modelo
Os modelos de sincronização labial usam uma rede neural compacta baseada em transformer que processa áudio por meio da análise de espectrograma mel. Essa arquitetura leve é especificamente projetada para desempenho em tempo real, com inferência eficiente em CPU e consumo mínimo de memória.
Por que inferência em CPU?
Para operações de inferência pequenas e frequentes, como sincronização labial em tempo real, o processamento pela CPU oferece melhores características de latência do que a GPU. Com tamanho de lote 1 e intervalos de inferência de 10 a 100 ms, a sobrecarga da GPU devida a transferências PCIe e lançamentos de kernel geralmente excede o tempo real de computação. Além disso, em motores de jogos, a GPU já está saturada com renderização, shaders e física, criando contenção de recursos que introduz picos de latência imprevisíveis.
Compatibilidade de Hardware
O plugin funciona de forma eficiente na maioria das CPUs de nível médio ou superior, sem exigir hardware gráfico dedicado, oferecendo desempenho em tempo real em plataformas desktop, móveis e VR. Para hardware mais fraco, você pode ajustar o Tipo de Modelo para Semi-Optimized ou Highly Optimized, ou aumentar o Tamanho do Bloco de Processamento para manter o desempenho em tempo real com capacidade de resposta ligeiramente reduzida.
Início Rápido
Aqui está uma configuração básica para habilitar o lip sync no seu personagem:
- Para personagens MetaHuman, siga o Guia de Configuração
- Para personagens personalizados, siga o Guia de Configuração para Personagens Personalizados
- Escolha e configure seu modelo de lip sync preferido
- Configure o processamento de entrada de áudio no seu Blueprint
- Conecte o nó de lip sync apropriado no Animation Blueprint
- Reproduza o áudio e veja seu personagem animar em sincronia
Animação opcional dos olhos
O plugin também inclui auxiliares opcionais para piscadas automáticas e rastreamento do olhar em MetaHumans. Eles são independentes do lip sync e podem ser usados isoladamente ou sobrepostos a ele. Consulte Auxiliares de Animação dos Olhos.
Recursos Adicionais
📦 Downloads e Links
Projetos de Demonstração:
Dois projetos de demonstração prontos para uso estão disponíveis - consulte a página dedicada Projetos de Demonstração para obter detalhes completos, downloads e tutoriais passo a passo:
- Fluxo de Trabalho Completo de NPC Conversacional com AI - reconhecimento de fala + chatbot LLM + TTS + sincronização labial
- Demonstração Básica de Sincronização Labial - entrada de microfone, arquivos de áudio, TTS
Ambos os demos são multiplataforma (Windows, Mac, Linux, iOS, Android, Meta Quest) e são fornecidos como builds empacotados e projetos-fonte completos para UE 5.6+.
🎥 Tutoriais em Vídeo
Demos em destaque:
Tutoriais do Modelo Realista (Alta Qualidade):
- Sincronização Labial de Alta Qualidade a partir de Arquivo/Buffer de Áudio
- Sincronização Labial de Alta Qualidade com Controle de Humor e TTS Local
- Sincronização Labial de Alta Qualidade com ElevenLabs e OpenAI TTS
- Sincronização Labial de Alta Qualidade com Microfone ao Vivo
- Sincronização Labial de Alta Qualidade para Personagens ARKit
Tutoriais do Standard Model:
- Sincronização Labial Padrão com Microfone ao Vivo
- Lip Sync Padrão com Texto para Fala Local
- Lip Sync Padrão com ElevenLabs e OpenAI TTS
Configuração Geral:
- Adicionando um personagem MetaHuman personalizado ao projeto de demonstração
- Vídeo tutorial de configuração
- Piscar de Olhos e Rastreamento de Câmera do MetaHuman
- Combinando com Animações Faciais e Corporais
- Passo a passo do projeto de demonstração (versão antiga)
💬 Suporte
- Desenvolvimento Personalizado: [email protected] (soluções personalizadas para equipes e organizações)