Configuração do Plugin
Configuração do Modelo
Para uma operação confiável com os modelos Realistic e Mood-Enabled Realistic, recrie o gerador antes de cada nova reprodução de áudio em vez de reutilizá-lo durante longos silêncios. Consulte Recriação do Gerador em Solução de Problemas para mais detalhes.
Configuração do Modelo Padrão
O nó Create Runtime Viseme Generator usa configurações padrão que funcionam bem para a maioria dos cenários. A configuração é feita através das propriedades do nó de blending do Animation Blueprint.
Para opções de configuração do Animation Blueprint, consulte a seção Configuração de Lip Sync abaixo.
Configuração de Modelo Realista
O nó Create Realistic MetaHuman Lip Sync Generator aceita um parâmetro Configuration opcional que permite personalizar o comportamento do gerador:
Tipo de modelo
A configuração Model Type determina qual versão do modelo realista usar:
| Tipo de Modelo | Desempenho | Qualidade Visual | Tratamento de Ruído | Casos de Uso Recomendados |
|---|---|---|---|---|
| Altamente Otimizado (Padrão) | Desempenho máximo, menor uso de CPU | Boa qualidade | Pode apresentar movimentos labiais perceptíveis com ruído de fundo ou sons que não sejam de voz | Ambientes com áudio limpo, cenários com exigência de desempenho |
| Semi-Otimizado | Bom desempenho, uso moderado de CPU | Alta qualidade | Maior estabilidade com áudio ruidoso | Equilíbrio entre desempenho e qualidade, condições de áudio mistas |
| Original | Adequado para uso em tempo real em CPUs modernas | Qualidade máxima | Mais estável com ruído de fundo e sons que não sejam de voz | Produções de alta qualidade, ambientes com áudio ruidoso, quando é necessária precisão máxima |
Configurações de Desempenho
Intra Op Threads: Controla o número de threads usadas para operações internas de processamento do modelo.
- 0 (Padrão/Automático): Usa detecção automática (normalmente 1/4 dos núcleos de CPU disponíveis, máximo 4)
- 1-16: Especifica manualmente a contagem de threads. Valores mais altos podem melhorar o desempenho em sistemas multi-core, mas usam mais CPU
Threads de Interoperabilidade: Controla o número de threads usadas para execução paralela de diferentes operações do modelo.
- 0 (Padrão/Automático): Usa detecção automática (normalmente 1/8 dos núcleos de CPU disponíveis, máximo 2)
- 1-8: Especifica manualmente a contagem de threads. Normalmente mantida baixa para processamento em tempo real
Tamanho do Bloco de Processamento
O Processing Chunk Size determina quantas amostras são processadas em cada etapa de inferência. O valor padrão é 160 amostras (10ms de áudio a 16kHz):
- Valores menores fornecem atualizações mais frequentes, mas aumentam o uso de CPU
- Valores maiores reduzem a carga da CPU, mas podem diminuir a capacidade de resposta do lip sync
- Recomenda-se usar múltiplos de 160 para um alinhamento ideal

Configuração de Modelo com Suporte a Humor
O nó Create Realistic MetaHuman Lip Sync With Mood Generator oferece opções de configuração adicionais além do modelo realista básico:
Configuração Básica
Lookahead Ms: Tempo de lookahead em milissegundos para melhorar a precisão do lip sync.
- Padrão: 80ms
- Intervalo: 20ms a 200ms (deve ser divisível por 20)
- Valores mais altos proporcionam melhor sincronização, mas aumentam a latência
Tipo de Saída: Controla quais controles faciais são gerados.
- Rosto Completo: Todos os 81 controles faciais (sobrancelhas, olhos, nariz, boca, mandíbula, língua)
- Somente Boca: Apenas controles relacionados à boca, mandíbula e língua
Configurações de Desempenho: Usa as mesmas configurações de Intra Op Threads e Inter Op Threads do modelo realista regular.
Configurações de Humor
Moods disponíveis:
- Neutro, Feliz, Triste, Nojo, Raiva, Surpresa, Medo
- Confiante, Animado, Entediado, Brincalhão, Confuso
Intensidade do Humor: Controla quão fortemente o humor afeta a animação (0.0 a 1.0)
Controle de Humor em Tempo Real
Você pode ajustar as configurações de humor durante a execução usando as seguintes funções:
- Definir Humor: Altera o tipo de humor atual
- Definir Intensidade do Humor: Ajusta quão fortemente o humor afeta a animação (0.0 a 1.0)
- Definir Lookahead Ms: Modifica o tempo de lookahead para sincronização
- Definir Tipo de Saída: Alterna entre os controles de Rosto Completo e Somente Boca

Guia de Seleção de Humor
Escolha moods apropriados com base no seu conteúdo:
| Mood | Melhor Para | Faixa de Intensidade Típica |
|---|---|---|
| Neutro | Conversa geral, narração, estado padrão | 0.5 - 1.0 |
| Feliz | Conteúdo positivo, diálogo alegre, comemorações | 0.6 - 1.0 |
| Triste | Conteúdo melancólico, cenas emocionais, momentos sombrios | 0.5 - 0.9 |
| Nojo | Reações negativas, conteúdo desagradável, rejeição | 0.4 - 0.8 |
| Raiva | Diálogo agressivo, cenas de confronto, frustração | 0.6 - 1.0 |
| Surpresa | Eventos inesperados, revelações, reações de choque | 0.7 - 1.0 |
| Medo | Situações ameaçadoras, ansiedade, diálogo nervoso | 0.5 - 0.9 |
| Confiante | Apresentações profissionais, diálogo de liderança, fala assertiva | 0.7 - 1.0 |
| Empolgado | Conteúdo energético, anúncios, diálogo entusiasmado | 0.8 - 1.0 |
| Entediado | Conteúdo monótono, diálogo desinteressado, fala cansada | 0.3 - 0.7 |
| Brincalhão | Conversa casual, humor, interações descontraídas | 0.6 - 0.9 |
| Confuso | Diálogo com muitas perguntas, incerteza, perplexidade | 0.4 - 0.8 |
Configuração do Animation Blueprint
Configuração de Lip Sync
- Modelo Padrão
- Modelos realistas
O nó Blend Runtime MetaHuman Lip Sync possui opções de configuração em seu painel de propriedades:
| Propriedade | Padrão | Descrição |
|---|---|---|
| Velocidade de Interpolação | 25 | Controla a rapidez com que os movimentos labiais fazem a transição entre visemes. Valores mais altos resultam em transições mais rápidas e abruptas. |
| Tempo de Redefinição | 0.2 | A duração em segundos após a qual o lip sync é redefinido. Isso é útil para evitar que o lip sync continue após o áudio ter parado. |
Animação de Riso
Você também pode adicionar animações de risada que responderão dinamicamente à risada detectada no áudio:
- Adicione o nó
Blend Runtime MetaHuman Laughter - Conecte sua variável
RuntimeVisemeGeneratorao pinoViseme Generator - Se você já está usando lip sync:
- Conecte a saída do nó
Blend Runtime MetaHuman Lip SyncaoSource Posedo nóBlend Runtime MetaHuman Laughter - Conecte a saída do nó
Blend Runtime MetaHuman Laughterao pinoResultdoOutput Pose
- Conecte a saída do nó
- Se usar apenas risada sem lip sync:
- Conecte sua pose de origem diretamente ao
Source Posedo nóBlend Runtime MetaHuman Laughter - Conecte a saída ao pino
Result
- Conecte sua pose de origem diretamente ao

Quando o riso é detectado no áudio, seu personagem será animado dinamicamente de acordo:
Configuração de Riso
O nó Blend Runtime MetaHuman Laughter tem suas próprias opções de configuração:
| Propriedade | Padrão | Descrição |
|---|---|---|
| Velocidade de Interpolação | 25 | Controla a rapidez com que os movimentos labiais fazem a transição entre as animações de riso. Valores mais altos resultam em transições mais rápidas e abruptas. |
| Tempo de Redefinição | 0.2 | A duração em segundos após a qual o riso é redefinido. Isso é útil para evitar que o riso continue depois que o áudio parar. |
| Peso Máximo do Riso | 0.7 | Escala a intensidade máxima da animação de riso (0.0 - 1.0). |
Nota: A detecção de risada está disponível atualmente apenas com o Modelo Standard.
O nó Blend Realistic MetaHuman Lip Sync tem opções de configuração em seu painel de propriedades:
| Propriedade | Padrão | Descrição |
|---|---|---|
| Velocidade de Interpolação | 30 | Controla a rapidez com que as expressões faciais fazem a transição durante a fala ativa. Valores mais altos resultam em transições mais rápidas e abruptas. |
| Velocidade de Interpolação em Repouso | 15 | Controla a rapidez com que as expressões faciais fazem a transição de volta ao estado de repouso/neutro. Valores mais baixos criam retornos mais suaves e graduais à pose de repouso. |
| Tempo de Redefinição | 0.2 | Duração em segundos após a qual o lip sync é redefinido para o estado de repouso. Útil para evitar que as expressões continuem após o áudio parar. |
| Preservar Estado de Repouso | false | Quando ativado, preserva o último estado emocional durante os períodos de repouso em vez de redefinir para neutro. |
| Preservar Expressões dos Olhos | true | Controla se os controles faciais relacionados aos olhos são preservados durante o estado de repouso. Só tem efeito quando Preservar Estado de Repouso está ativado. |
| Preservar Expressões das Sobrancelhas | true | Controla se os controles faciais relacionados às sobrancelhas são preservados durante o estado de repouso. Só tem efeito quando Preservar Estado de Repouso está ativado. |
| Preservar Formato da Boca | false | Controla se os controles de formato da boca (excluindo movimentos específicos da fala, como língua e mandíbula) são preservados durante o estado de repouso. Só tem efeito quando Preservar Estado de Repouso está ativado. |
Preservação do Estado Ocioso
O recurso Preserve Idle State aborda como o modelo Realistic lida com períodos de silêncio. Diferentemente do modelo Standard, que usa visemes discretos e retorna consistentemente a valores zero durante o silêncio, a rede neural do modelo Realistic pode manter um posicionamento facial sutil que difere da pose de repouso padrão do MetaHuman.
Quando Ativar:
- Manter expressões emocionais entre segmentos de fala
- Preservar os traços de personalidade do personagem
- Garantir a continuidade visual em sequências cinematográficas
Opções de Controle Regional:
- Expressões Oculares: Preserva o estreitamento, a abertura e o posicionamento das pálpebras
- Expressões de Sobrancelha: Mantém o posicionamento das sobrancelhas e da testa
- Formato da Boca: Mantém a curvatura geral da boca enquanto permite que os movimentos da fala (língua, mandíbula) sejam redefinidos
Combinando com animações existentes
Prefere assistir em vez de ler? Confira o tutorial em vídeo que cobre exatamente esta configuração.
Para aplicar lip sync e risada junto com animações corporais existentes e animações faciais personalizadas sem sobrescrevê-las:
Esta configuração se aplica ao Animation Blueprint do rosto, já que o lip sync não faz parte do Animation Blueprint do corpo. Para animações corporais personalizadas (por exemplo, torso, braços e outros movimentos do corpo), basta conectar sua sequência de animação (por meio de um Sequence Player) diretamente à pose de saída no Animation Blueprint do corpo. Nenhuma configuração adicional é necessária ali.
- Adicione um nó
Layered blend per boneentre suas animações de corpo e a saída final. - Configure a configuração de camadas:
- Adicione 1 item ao array
Layer Setup - Adicione 3 itens aos
Branch Filterspara a camada, com os seguintesBone Names:FACIAL_C_FacialRootFACIAL_C_Neck2RootFACIAL_C_Neck1Root
- Adicione 1 item ao array
- Importante para animações faciais personalizadas: Em
Curve Blend Option, selecione "Use Max Value". Isso permite que animações faciais personalizadas (expressões, emoções, etc.) sejam corretamente sobrepostas ao lip sync. - Faça as conexões:
- Sua animação personalizada (normalmente um
Sequence Playercom o asset de sequência de animação desejado) → entradaBase Pose - Saída de animação facial (dos nós de lip sync e/ou risada) → entrada
Blend Poses 0 - Nó de blend em camadas → pose
Resultfinal
- Sua animação personalizada (normalmente um

Seleção de Conjunto de Morph Targets
- Modelo Padrão
- Modelos realistas
O Modelo Padrão usa pose assets que, por natureza, suportam qualquer convenção de nomenclatura de morph target através da configuração personalizada de pose asset. Nenhuma configuração adicional é necessária.
O nó Blend Realistic MetaHuman Lip Sync inclui uma propriedade Morph Target Set que determina qual convenção de nomenclatura de morph target usar para animação facial:
| Conjunto de Morph Targets | Descrição | Casos de Uso |
|---|---|---|
| MetaHuman (Padrão) | Nomes padrão de morph targets do MetaHuman (ex.: CTRL_expressions_jawOpen) | Personagens MetaHuman |
| ARKit | Nomes compatíveis com Apple ARKit (ex.: JawOpen, MouthSmileLeft) | Personagens baseados em ARKit |
Convertendo Personagens para ARKit ou MetaHuman Blendshapes
Se o seu personagem não usa nativamente os nomes de blendshapes padrão do ARKit, vários sistemas de personagens comerciais populares podem ser convertidos para produzi-los (ou, para o CC5, convertidos diretamente para blendshapes nativos do MetaHuman). Isso dá a você acesso ao ARKit ou ao MetaHuman Morph Target Set acima, em vez do processo de mapeamento manual de visemes exigido para o Standard Model. Personagens CC4 e CC5 são tratados de forma diferente aqui, já que personagens CC5 podem compartilhar o rig facial nativo do MetaHuman em vez de precisar de uma conversão ARKit. CC5: converter para blendshapes do MetaHuman (recomendado) Se o seu personagem for criado no CC5 com o perfil facial HD, ele já compartilha os controles faciais e o esqueleto do MetaHuman, então não há necessidade de gerar blendshapes ARKit manualmente. Em vez disso: Depois de importado, selecione a opção MetaHuman Morph Target Set em vez de ARKit, já que os blendshapes do personagem já usam a nomenclatura nativa do MetaHuman. CC4 (ou CC5 sem o perfil HD): converter para blendshapes do ARKit Se você estiver no CC4, ou em um personagem CC5 que não usa o perfil facial HD, use a conversão manual do ARKit em vez disso. Antes de começar, certifique-se de que o Facial Profile do seu personagem esteja definido como CC4 Extended (não Standard, Extended-Plus ou o novo HD Facial Profile). O mapeamento de blendshape do script é codificado de forma fixa com base nos nomes dos sliders do Extended; outros perfis usam convenções de nomenclatura diferentes e o script irá silenciosamente ignorar ou falhar ao encontrar os sliders esperados. Baixe este script: Abra o script em um editor de texto e, onde estiver escrito No Character Creator, escolha seu personagem e, em seguida, no menu superior, em Script, selecione Load Python. Depois, selecione o script que você acabou de editar. O script agora criará o conjunto completo de blendshapes ARKit a partir dos sliders padrão da Reallusion e os exportará como arquivos OBJ. Isso pode levar alguns minutos. Agora você pode importar essas formas indo até a janela Facial Profile Editor. Clique no botão Edit Expressions e, no menu suspenso Batch Import, selecione OBJ. Aqui você pode importar a pasta que você referenciou anteriormente. Isso então listará todas as formas ARKit. Escreva um nome na Target Category, por exemplo AR_Kit, e clique em OK. Isso terá criado uma nova categoria em Expression. Você pode desativar todas as outras categorias. Depois que a categoria ARKit estiver configurada, exporte seu personagem como FBX normalmente. Isso concede ao personagem os 52 blendshapes ARKit padrão, que você pode então usar com a opção ARKit Morph Target Set acima. Observação: o movimento da mandíbula é impulsionado em parte pela rotação dos ossos, e não por blendshapes puros no rig do CC4, então Os morphs FACS do Daz, disponíveis nativamente no Genesis 8.1 e Genesis 9, já são compatíveis com ARKit sem necessidade de renomeação. O Genesis 8 comum (não o 8.1) não inclui esses por padrão. Você precisará usar o Genesis 8.1 ou adicionar um pacote separado de morphs FACS. O add-on Diffeomorphic mantido ativamente (uma ponte entre Daz Studio e Blender, não afiliada à Daz 3D) é a forma recomendada de trazer esses itens para o Unreal: Uma vez exportado, use a opção ARKit Morph Target Set acima. Observação: as formas de direção do olhar nas cílios e nos globos oculares podem não ser totalmente transferidas, já que são controladas de forma diferente da malha principal do rosto, mas isso não afeta o lip sync, que só precisa das formas da boca e do maxilar.Guias de conversão para Reallusion CC4/CC5 e Daz Genesis 8.1/9 (clique para expandir)
rl_export_arkit_objs.pyoutput_dir = "path/to/your/target/folder", atribua o caminho para a sua pasta de exportação. Certifique-se de usar barras normais /.



jawOpen pode parecer fraco ou não abrir a boca de forma convincente após a exportação. Se isso acontecer, ative Mouth Open as Morph nas opções de exportação do FBX; isso incorpora o movimento da mandíbula impulsionado pelos ossos em um blendshape dedicado que pode ser atribuído como a origem de jawOpen em vez do padrão. Ou o complemento cc_blender_tools pode encaminhar o personagem pelo Blender para corrigir isso e outros problemas de forma; consulte a seção "Blender Round Trip" da sua documentação para ver o fluxo de trabalho (o título da página menciona Unity, mas esta seção específica é independente de engine).
Ajuste fino do comportamento de Lip Sync
Escalonando Curvas Específicas de Lip Sync
Você pode atenuar (ou amplificar) movimentos faciais individuais produzidos pelo lip sync usando um nó Modify Curve. Isso é útil quando uma curva específica parece muito pronunciada para o conteúdo do seu áudio ou para o seu personagem.
Configuração:
- Depois do seu nó de blend de lip sync, adicione um nó
Modify Curve - Clique com o botão direito no nó e selecione Add Curve Pin, depois insira o nome da curva que você deseja escalar
- Defina a propriedade Apply Mode do nó como Scale
- Defina o parâmetro Value: valores abaixo de 1.0 atenuam o movimento, valores acima de 1.0 amplificam-no (por exemplo, 0.8 = redução de 20%)
Curvas comumente escaladas:
| Nome da Curva | Finalidade | Aplica-se A | Ajuste Típico |
|---|---|---|---|
CTRL_expressions_tongueOut | Protrusão da língua para frente durante certos fonemas | Modelo padrão | 0.8 para reduzir a protrusão |
CTRL_expressions_jawOpen | Intervalo de abertura da mandíbula | Modelos realistas | 0.9 para reduzir o movimento da mandíbula |
Você pode adicionar vários pinos de curva ao mesmo nó Modify Curve para escalar várias curvas de uma só vez.
Ajuste fino específico por humor
Para modelos com suporte a humor, você pode ajustar expressões emocionais específicas:
Controle de Sobrancelha:
CTRL_expressions_browRaiseInL/CTRL_expressions_browRaiseInR- Elevação da sobrancelha internaCTRL_expressions_browRaiseOuterL/CTRL_expressions_browRaiseOuterR- Elevação da sobrancelha externaCTRL_expressions_browDownL/CTRL_expressions_browDownR- Abaixamento da sobrancelha
Controle de Expressão Ocular:
CTRL_expressions_eyeSquintInnerL/CTRL_expressions_eyeSquintInnerR- Apertar os olhosCTRL_expressions_eyeCheekRaiseL/CTRL_expressions_eyeCheekRaiseR- Levantar as bochechas
Comparação e Seleção de Modelos
Escolhendo Entre Modelos
Ao decidir qual modelo de lip sync usar no seu projeto, considere estes fatores:
| Consideração | Modelo Padrão | Modelo Realista | Modelo Realista com Humor |
|---|---|---|---|
| Compatibilidade de Personagens | MetaHumans e todos os tipos de personagens personalizados | MetaHumans (e personagens ARKit) | MetaHumans (e personagens ARKit) |
| Qualidade Visual | Bom lip sync com desempenho eficiente | Realismo aprimorado com movimentos de boca mais naturais | Realismo aprimorado com expressões emocionais |
| Desempenho | Otimizado para todas as plataformas, incluindo mobile/VR | Requisitos de recursos mais altos | Requisitos de recursos mais altos |
| Recursos | 14 visemes, detecção de riso | 81 controles faciais, 3 níveis de otimização | 81 controles faciais, 12 humores, saída configurável |
| Suporte de Plataforma | Windows, Android, Quest | Windows, Mac, iOS, Linux, Android, Quest | Windows, Mac, iOS, Linux, Android, Quest |
| Casos de Uso | Aplicações gerais, jogos, VR/AR, mobile | Experiências cinematográficas, interações em close-up | Narrativa emocional, interação avançada com personagens |
Compatibilidade de Versão da Engine
Se você estiver usando o Unreal Engine 5.2, os Realistic Models podem não funcionar corretamente devido a um bug na biblioteca de reamostragem do UE. Para usuários do UE 5.2 que precisam de funcionalidade confiável de lip sync, use o Standard Model em vez disso.
Este problema é específico do UE 5.2 e não afeta outras versões da engine.
Recomendações de Desempenho
- Para a maioria dos projetos, o Standard Model oferece um excelente equilíbrio entre qualidade e desempenho
- Use o Realistic Model quando você precisar da mais alta fidelidade visual para personagens MetaHuman
- Use o Mood-Enabled Realistic Model quando o controle de expressão emocional for importante para sua aplicação
- Considere a capacidade de desempenho da sua plataforma de destino ao escolher entre os modelos
- Teste diferentes níveis de otimização para encontrar o melhor equilíbrio para o seu caso de uso específico
Solução de problemas
Problemas Comuns
Recriação do Gerador para Modelos Realistas: Para uma operação confiável e consistente com os Modelos Realistas, recomenda-se recriar o gerador sempre que você quiser alimentar novos dados de áudio após um período de inatividade. Isso se deve ao comportamento do runtime ONNX, que pode fazer com que o lip sync pare de funcionar ao reutilizar geradores após períodos de silêncio.
Por exemplo, você pode recriar o gerador de lip sync a cada início de reprodução, como sempre que você chamar Play Sound 2D ou usar qualquer outro método para iniciar a reprodução da onda sonora e o lip sync:

Localização do Plugin para Integração do Runtime Text To Speech: Ao usar o Runtime MetaHuman Lip Sync junto com o Runtime Text To Speech (ambos os plugins usam ONNX Runtime), você pode enfrentar problemas se os plugins estiverem instalados na pasta Marketplace do engine. Para corrigir isso:
- Localize ambos os plugins na pasta de instalação do seu UE em
\Engine\Plugins\Marketplace(por exemplo,C:\Program Files\Epic Games\UE_5.6\Engine\Plugins\Marketplace) - Mova as pastas
RuntimeMetaHumanLipSynceRuntimeTextToSpeechpara a pastaPluginsdo seu projeto - Se o seu projeto não tiver uma pasta
Plugins, crie uma no mesmo diretório do seu arquivo.uproject - Reinicie o Unreal Editor
Isso resolve problemas de compatibilidade que podem ocorrer quando vários plugins baseados no ONNX Runtime são carregados do diretório Marketplace do engine.
Configuração de Empacotamento (Windows): Se o lip sync não estiver funcionando corretamente no seu projeto empacotado no Windows, certifique-se de que você está usando a configuração de build Shipping em vez de Development. A configuração Development pode causar problemas com o runtime ONNX dos modelos realistas em builds empacotados.
Para corrigir isso:
- Nas suas Configurações do Projeto → Empacotamento, defina a Configuração de Build como Shipping
- Reempacote seu projeto

Em alguns projetos somente com Blueprint, o Unreal Engine ainda pode compilar na configuração Development mesmo quando Shipping está selecionado. Se isso acontecer, converta seu projeto para um projeto C++ adicionando pelo menos uma classe C++ (ela pode estar vazia). Para fazer isso, vá em Tools → New C++ Class no menu do editor da UE e crie uma classe vazia. Isso forçará o projeto a compilar corretamente na configuração Shipping. Seu projeto pode permanecer somente com Blueprint em funcionalidade, a classe C++ é necessária apenas para a configuração de compilação adequada.
Responsividade degradada do Lip Sync: Se você perceber que o lip sync se torna menos responsivo com o tempo ao usar Streaming Sound Wave ou Capturable Sound Wave, isso pode ser causado por acúmulo de memória. Por padrão, a memória é realocada cada vez que um novo áudio é anexado. Para evitar esse problema, chame a função ReleaseMemory periodicamente para liberar a memória acumulada, como a cada 30 segundos ou mais.
Otimização de Desempenho:
- Ajuste o Tamanho do Bloco de Processamento para modelos Realistic com base nos seus requisitos de desempenho
- Use contagens de threads apropriadas para o seu hardware de destino
- Considere usar o tipo de saída Mouth Only para modelos com suporte a humor quando a animação facial completa não for necessária