Übersicht

Runtime MetaHuman Lip Sync ist ein Plugin, das Echtzeit-, Offline- und plattformübergreifende Lippensynchronisation für MetaHuman- und benutzerdefinierte Charaktere ermöglicht. Damit können Sie die Lippen eines Charakters als Reaktion auf Audioeingaben aus verschiedenen Quellen animieren, darunter:
- Synthetisierte Sprache von Runtime Text To Speech oder Runtime AI Chatbot Integrator
- Gestreamte oder importierte Audiodaten in mehreren Formaten über den Runtime Audio Importer
- Jegliche Audiodaten im Float-PCM-Format (ein Array von Gleitkomma-Abtastwerten)
Das Standard Model erzeugt 14 Viseme und führt die Lip-Sync-Animation mithilfe eines vordefinierten Pose-Assets durch. Im Gegensatz dazu erzeugen die Realistic Models (exklusiv für MetaHuman- und ARKit-basierte Charaktere) 81 Gesichtssteuerungsänderungen, ohne auf ein vordefiniertes Pose-Asset zurückzugreifen, was zu deutlich realistischeren Gesichtsanimationen führt.
Charakterkompatibilität
Trotz seines Namens funktioniert Runtime MetaHuman Lip Sync mit einer breiten Palette von Charakteren, weit über MetaHumans hinaus:
Beliebte kommerzielle Charaktersysteme
- Daz Genesis 8/9 Charaktere
- Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) Charaktere
- Mixamo Charaktere
Unterstützung für Animationsstandards
- FACS-basierte Blendshape-Systeme
- Apple-ARKit-Blendshape-Standard
- Preston-Blair-Phonem-Sets
- 3ds-Max-Phonem-Systeme
- Beliebiger Charakter mit benutzerdefinierten Morph-Targets für Gesichtsausdrücke
Viele gängige Systeme, einschließlich Reallusion CC4/CC5 und Daz Genesis 8.1/9, können ebenfalls konvertiert werden, um ARKit-Standard-Blendshape-Namen zu verwenden. Dadurch können Sie für diese Charaktere das **
Für Nicht-MetaHuman-Charaktere mit dem Standard Model siehe Leitfaden zur Einrichtung eigener Charaktere. Für ARKit-basierte Charaktere mit den Realistic Models siehe Auswahl des Morph-Target-Sets.
Animationsvorschau
Schauen Sie sich diese kurzen Animationen an, um die Qualität der von dem Plugin erzeugten Lippensynchronisations-Animation für verschiedene Charaktertypen und Modelle zu sehen:
Wichtigste Funktionen
- Echtzeit-Lippensynchronisation über Mikrofon-Eingabe
- Unterstützung für Offline-Audioverarbeitung
- Plattformübergreifende Kompatibilität mit modellspezifischer Plattformunterstützung
- Unterstützung für mehrere Charaktersysteme und Animationsstandards
- Flexible Visem-Zuordnung für benutzerdefinierte Charaktere
- Universelle Sprachunterstützung – funktioniert mit jeder gesprochenen Sprache durch Audioanalyse
- Stimmungsbewusste Gesichtsanimation für verbesserte Ausdruckskraft
- Konfigurierbare Ausgabetypen (vollständige Gesichts- oder Nur-Mund-Steuerung)
- Optionale Augenanimationshilfen für Blinzeln und Blickverfolgung
Lip-Sync-Modelle
Das Plugin bietet mehrere Lip-Sync-Modelle, um unterschiedlichen Projektanforderungen gerecht zu werden:
- Standardmodell
- Realistisches Modell
- Stimmungsfähiges realistisches Modell
Das Standard-Lip-Sync-Modell bietet effiziente, plattformübergreifende Leistung mit breiter Charakterkompatibilität:
- Funktioniert mit MetaHumans und allen benutzerdefinierten Charaktertypen
- Optimiert für Echtzeitleistung
- Geringere Ressourcenanforderungen
- Plattformunterstützung: Windows, Android, Android-basierte Plattformen (einschließlich Meta Quest)
Um das Standard Model zu verwenden, müssen Sie ein zusätzliches Erweiterungs-Plugin installieren. Siehe den Abschnitt „Voraussetzungen“ für Installationsanweisungen.
Das realistische Lip-Sync-Modell liefert eine verbesserte visuelle Wiedergabetreue speziell für MetaHuman-Charaktere:
- Kompatibel mit MetaHuman- und ARKit-basierten Charakteren mit fortschrittlicher Gesichtsanimation (81 Gesichtssteuerungen)
- Höhere visuelle Qualität mit natürlicheren Mundbewegungen
- Etwas höhere Leistungsanforderungen
- Streaming-Audioverarbeitung für Echtzeitanwendungen
- Ideal für filmische Erlebnisse und Charakterinteraktionen in Nahaufnahme
- Drei Optimierungsstufen: Original, Semi-Optimized und Highly Optimized
- Konfigurierbare Morph-Target-Sets (siehe Auswahl der Morph-Target-Sets)
- Plattformunterstützung: Windows, Mac, iOS, Linux, Android, Android-basierte Plattformen (einschließlich Meta Quest)
Das Realistic Model ist im Haupt-Plugin enthalten und erfordert keine zusätzlichen Erweiterungen zur Nutzung.
Das realistische Modell mit Stimmungsunterstützung bietet emotionsbewusste Gesichtsanimation für MetaHuman-Charaktere:
- Kompatibel mit MetaHuman- und ARKit-basierten Charakteren mit stimmungsreaktiver Gesichtsanimation (81 Gesichtssteuerungen)
- 12 verschiedene Stimmungstypen (Neutral, Glücklich, Traurig, Selbstbewusst, usw.)
- Konfigurierbare Stimmungsintensität (0.0 bis 1.0)
- Einstellbare Vorausschauzeit für verbesserte Synchronisation (20ms bis 200ms)
- Auswählbare Ausgabetypen: Vollgesicht oder nur Mundsteuerung
- Streaming-Audioverarbeitung für Echtzeitanwendungen
- Konfigurierbare Morph-Target-Sets (siehe Auswahl der Morph-Target-Sets)
- Plattformunterstützung: Windows, Mac, iOS, Linux, Android, Android-basierte Plattformen (einschließlich Meta Quest)
Das stimmungsfähige realistische Modell ist im Haupt-Plugin enthalten und benötigt keine zusätzlichen Erweiterungen zur Verwendung.
Sie können das passende Modell anhand Ihrer Projektanforderungen in Bezug auf Leistung, Charakterkompatibilität, visuelle Qualität, Zielplattform und Funktionsanforderungen auswählen.
So funktioniert es
Das Plugin verarbeitet Audioeingaben auf folgende Weise:
- Audiodaten werden als Float-PCM-Format mit spezifizierten Kanälen und Abtastrate empfangen.
- Das Plugin verarbeitet das Audio, um je nach Modell Gesichtssteuerungsdaten oder Viseme zu generieren.
- Bei Modellen mit Stimmungsunterstützung wird emotionaler Kontext auf die Gesichtsanimation angewendet.
- Die Animationsdaten steuern die Gesichtsbewegungen des Charakters in Echtzeit.
Leistungsarchitektur
Runtime MetaHuman Lip Sync verwendet reine CPU-Inferenz, um konsistente, latenzarme Lip-Sync-Ergebnisse zu liefern, die für Echtzeitanwendungen geeignet sind. Standardmäßig führt das Plugin die Lip-Sync-Verarbeitung alle 10 Millisekunden durch (einstellbar – siehe Plugin-Konfiguration für alle verfügbaren Einstellungen, einschließlich Verarbeitungs-Chunk-Größe, Thread-Anzahl sowie weiterer Leistungsparameter).
Modellarchitektur-Übersicht
Die Modelle zur Lippensynchronisation verwenden ein kompaktes neuronales Netz auf Transformer-Basis, das Audiodaten mithilfe einer Mel-Spektrogramm-Analyse verarbeitet. Diese leichtgewichtige Architektur ist speziell für Echtzeitleistung mit effizienter CPU-Inferenz und minimalem Speicherbedarf ausgelegt.
Warum CPU-Inferenz?
Für kleine, häufige Inferenzoperationen wie Echtzeit-Lippensynchronisation bietet CPU-Verarbeitung bessere Latenzeigenschaften als GPU. Bei einer Batchgröße von 1 mit Inferenzintervallen von 10–100 ms übersteigt der GPU-Overhead durch PCIe-Transfers und Kernel-Starts oft die tatsächliche Rechenzeit. Darüber hinaus ist die GPU in Spiel-Engines bereits durch Rendering, Shader und Physik ausgelastet, was zu Ressourcenkonflikten führt, die unvorhersehbare Latenzspitzen verursachen.
Hardware-Kompatibilität
Das Plugin arbeitet effizient auf den meisten CPUs der Mittelklasse und darüber, ohne dass dedizierte Grafikhardware erforderlich ist, und bietet Echtzeitleistung auf Desktop-, Mobil- und VR-Plattformen. Für schwächere Hardware können Sie den Modelltyp auf Semi-Optimized oder Highly Optimized umstellen oder die Verarbeitungs-Chunkgröße erhöhen, um die Echtzeitleistung bei leicht reduzierter Reaktionsfähigkeit beizubehalten.
Schnellstart
Hier ist eine grundlegende Einrichtung, um die Lippensynchronisation für deinen Charakter zu aktivieren:
- Für MetaHuman-Charaktere folgen Sie der Einrichtungsanleitung
- Für benutzerdefinierte Charaktere befolgen Sie die Anleitung zur Einrichtung benutzerdefinierter Charaktere
- Wählen und konfigurieren Sie Ihr bevorzugtes Lip-Sync-Modell.
- Richten Sie die Audioeingabeverarbeitung in Ihrem Blueprint ein.
- Verbinden Sie den passenden Lip-Sync-Knoten im Animation Blueprint.
- Spielen Sie Audio ab und sehen Sie, wie Ihr Charakter synchron dazu animiert wird.
Optionale Augenanimation
Das Plugin enthält außerdem optionale Hilfsfunktionen für automatisches Blinzeln und Blickverfolgung bei MetaHumans. Diese sind unabhängig von der Lippensynchronisation und können eigenständig oder zusätzlich zu dieser verwendet werden. Siehe Hilfsfunktionen für die Augenanimation.
Weitere Ressourcen
📦 Downloads und Links
Demo-Projekte:
Zwei sofort einsatzbereite Demo-Projekte sind verfügbar – siehe die eigene Demo-Projekte-Seite für vollständige Details, Downloads und Schritt-für-Schritt-Anleitungen:
- Einfache Lip-Sync-Demo - Mikrofoneingabe, Audiodateien, TTS
Beide Demos sind plattformübergreifend (Windows, Mac, Linux, iOS, Android, Meta Quest) und werden als gepackte Builds und vollständige UE 5.6+-Quellprojekte ausgeliefert.
🎥 Video-Tutorials
Ausgewählte Demos:
Tutorials für realistische Modelle (hochwertig):
- Hochwertige Lippensynchronisation aus Audiodatei/-puffer
- Hochwertige Lippensynchronisation mit Stimmungssteuerung und lokalem TTS
- Hochwertige Lippensynchronisation mit ElevenLabs- und OpenAI-TTS
- Hochwertige Live-Mikrofon-Lippensynchronisation
- Hochwertige Lippensynchronisation für ARKit-Charaktere
Standardmodell-Tutorials:
- Standard Lip Sync mit Live-Mikrofon
- Standard Lip Sync mit lokaler Text-to-Speech
- Standard Lip Sync mit ElevenLabs & OpenAI TTS
Allgemeine Einrichtung:
- Hinzufügen eines benutzerdefinierten MetaHuman-Charakters zum Demo-Projekt
- Video-Tutorial zur Einrichtung
- MetaHuman-Augenblinzeln & Kamera-Tracking
- Kombination mit Gesichts- und Körperanimationen
- Vorführung des Demo-Projekts (ältere Version)
💬 Unterstützung
- Individuelle Entwicklung: [email protected] (maßgeschneiderte Lösungen für Teams & Organisationen)