Demo-Projekte
Damit Sie schnell mit Runtime MetaHuman Lip Sync loslegen können, stehen zwei gebrauchsfertige Demo-Projekte zur Verfügung. Beide wurden mit Unreal Engine 5.6+ erstellt, sind rein Blueprint-basiert und laufen plattformübergreifend auf Windows, Mac, Linux, iOS, Android sowie Android-basierten Plattformen (einschließlich Meta Quest).
Verfügbare Demo-Projekte
- KI-Konversations-NPC / Interaktiver Avatar
- Einfache Lip-Sync-Demo
Ein vollständiger KI-Konversations-Avatar-Workflow, der Spracherkennung, einen KI-Chatbot (LLM), Sprachsynthese und Audiowiedergabe mit Echtzeit-Lippensynchronisation kombiniert - alles läuft gemeinsam in einem einzigen Projekt. Geeignet für eine breite Palette von Anwendungsfällen - einschließlich Spielen, interaktiven Kiosken, virtueller Produktion, Museumsinstallationen, digitalen Assistenten und Trainingssimulationen.
Pipeline-Übersicht
🎤 Microphone → Speech Recognition → 💬 LLM Chatbot → 🔊 Text-to-Speech → 👄 Lip Sync + Playback
Wenn das LLM auf Streaming-Modus eingestellt ist, wird seine Ausgabe satzweise aufgeteilt und an das TTS gesendet, sobald jeder Satz abgeschlossen ist, anstatt auf die vollständige Antwort zu warten, um die Latenz zu minimieren.
Videos
Schnelle Vorschau (~30 Sek.)
Eine kurze Vorführung der Demo in Aktion.
Vollständige Anleitung
Eine ausführliche Anleitung, die Einrichtung, Konfiguration und die vollständige Gesprächspipeline abdeckt.
Downloads
Erforderliche und optionale Plugins
Das Demo-Projekt ist modular – Sie benötigen nur die Plugins für die Anbieter, die Sie verwenden möchten.
| Plugin | Zweck | Erforderlich? |
|---|---|---|
| Runtime MetaHuman Lip Sync | Lip-Sync-Animation | ✅ Immer |
| Runtime Audio Importer | Audioaufnahme & -verarbeitung | ✅ Immer |
| Runtime Speech Recognizer | Offline-Spracherkennung (whisper.cpp) | ✅ Immer |
| Runtime AI Chatbot Integrator | Externe LLMs (OpenAI, Claude, DeepSeek, Gemini, Grok, Ollama) und/oder externe TTS (OpenAI, ElevenLabs) | 🔶 Optional |
| Runtime Local LLM | Lokale LLM-Inferenz via llama.cpp (Llama, Mistral, Gemma, etc., GGUF-Modelle) | 🔶 Optional |
| Runtime Text To Speech | Lokale TTS über Piper und Kokoro | 🔶 Optional |
Während jedes der oben genannten Plugins einzeln optional ist, benötigen Sie mindestens einen LLM-Anbieter und mindestens einen TTS-Anbieter, damit die Demo funktioniert. Kombinieren Sie frei nach Belieben (z. B. lokales LLM + ElevenLabs TTS, oder OpenAI LLM + lokales TTS).
Modulare Architektur
Im Ordner Content finden Sie einen Ordner Modules, der drei Unterordner enthält:
Content/
└── Modules/
├── RuntimeAIChatbotIntegrator/ ← External LLMs and/or external TTS
├── RuntimeLocalLLM/ ← Local LLM via llama.cpp
└── RuntimeTextToSpeech/ ← Local TTS via Piper/Kokoro
Wenn Sie eines (oder mehrere) der optionalen Plugins nicht erworben haben, löschen Sie einfach die entsprechenden Ordner. Die Basis-Assets des Demo-Projekts (Game Instance, Widgets usw.) referenzieren diese Module nicht direkt, sodass das Löschen keine Asset-Referenzfehler verursacht. Die Konfigurationsoberfläche blendet automatisch jeden Anbieter aus, dessen Ordner fehlt.
Diese Modularität gilt nur für LLM- und TTS-Anbieter. Spracherkennung (Runtime Speech Recognizer) und Lippensynchronisation (Runtime MetaHuman Lip Sync) sind Teil des Basis-Demoprojekts und immer erforderlich.

Beim ersten Start fragt Unreal möglicherweise, ob fehlende optionale Plugins deaktiviert werden sollen - klicken Sie auf Ja. Stellen Sie sicher, dass Sie auch den entsprechenden Ordner Content/Modules/ gelöscht haben (siehe oben).
Gebündelte Erweiterungs-Plugins
Silero VAD, WebRTC AEC3, und Standard Lip Sync-Erweiterungen (klicken zum Erweitern)
Die Quellversion der Demo wird mit drei kostenlosen Erweiterungs-Plugins geliefert, die im Ordner Plugins/ enthalten sind: RuntimeAudioImporterSileroVAD (neuronale VAD), RuntimeAudioImporterWebRTCAEC3 (Echounterdrückung) und RuntimeMetaHumanLipSync_Standard (Standard-Lip-Sync-Modell).
Die gebündelten Binärdateien sind vorkompiliert für UE 5.6. Für UE 5.7 / 5.8 erstelle sie entweder aus dem Quellcode (siehe Dokumentation der jeweiligen Erweiterung) oder verwende vorkompilierte Binärdateien: UE 5.7 · UE 5.8. Zum Installieren: Lösche die drei vorhandenen Ordner aus Plugins/ und extrahiere dann den Inhalt des Archivs an deren Stelle in Plugins/.
Alle drei sind optional – wenn du sie nicht brauchst, lösche einfach ihre Ordner aus Plugins/, bevor du startest.
Demo-Projekt-Layout
Die unten gezeigte Benutzeroberfläche ist vollständig mit UMG (Unreal Motion Graphics) erstellt und dient ausschließlich dazu, die Pipeline zu demonstrieren – Spracherkennung → LLM → TTS → Lippensynchronisation. Sie können sie frei neu gestalten oder ersetzen, um sie an das visuelle Design, das Steuerungsschema oder die Plattform Ihres Projekts (VR/AR, Mobilgeräte, Konsole, Kiosk usw.) anzupassen. Falls bestimmte Widgets in Ihrem Anwendungsfall nicht benötigt werden, können Sie sie auch einfach ausblenden (z. B. ihre Sichtbarkeit auf Collapsed oder Hidden setzen).

| Area | Was ist da? |
|---|---|
| Zentrum | Der MetaHuman-Charakter. |
| Linke Seite | Vier Konfigurationsschaltflächen (Spracherkennung, AI-Chatbot, Text-to-Speech, Animationen), die unten im Detail beschrieben werden. |
| Unten mittig | Eine Schaltfläche Aufnahme starten. Klicken Sie darauf, um ein Sprachgespräch zu beginnen: Ihr Mikrofon wird erfasst, transkribiert, an das LLM gesendet, die Antwort wird per TTS synthetisiert und mit Lippensynchronisation abgespielt, völlig freihändig. |
| Rechts mittig | Ein Widget für den Gesprächsverlauf, das den vollständigen Austausch zwischen Ihnen und der KI zeigt (sowohl Benutzer- als auch Assistentennachrichten). Es enthält außerdem ein Texteingabefeld, sodass Sie Nachrichten direkt eingeben können, ohne Spracherkennung zu verwenden – nützlich für Tests, für Barrierefreiheit oder wenn kein Mikrofon verfügbar ist. |
Sie können beide Eingabemodi in derselben Sitzung frei mischen – sprechen Sie einige Nachrichten, tippen Sie andere.
Wenn die Lippensynchronisation bei längerem Testen immer weiter hinter dem Audio zurückfällt (nicht nur eine feste Verzögerung), siehe Processing Chunk Size unter Animationen konfigurieren weiter unten.
Konfigurationsschaltflächen
Die vier Konfigurationsschaltflächen auf der linken Seite öffnen eigene Bedienfelder für jeden Teil der Pipeline:
1. Spracherkennung konfigurieren
Konfigurieren Sie, wie die Stimme des Benutzers erfasst und transkribiert wird:
- Sprache auswählen
- Spracherkennungsparameter anpassen (Whisper-Modell-Einstellungen)
- AEC konfigurieren (Akustische Echounterdrückung)
- VAD konfigurieren (Sprachaktivitätserkennung)

2. AI-Chatbot konfigurieren
Wählen Sie Ihren LLM-Anbieter und konfigurieren Sie ihn:
- Wählen Sie den Anbieter aus (Runtime AI Chatbot Integrator oder Runtime Local LLM)
- Wählen Sie den Modus: Regulär oder Streaming (abhängig vom Anbieter; Streaming ermöglicht die satzweise Übergabe an TTS, siehe Pipeline-Übersicht)
- Für externe Anbieter: Auth-Token, Modellname, usw.
- Für lokale LLMs: wählen Sie ein GGUF-Modell aus, legen Sie die Kontextgröße und weitere Inferenzparameter fest. Sie können auch Ihr eigenes GGUF-Modell zur Laufzeit herunterladen, direkt aus der Demo (z. B. per URL), und es sofort verwenden, ohne das Projekt neu zu erstellen.
Die Provider-Combobox zeigt nur Provider an, deren Plugin-Modulordner in Content/Modules/ vorhanden ist.


3. Text-to-Sprache konfigurieren
Wähle deinen TTS-Anbieter und konfiguriere Stimmen/Modelle:
- Wählen Sie Anbieter (Runtime AI Chatbot Integrator für OpenAI/ElevenLabs, oder Runtime Text To Speech für lokale Piper/Kokoro)
- Wählen Sie Modus: Regulär oder Streaming (steuert, ob Audio auf einmal oder während der Synthese zurückgegeben wird)
- Wählen Sie Stimme/Modell
- Passen Sie die anbieterspezifischen Parameter an


4. Animationen konfigurieren
Steuere die visuelle Darstellung deines KI-Avatars:
- Wählen Sie zwischen 3 vorab heruntergeladenen MetaHuman-Charakteren (Aera, Ada, Orlando)
- Wählen Sie das Lip-Sync-Modell (Standard oder Realistisch)
- Wählen Sie den Lip-Sync-Modelltyp – Hochoptimiert, Semi-optimiert oder Original (siehe Modelltyp)
- Passen Sie die Verarbeitungs-Chunkgröße an – steuert, wie oft die Lip-Sync-Inferenz ausgeführt wird (siehe Verarbeitungs-Chunkgröße)
- Wenn die Lippensynchronisation unter CPU-Last im Laufe der Zeit immer weiter hinter dem Audio zurückbleibt, erhöhen Sie diesen Wert auf 480 oder 640.
- Wählen Sie eine Leerlaufanimation aus, die während des Gesprächs auf dem MetaHuman abgespielt wird.

Vorkonfigurieren der Demo im Editor
Wenn Sie mit der Quellversion arbeiten, können Sie Standardwerte direkt im Editor vorausfüllen, sodass Werte nicht bei jedem Lauf erneut eingegeben werden müssen:
| What | Wo |
|---|---|
| Allgemeine Einstellungen (Lip-Sync-Modell, Leerlauf-Animation, Charakterklasse, Spracherkennung, usw.) | Content/LipSyncSTSGameInstance |
| Externes LLM / Externes TTS-Einstellungen (Runtime AI Chatbot Integrator) | Content/Modules/RuntimeAIChatbotIntegrator/RuntimeAIChatbotIntegrator_Provider |
| Local LLM-Einstellungen (Runtime Local LLM) | Content/Modules/RuntimeLocalLLM/RuntimeLocalLLM_Provider |
| Einstellungen für lokales TTS (Runtime Text To Speech) | Content/Modules/RuntimeTextToSpeech/RuntimeTextToSpeech_Provider |
Plattformübergreifende Hinweise
Alle Plugins, die von der Demo verwendet werden, unterstützen Windows, Mac, Linux, iOS, Android sowie Android-basierte Plattformen (einschließlich Meta Quest), sodass das Demo-Projekt auch auf allen diesen funktioniert. Dadurch eignet es sich für den Einsatz in einer Vielzahl von Umgebungen – von Spielen und Desktop-Kiosken über mobile Apps, eigenständige VR-Headsets bis hin zu Virtual-Production-Setups am Set.
Für schwächere Geräte (Mobilgeräte, Standalone-VR) möchten Sie vielleicht:
- Verwenden Sie das Standard-Lip-Sync-Modell statt Realistic - siehe den Modellvergleich
- Wechseln Sie zum Modelltyp Hochoptimiert
- Erhöhen Sie die Verarbeitungs-Chunkgröße, um die CPU-Last zu reduzieren
- Wählen Sie kleinere LLM-/TTS-Modelle
Siehe Plattformspezifische Konfiguration für weitere Einrichtungsschritte auf Android, iOS, Mac und Linux.
Pixel Streaming-Unterstützung
Bereitstellen der Demo über Pixel Streaming (Klicken zum Erweitern)
Das AI-Konversations-Demo-Projekt funktioniert auch in einer Pixel Streaming-Umgebung, sodass Sie den MetaHuman-Avatar an einen Remote-Client (z. B. einen Webbrowser) streamen können, während das Mikrofonaudio des Benutzers von der Client-Seite erfasst wird. Es ist nur eine einzige Änderung am Demo-Projekt erforderlich.
Installieren Sie die Pixel Streaming-Erweiterung für Runtime Audio Importer.
Das Runtime Audio Importer Plugin bietet ein kostenloses Erweiterungs-Plugin, das die Audioaufnahme von einem Pixel Streaming-Client ermöglicht. Je nachdem, welche Version der Pixel Streaming-Infrastruktur Sie verwenden, installieren Sie eines der folgenden:
- Pixel Streaming-Erweiterung (für das originale Pixel Streaming-Plugin) oder
- Pixel Streaming 2-Erweiterung (für das neuere Pixel Streaming 2-Plugin)
Download-Links und Installationsschritte sind hier verfügbar: Pixel Streaming Audio Capture - Erweiterungs-Plugin-Installation.
2. Tauschen Sie den aufnehmbaren Soundwellen-Knoten in LipSyncSTSGameInstance aus.
Nachdem das Erweiterungs-Plugin installiert ist:
- Navigieren Sie im Content Browser zu
/All/Gameund öffnen Sie das AssetLipSyncSTSGameInstance. - Wechseln Sie zum Ereignisgraph.
- Suchen Sie Event Init und folgen Sie dem Ausführungsablauf, bis Sie das Knotenpaar finden:
Create Capturable Sound Wave→Set Capturable Sound Wave. - Ersetzen Sie den Aufruf von
Create Capturable Sound Waveentweder durchCreate Pixel Streaming Capturable Sound WaveoderCreate Pixel Streaming 2 Capturable Sound Wave, je nachdem, auf welche Version der Pixel-Streaming-Infrastruktur Sie abzielen. - Verbinden Sie seinen Ausgang mit demselben
Set Capturable Sound Wave-Knoten.
Nach diesem Schritt ist das Projekt bereit für die Bereitstellung auf Pixel Streaming – Spracherkennung, LLM, TTS und Lippensynchronisation funktionieren weiterhin wie zuvor, aber mit Audio, das vom Remote-Client statt von einem lokalen Mikrofon erfasst wird.
Eigene Charaktere verwenden
Das Demo-Projekt wird mit drei Beispiel-MetaHuman-Charakteren (Aera, Ada, Orlando) ausgeliefert, aber Sie können Ihren eigenen MetaHuman importieren und ihn in der Demo verwenden.
📺 Video-Tutorial: Hinzufügen eines benutzerdefinierten MetaHuman-Charakters zum Demo-Projekt
Das Runtime MetaHuman Lip Sync Plugin selbst unterstützt viele andere Charaktersysteme über MetaHumans hinaus (ARKit-basierte Charaktere, Daz Genesis 8/9, Reallusion CC3/CC4, Mixamo, ReadyPlayerMe usw. – siehe den Leitfaden zur Einrichtung eigener Charaktere). Ob du einen Spiel-NPC, einen virtuellen Präsentator, einen Kiosk-Betreuer oder einen digitalen Menschen für die virtuelle Produktion erstellst, das Plugin passt sich deiner Charakter-Pipeline an.
Ein einfacheres Demo-Projekt, das sich rein auf die Lip Sync-Funktion selbst konzentriert, ohne den vollständigen AI-Konversations-Workflow. Geeignet, wenn Sie Lip Sync einfach nur mit verschiedenen Audioquellen in Aktion sehen möchten.
Vorgestelltes Video
Downloads
Was ist enthalten
Dieses Demo zeigt die grundlegenden Arbeitsabläufe der Lippensynchronisation:
- Mikrofoneingang – Echtzeit-Lippensynchronisation aus Live-Audio
- Audiodatei-Wiedergabe – Lippensynchronisation aus importierten Audiodateien
- Text-to-Speech – Lippensynchronisation, die durch synthetisierte Sprache gesteuert wird
Erforderliche & optionale Plugins
| Plugin | Zweck | Erforderlich? |
|---|---|---|
| Runtime MetaHuman Lip Sync | Lip-Sync-Animation | ✅ Erforderlich |
| Runtime Audio Importer | Audio-Import & Aufnahme | ✅ Erforderlich |
| Runtime Text To Speech | Lokale TTS für die TTS-Demo-Szene | 🔶 Optional |
| Runtime AI Chatbot Integrator | Externe TTS-Anbieter (OpenAI, ElevenLabs) | 🔶 Optional |
Mitgelieferte Erweiterungs-Plugins
Standard Lip Sync Erweiterung (klicken zum Erweitern)
Die Quellversion enthält die Erweiterung RuntimeMetaHumanLipSync_Standard, die in Plugins/ vorinstalliert ist und Unterstützung für das Standard-Lip-Sync-Modell bietet. Die Binärdateien sind für UE 5.6 vorgefertigt; für UE 5.7 / 5.8 verwenden Sie die vorgefertigten Archive (UE 5.7 · UE 5.8) oder erstellen Sie sie aus dem Quellcode. Zum Installieren löschen Sie den vorhandenen Ordner aus Plugins/ und entpacken Sie den Inhalt des Archivs an seiner Stelle. Löschen Sie den Ordner, ohne ihn zu ersetzen, wenn Sie das Standard-Modell nicht benötigen.
Brauchen Sie Hilfe?
Wenn Sie beim Einrichten oder Ausführen der Demoprojekte auf Probleme stoßen, können Sie sich gerne an uns wenden:
Für individuelle Entwicklungsanfragen (z. B. Erweiterung der Demo mit eigener Logik, Anpassung an eine bestimmte Plattform oder Charakter-Pipeline) kontaktieren Sie [email protected].