Runtime Speech Recognizer
Dokumentation für das Runtime Speechech Recognizer-Plugin.
- Auf Fab erhältlich
- Produkt-Website
- Demo herunterladen (Windows)
- Video-Tutorial
- Plugin-Support & Individuelle Entwicklung: [email protected] (maßgeschneiderte Lösungen für Teams & Organisationen)
Übersicht
Runtime Speech Recognizer Documentation
So verwenden Sie das Plugin
Das Runtime Speech Recognizer Plugin wurde entwickelt, um Wörter aus eingehenden Audiodaten zu erkennen. Es verwendet eine leicht modifizierte Version von whisper.cpp, um mit der Engine zu arbeiten. Um das Plugin zu verwenden, folgen Sie diesen Schritten:
Sprachmodelle auswählen und herunterladen
Derzeit ist das Plugin darauf ausgelegt, ein einzelnes Sprachmodell zu unterstützen, das zuvor im Editor ausgewählt wird, um mit dem Projekt gepackt und verwendet zu werden. Befolgen Sie diese Schritte, um ein bestimmtes Sprachmodell auszuwählen, herunterzuladen und bereitzustellen:
Liste der Erkennungsparameter
Diese Parameter können nur gesetzt werden, während der Erkennungsprozess nicht läuft.
Unterstützte Sprachen
Dies ist die vollständige Liste der Sprachen, die von den verfügbaren Sprachmodellen unterstützt werden.
Befehls-Erkennung
Levenshtein-Ähnlichkeit berechnen
Fehlerbehebung
Sprachmodell-Staging-Probleme
Demo-Projekt
Verpacktes Demo-Projekt für Windows.
Wie man die Leistung verbessert
Das Plugin verwendet je nach Plattform verschiedene GPU-Beschleunigungsmethoden
Vosk-Erweiterung
Standardmäßig verwendet das Runtime Speech Recognizer Plugin whisper.cpp zur Erkennung. Auf Plattformen ohne GPU-Beschleunigungsunterstützung in whisper.cpp, insbesondere Android und Android-basierten Plattformen wie Meta Quest, fällt die Erkennung auf CPU + Intrinsics zurück, was langsamer ist und den Akku stärker belastet. Das Vosk extension plugin fügt einen alternativen Anbieter basierend auf Vosk hinzu, einem leichtgewichtigen Spracherkennungs-Toolkit, das auf eingeschränkter Hardware gut funktioniert und sich besonders auf Meta Quest bewährt.