Zum Hauptinhalt springen

Übersicht

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer ist ein plattformübergreifendes Plugin, das Echtzeit-Offline-Spracherkennung ermöglicht. Basierend auf der Whisper OpenAI-Technologie, insbesondere der whisper.cpp-Bibliothek, und unterstützt mehrere Sprachmodelle, die in den Plugin-Einstellungen vorausgewählt sind, mit automatischer Spracherkennung.

Wie installiert man

Beim ersten Start installieren Sie die Sprachmodelle (ein Dialogfeld wird angezeigt, das Sie automatisch dazu auffordert).

Grundlegende Beschreibung

Dieses Plugin bietet eine Echtzeit-Spracherkennung mit fortschrittlichen Algorithmen, die auf der whisper.cpp-Bibliothek basieren, die unter der freizügigen MIT-Lizenz verfügbar ist. Es vergleicht eingehende Audiodaten, die als Stream oder als Nicht-Stream-Eingabe (z. B. eine Datei oder ein Puffer von Audiodaten) bereitgestellt werden, mit vortrainierten Sprachmodellen. Bei Verwendung mehrsprachiger Modelle kann das Plugin die gesprochene Sprache automatisch erkennen und diese Informationen zusammen mit dem erkannten Text bereitstellen.

Das Plugin verwendet je nach Plattform unterschiedliche GPU-Beschleunigungsmethoden:

  • Windows und Linux: Verwendet Vulkan für GPU-Beschleunigung, was den Erkennungsprozess erheblich beschleunigt
  • Mac und iOS: Verwendet Metal für GPU-Beschleunigung und liefert eine Leistung, die mit der Vulkan-Beschleunigung unter Windows oder Linux vergleichbar ist, wenn nicht sogar schneller
  • Andere Plattformen: Verwendet CPU + Intrinsics für die Beschleunigung (kann langsamer sein, z. B. unter Android oder Meta Quest, wenn nativ ausgeführt)

Zusätzliche Ressourcen

Join our Discord
online · support