Aperçu

Runtime Speech Recognizer est un plugin multiplateforme qui permet la reconnaissance vocale en temps réel et hors ligne. Basé sur la technologie Whisper OpenAI, en particulier la bibliothèque whisper.cpp, et prend en charge plusieurs modèles de langage présélectionnés dans les paramètres du plugin avec des capacités de détection automatique de la langue.
Comment installer
Lors du premier lancement, installez les modèles de langue (une boîte de dialogue apparaîtra vous invitant à le faire automatiquement).
Description de base
Ce plugin fournit une reconnaissance vocale en temps réel utilisant des algorithmes avancés basés sur la bibliothèque whisper.cpp, qui est disponible sous la licence MIT permissive. Il fait correspondre les données audio entrantes, fournies sous forme de flux ou d'entrée non-flux (comme un fichier ou un tampon de données audio), avec des modèles de langage pré-entraînés. Lors de l'utilisation de modèles multilingues, le plugin peut détecter automatiquement la langue parlée et fournir ces informations accompagnées du texte reconnu.
Le plugin utilise différentes méthodes d'accélération GPU en fonction de la plateforme :
- Windows et Linux : Utilise Vulkan pour l'accélération GPU, ce qui accélère considérablement le processus de reconnaissance
- Mac et iOS : Utilise Metal pour l'accélération GPU, offrant des performances comparables à l'accélération Vulkan sous Windows ou Linux, voire plus rapides
- Autres plateformes : Utilise CPU + intrinsèques pour l'accélération (peut être plus lent, par exemple sur Android ou Meta Quest, lorsqu'il est exécuté en natif)
Ressources supplémentaires
- Obtenez-le sur Fab
- Site web du produit
- Télécharger la démo (Windows)
- Tutoriel vidéo (vidéo plus ancienne)
- Support de plugin et développement personnalisé : [email protected] (solutions adaptées pour les équipes et les organisations)