Runtime Speech Recognizer
Documentación para el plugin Runtime Speech Recognizer.
- Consíguelo en Fab
- Sitio web del producto
- Descargar Demo (Windows)
- Tutorial en video
- Soporte del Plugin & Desarrollo Personalizado: [email protected] (soluciones a medida para equipos y organizaciones)
Descripción general
Runtime Speech Recognizer Documentation
Cómo usar el complemento
El plugin Runtime Speech Recognizer está diseñado para reconocer palabras de los datos de audio entrantes. Utiliza una versión ligeramente modificada de whisper.cpp para funcionar con el motor. Para usar el plugin, sigue estos pasos:
Selección y descarga de modelos de lenguaje
Actualmente, el plugin está diseñado para admitir un único modelo de lenguaje, seleccionado previamente en el editor, para empaquetarse y usarse con el proyecto. Siga estos pasos para seleccionar, descargar y preparar un modelo de lenguaje específico:
Lista de parámetros de reconocimiento
Estos parámetros solo se pueden configurar mientras el reconocedor no está en ejecución.
Idiomas admitidos
Esta es la lista completa de idiomas admitidos por los modelos de lenguaje disponibles.
Reconocimiento de comandos
Calcular Similitud de Levenshtein
Solución de problemas
Problemas de Preparación del Modelo de Lenguaje
Proyecto de demostración
Proyecto de demostración empaquetado para Windows.
Cómo mejorar el rendimiento
El complemento utiliza diferentes métodos de aceleración por GPU según la plataforma
Extensión de Vosk
Por defecto, el complemento Runtime Speech Recognizer utiliza whisper.cpp para el reconocimiento. En plataformas sin soporte de aceleración por GPU en whisper.cpp, especialmente Android y plataformas basadas en Android como Meta Quest, el reconocimiento recurre a CPU + funciones intrínsecas, lo que es más lento y consume más batería. El complemento de extensión Vosk añade un proveedor alternativo basado en Vosk, un kit de herramientas de reconocimiento de voz ligero que funciona bien en hardware limitado y rinde especialmente bien en Meta Quest.