Descripción general

Runtime Speech Recognizer es un plugin multiplataforma que permite el reconocimiento de voz en tiempo real y sin conexión. Se basa en tecnología Whisper OpenAI, particularmente en la biblioteca whisper.cpp, e incluye un catálogo de modelos de lenguaje preentrenados que puedes descargar desde la configuración del plugin, con detección automática de idioma al usar modelos multilingües.
Instalación de modelos de lenguaje
En la primera ejecución, el editor te solicita descargar un modelo de lenguaje automáticamente. Consulta Cómo usar modelos de lenguaje para obtener detalles sobre cómo seleccionar, descargar y empaquetar modelos.
Descripción básica
Este plugin proporciona reconocimiento de voz en tiempo real utilizando algoritmos avanzados basados en la biblioteca whisper.cpp, que está disponible bajo la licencia MIT permisiva. Compara los datos de audio entrantes, proporcionados como entrada de flujo o no flujo (como un archivo o búfer de datos de audio), con modelos de lenguaje preentrenados. Al usar modelos multilingües, el plugin puede detectar automáticamente el idioma hablado y proporcionar esta información junto con el texto reconocido.
El complemento utiliza diferentes métodos de aceleración de GPU según la plataforma:
- Windows y Linux: Utiliza Vulkan para la aceleración por GPU, lo que acelera significativamente el proceso de reconocimiento
- Mac e iOS: Utiliza Metal para la aceleración por GPU, ofreciendo un rendimiento comparable a la aceleración Vulkan de Windows o Linux, si no más rápido.
- Otras plataformas: Utiliza CPU + intrínsecos para la aceleración (puede ser más lento, como en Android o Meta Quest, cuando se ejecuta de forma nativa). En estas plataformas, considera la extensión de Vosk como un proveedor alternativo más ligero.
Recursos adicionales
- Consíguelo en Fab
- Sitio web del producto
- Descargar demo (Windows)
- Tutorial en video (video anterior)
- Soporte de plugins y desarrollo personalizado: [email protected] (soluciones a medida para equipos y organizaciones)