Resumen

Runtime Speech Recognizer es un plugin multiplataforma que permite el reconocimiento de voz en tiempo real y sin conexión. Basado en la tecnología Whisper OpenAI, particularmente en la librería whisper.cpp, y admite múltiples modelos de lenguaje preseleccionados en la configuración del plugin con capacidades de detección automática de idioma.
Cómo instalar
En la primera ejecución, instale los modelos de lenguaje (aparecerá un cuadro de diálogo pidiéndole que lo haga automáticamente).
Descripción básica
Este plugin proporciona reconocimiento de voz en tiempo real utilizando algoritmos avanzados basados en la biblioteca whisper.cpp, que está disponible bajo la licencia MIT permisiva. Compara los datos de audio entrantes, proporcionados como una entrada en flujo continuo o sin flujo (como un archivo o búfer de datos de audio), con modelos de lenguaje preentrenados. Al usar modelos multilingües, el plugin puede detectar automáticamente el idioma hablado y proporcionar esta información junto con el texto reconocido.
El plugin utiliza diferentes métodos de aceleración de GPU dependiendo de la plataforma:
- Windows y Linux: Utiliza Vulkan para la aceleración por GPU, lo que acelera significativamente el proceso de reconocimiento
- Mac y iOS: Utiliza Metal para la aceleración por GPU, ofreciendo un rendimiento comparable, si no más rápido, al de la aceleración Vulkan en Windows o Linux
- Otras plataformas: Utiliza CPU + intrinsics para la aceleración (puede ser más lento, como en Android o Meta Quest, al ejecutarse de forma nativa)
Recursos adicionales
- Cónsíguelo en Fab
- Sitio web del producto
- Descargar demo (Windows)
- Tutorial en video (video anterior)
- Soporte de plugins y desarrollo personalizado: [email protected] (soluciones adaptadas para equipos y organizaciones)