Saltar al contenido principal

Descripción general

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer es un plugin multiplataforma que permite el reconocimiento de voz en tiempo real y sin conexión. Se basa en tecnología Whisper OpenAI, particularmente en la biblioteca whisper.cpp, e incluye un catálogo de modelos de lenguaje preentrenados que puedes descargar desde la configuración del plugin, con detección automática de idioma al usar modelos multilingües.

Instalación de modelos de lenguaje

En la primera ejecución, el editor te solicita descargar un modelo de lenguaje automáticamente. Consulta Cómo usar modelos de lenguaje para obtener detalles sobre cómo seleccionar, descargar y empaquetar modelos.

Descripción básica

Este plugin proporciona reconocimiento de voz en tiempo real utilizando algoritmos avanzados basados en la biblioteca whisper.cpp, que está disponible bajo la licencia MIT permisiva. Compara los datos de audio entrantes, proporcionados como entrada de flujo o no flujo (como un archivo o búfer de datos de audio), con modelos de lenguaje preentrenados. Al usar modelos multilingües, el plugin puede detectar automáticamente el idioma hablado y proporcionar esta información junto con el texto reconocido.

El complemento utiliza diferentes métodos de aceleración de GPU según la plataforma:

  • Windows y Linux: Utiliza Vulkan para la aceleración por GPU, lo que acelera significativamente el proceso de reconocimiento
  • Mac e iOS: Utiliza Metal para la aceleración por GPU, ofreciendo un rendimiento comparable a la aceleración Vulkan de Windows o Linux, si no más rápido.
  • Otras plataformas: Utiliza CPU + intrínsecos para la aceleración (puede ser más lento, como en Android o Meta Quest, cuando se ejecuta de forma nativa). En estas plataformas, considera la extensión de Vosk como un proveedor alternativo más ligero.

Recursos adicionales

Join our Discord
online · support