Visão Geral

Runtime Speech Recognizer é um plugin multiplataforma que permite reconhecimento de fala em tempo real e offline. Baseado na tecnologia Whisper da OpenAI, em particular na biblioteca whisper.cpp, e acompanhado de um catálogo de modelos de linguagem pré-treinados, disponíveis para download nas configurações do plugin, com detecção automática de idioma ao usar modelos multilíngues.
Instalando modelos de linguagem
Na primeira execução, o editor solicita que você baixe um modelo de linguagem automaticamente. Consulte Como usar modelos de linguagem para obter detalhes sobre como selecionar, baixar e empacotar modelos.
Descrição básica
Este plugin fornece reconhecimento de fala em tempo real usando algoritmos avançados baseados na biblioteca whisper.cpp, que está disponível sob a licença MIT permissiva. Ele compara os dados de áudio recebidos, fornecidos como entrada em stream ou não stream (como um arquivo ou buffer de dados de áudio), com modelos de linguagem pré-treinados. Ao usar modelos multilíngues, o plugin pode detectar automaticamente o idioma falado e fornecer essas informações junto com o texto reconhecido.
O plugin usa diferentes métodos de aceleração de GPU dependendo da plataforma:
- Windows e Linux: Usa Vulkan para aceleração de GPU, o que acelera significativamente o processo de reconhecimento
- Mac e iOS: Usa Metal para aceleração de GPU, entregando desempenho comparável à aceleração Vulkan do Windows ou Linux, senão mais rápido
- Outras plataformas: Usa CPU + intrinsics para aceleração (pode ser mais lento, como no Android ou Meta Quest, quando executado nativamente). Nessas plataformas, considere a extensão Vosk como um provedor alternativo mais leve.
Recursos Adicionais
- Obtenha na Fab
- Site do produto
- Baixar demonstração (Windows)
- Tutorial em vídeo (vídeo mais antigo)
- Suporte ao plugin e desenvolvimento personalizado: [email protected] (soluções personalizadas para equipes e organizações)