Runtime Speech Recognizer
Documentação para o plugin Runtime Speech Recognizer.
- Obtenha no Fab
- Site do produto
- Baixar Demo (Windows)
- Tutorial em vídeo
- Suporte do Plugin & Desenvolvimento Personalizado: [email protected] (soluções sob medida para equipes e organizações)
Visão Geral
Runtime Speech Recognizer Documentation
Como usar o plugin
O plugin Runtime Speech Recognizer foi projetado para reconhecer palavras a partir de dados de áudio recebidos. Ele usa uma versão ligeiramente modificada do whisper.cpp para funcionar com o motor. Para usar o plugin, siga estas etapas:
Selecionando e baixando modelos de linguagem
Atualmente, o plugin foi projetado para suportar um único modelo de linguagem, selecionado no editor antecipadamente, para ser empacotado e usado com o projeto. Siga estas etapas para selecionar, baixar e preparar um modelo de linguagem específico:
Lista de parâmetros de reconhecimento
Estes parâmetros só podem ser definidos enquanto o reconhecedor não está em execução.
Idiomas suportados
Esta é a lista completa de idiomas suportados pelos modelos de linguagem disponíveis.
Reconhecimento de comandos
Calcular Similaridade de Levenshtein
Solução de problemas
Problemas de Preparação do Modelo de Linguagem
Projeto de demonstração
Projeto de Demonstração Empacotado para Windows.
Como melhorar o desempenho
O plugin utiliza diferentes métodos de aceleração por GPU dependendo da plataforma
Extensão Vosk
Por padrão, o plugin Runtime Speech Recognizer usa whisper.cpp para reconhecimento. Em plataformas sem suporte a aceleração de GPU no whisper.cpp, principalmente Android e plataformas baseadas em Android, como Meta Quest, o reconhecimento recorre à CPU + intrinsics, o que é mais lento e consome mais bateria. O plugin de extensão Vosk adiciona um provedor alternativo baseado em Vosk, um kit de ferramentas de reconhecimento de fala leve que funciona bem em hardware limitado e apresenta um desempenho especialmente bom no Meta Quest.