Pular para o conteúdo principal

Visão geral

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer é um plugin multiplataforma que permite reconhecimento de fala em tempo real e offline. Baseado na tecnologia Whisper OpenAI, especialmente na biblioteca whisper.cpp, e oferece suporte a vários modelos de idioma pré-selecionados nas configurações do plugin com recursos de detecção automática de idioma.

Como instalar

Na primeira execução, instale os modelos de idioma (uma caixa de diálogo aparecerá pedindo que você faça isso automaticamente).

Descrições básicas

Este plugin fornece reconhecimento de fala em tempo real usando algoritmos avançados baseados na biblioteca whisper.cpp, que está disponível sob a licença permissiva MIT. Ele combina dados de áudio de entrada, fornecidos como entrada de streaming ou não streaming (como um arquivo ou buffer de dados de áudio), com modelos de linguagem pré-treinados. Ao usar modelos multilíngues, o plugin pode detectar automaticamente o idioma falado e fornecer essa informação junto com o texto reconhecido.

O plugin utiliza diferentes métodos de aceleração de GPU dependendo da plataforma:

  • Windows e Linux: Usa Vulkan para aceleração de GPU, o que acelera significativamente o processo de reconhecimento
  • Mac e iOS: Usa Metal para aceleração de GPU, oferecendo desempenho comparável à aceleração Vulkan do Windows ou Linux, senão mais rápido
  • Outras plataformas: Usa CPU + intrinsics para aceleração (pode ser mais lento, como no Android ou Meta Quest, quando executado nativamente)

Recursos Adicionais

Join our Discord
online · support