Перейти к основному содержимому

Обзор

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer — это кроссплатформенный плагин, обеспечивающий распознавание речи в реальном времени без подключения к интернету. Основан на технологии Whisper от OpenAI, в частности на библиотеке whisper.cpp, и поддерживает несколько языковых моделей, предустановленных в настройках плагина.

Установка

При первом запуске необходимо установить языковые модели (появится диалоговое окно с предложением сделать это автоматически).

Основное описание

Этот плагин обеспечивает распознавание речи в реальном времени с использованием продвинутых алгоритмов на основе библиотеки whisper.cpp, распространяемой под лицензией MIT. Он сопоставляет входящие аудиоданные, предоставленные в виде потока или не потокового ввода (например, файла или буфера аудиоданных), с предварительно обученными языковыми моделями.

Плагин использует различные методы ускорения на GPU в зависимости от платформы:

  • Windows: Использует Vulkan для ускорения на GPU, что значительно ускоряет процесс распознавания
  • Mac и iOS: Использует Metal для ускорения на GPU, обеспечивая производительность, сопоставимую с ускорением на Windows через Vulkan, если не выше
  • Другие платформы: Использует CPU + intrinsics для ускорения

Дополнительные ресурсы