Перейти к основному содержимому

Обзор

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer — это кроссплатформенный плагин, обеспечивающий распознавание речи в реальном времени без подключения к интернету. Он основан на технологии Whisper OpenAI, в частности на библиотеке whisper.cpp, и поставляется с каталогом предварительно обученных языковых моделей, которые можно загрузить из настроек плагина, с автоматическим определением языка при использовании многоязычных моделей.

Установка языковых моделей

При первом запуске редактор предложит автоматически загрузить языковую модель. Подробнее о выборе, загрузке и упаковке моделей см. в разделе Как использовать языковые модели.

Базовое описание

Этот плагин предоставляет распознавание речи в реальном времени с использованием передовых алгоритмов на основе библиотеки whisper.cpp, которая доступна под разрешительной лицензией MIT. Он сопоставляет входящие аудиоданные, предоставляемые в виде потока или непотокового ввода (например, файла или буфера аудиоданных), с предварительно обученными языковыми моделями. При использовании многоязычных моделей плагин может автоматически определять разговорный язык и предоставлять эту информацию вместе с распознанным текстом.

Плагин использует разные методы ускорения GPU в зависимости от платформы:

  • Windows и Linux: использует Vulkan для ускорения на GPU, что значительно ускоряет процесс распознавания
  • Mac и iOS: использует Metal для ускорения на GPU, обеспечивая производительность, сопоставимую с ускорением Vulkan на Windows или Linux, если не быстрее
  • Другие платформы: использует CPU + интринсики для ускорения (может быть медленнее, например, на Android или Meta Quest при нативном запуске). На этих платформах рассмотрите расширение Vosk в качестве более лёгкого альтернативного провайдера.

Дополнительные ресурсы

Join our Discord
online · support