Обзор

Runtime Speech Recognizer — это кроссплатформенный плагин, обеспечивающий распознавание речи в реальном времени без подключения к интернету. Он основан на технологии Whisper OpenAI, в частности на библиотеке whisper.cpp, и поставляется с каталогом предварительно обученных языковых моделей, которые можно загрузить из настроек плагина, с автоматическим определением языка при использовании многоязычных моделей.
Установка языковых моделей
При первом запуске редактор предложит автоматически загрузить языковую модель. Подробнее о выборе, загрузке и упаковке моделей см. в разделе Как использовать языковые модели.
Базовое описание
Этот плагин предоставляет распознавание речи в реальном времени с использованием передовых алгоритмов на основе библиотеки whisper.cpp, которая доступна под разрешительной лицензией MIT. Он сопоставляет входящие аудиоданные, предоставляемые в виде потока или непотокового ввода (например, файла или буфера аудиоданных), с предварительно обученными языковыми моделями. При использовании многоязычных моделей плагин может автоматически определять разговорный язык и предоставлять эту информацию вместе с распознанным текстом.
Плагин использует разные методы ускорения GPU в зависимости от платформы:
- Windows и Linux: использует Vulkan для ускорения на GPU, что значительно ускоряет процесс распознавания
- Mac и iOS: использует Metal для ускорения на GPU, обеспечивая производительность, сопоставимую с ускорением Vulkan на Windows или Linux, если не быстрее
- Другие платформы: использует CPU + интринсики для ускорения (может быть медленнее, например, на Android или Meta Quest при нативном запуске). На этих платформах рассмотрите расширение Vosk в качестве более лёгкого альтернативного провайдера.
Дополнительные ресурсы
- Купить на Fab
- Сайт продукта
- Скачать демо (Windows)
- Видеоурок (более старое видео)
- Поддержка плагина и индивидуальная разработка: [email protected] (индивидуальные решения для команд и организаций)