Обзор

Runtime Speech Recognizer — это кроссплатформенный плагин, который обеспечивает распознавание речи в реальном времени без подключения к интернету. Основанный на технологии Whisper OpenAI, а именно на библиотеке whisper.cpp, он поддерживает несколько языковых моделей, предварительно выбранных в настройках плагина, с возможностью автоматического определения языка.
Как установить
При первом запуске установите языковые модели (появится диалоговое окно с предложением сделать это автоматически).
Базовое описание
Этот плагин обеспечивает распознавание речи в реальном времени с использованием продвинутых алгоритмов на основе библиотеки whisper.cpp, доступной под либеральной лицензией MIT. Он сопоставляет входящие аудиоданные (передаваемые в потоковом или непотоковом режиме, например, в виде файла или буфера аудиоданных) с предварительно обученными языковыми моделями. При использовании многоязычных моделей плагин может автоматически определять язык речи и предоставлять эту информацию вместе с распознанным текстом.
Плагин использует различные методы ускорения GPU в зависимости от платформы:
- Windows и Linux: Использует Vulcan для ускорения GPU, что значительно ускоряет процесс распознавания
- Mac и iOS: Использует Metal для ускорения GPU, обеспечивая производительность, сопоставимую с ускорением Vulcan на Windows или Linux, если не быстрее
- Другие платформы: Использует CPU + intrinsics для ускорения (может быть медленнее, например, на Android или Meta Quest при нативной работе)
Дополнительные ресурсы
- Приобрести на Fab
- Сайт продукта
- Скачать демо (Windows)
- Видеоурок (старое видео)
- Поддержка плагина и индивидуальная разработка: [email protected] (индивидуальные решения для команд и организаций)