Runtime Speech Recognizer
Документация для плагина Runtime Speech Recognizer.
- Получить на Fab
- Веб-сайт продукта
- Скачать демо (Windows)
- Видеоурок
- Поддержка плагина и индивидуальная разработка: [email protected] (индивидуальные решения для команд и организаций)
Обзор
Runtime Speech Recognizer Documentation
Как использовать плагин
Плагин Runtime Speech Recognizer предназначен для распознавания слов из входящих аудиоданных. Он использует слегка модифицированную версию whisper.cpp для работы с движком. Чтобы использовать плагин, выполните следующие шаги:
Выбор и загрузка языковых моделей
В настоящее время плагин рассчитан на поддержку одной языковой модели, выбранной заранее в редакторе, которая будет упакована и использоваться вместе с проектом. Чтобы выбрать, загрузить и подготовить конкретную языковую модель, выполните следующие шаги:
Список параметров распознавания
Эти параметры можно установить только когда распознаватель не работает.
Поддерживаемые языки
Это полный список языков, поддерживаемых доступными языковыми моделями.
Распознавание команд
Вычисление сходства по Левенштейну
Устранение неполадок
Проблемы с подготовкой языковой модели
Демонстрационный проект
Упакованный демонстрационный проект для Windows.
Как улучшить производительность
Плагин использует различные методы ускорения на GPU в зависимости от платформы
Расширение Vosk
По умолчанию плагин Runtime Speech Recognizer использует whisper.cpp для распознавания. На платформах без поддержки аппаратного ускорения GPU в whisper.cpp, прежде всего на Android и основанных на Android платформах, таких как Meta Quest, распознавание переключается на CPU + интринсики, что медленнее и сильнее расходует батарею. Плагин расширения Vosk добавляет альтернативного провайдера на основе Vosk, легковесного инструментария распознавания речи, который хорошо работает на устройствах с ограниченными ресурсами и особенно хорошо показывает себя на Meta Quest.