Runtime Speech Recognizer
Runtime Speech Recognizer 外掛程式的文件。
- 在 Fab 上取得
- 產品網站
- 下載示範 (Windows)
- 影片教學 (舊版影片)
- 外掛支援與客製化開發:[email protected](為團隊與組織提供的量身解決方案)
Join our Discord
online · support
概述
Runtime Speech Recognizer Documentation
如何使用插件
Runtime Speech Recognizer 外掛程式旨在從傳入的音訊資料中辨識字詞。它使用略微修改過的 whisper.cpp 版本來與引擎搭配運作。若要使用此外掛程式,請依照下列步驟操作:
選擇與下載語言模型
目前,該外掛程式設計為支援單一語言模型,需事先在編輯器中選取,以便與專案一起打包和使用。請依照以下步驟選取、下載並暫存特定的語言模型:
辨識參數列表
這些參數只能在辨識器未運行時設定。
支援的語言
以下是可用語言模型所支援的完整語言清單。
指令辨識
計算 Levenshtein 相似度
疑難排解
語言模型暫存問題
示範專案
Windows 封裝示範專案。
如何提升效能
此插件根據不同平台使用不同的 GPU 加速方法:在 Windows 和 Linux 上使用 Vulkan,在 Mac 和 iOS 平台上使用 Metal,這些方法能顯著加快辨識過程。在其他平台上,插件則使用 CPU 搭配內建指令集進行加速。不過,您可以透過以下建議進一步提升插件的效能:
Vosk 擴充功能
根據預設,Runtime Speech Recognizer 外掛程式使用 whisper.cpp 進行語音辨識。在 whisper.cpp 不支援 GPU 加速的平台上,尤其是 Android 及基於 Android 的平台,如 Meta Quest,語音辨識會退回使用 CPU + intrinsics,這導致速度較慢且更耗電。Vosk 擴充外掛程式新增了一個以 Vosk 為基礎的替代提供者;Vosk 是一套輕量級語音辨識工具組,在資源受限的硬體上表現良好,且在 Meta Quest 上表現特別出色。