概述

Runtime Speech Recognizer 是一款跨平台外掛程式,可實現即時、離線語音辨識。它基於 Whisper OpenAI 技術,特別是 whisper.cpp 函式庫,並隨附一系列預先訓練的語言模型,您可以從外掛程式的設定中下載這些模型,使用多語言模型時會自動偵測語言。
安裝語言模型
首次執行時,編輯器會提示您自動下載語言模型。如需選擇、下載及打包模型的詳細資訊,請參閱如何使用語言模型。
基本描述
此插件使用基於 whisper.cpp 函式庫的先進演算法提供即時語音辨識,該函式庫採用寬鬆的 MIT 授權條款。它會將輸入的音訊資料(以串流或非串流輸入形式提供,例如檔案或音訊資料緩衝區)與預先訓練的語言模型進行比對。使用多語言模型時,此插件可自動偵測口說語言,並在辨識出的文字旁提供此資訊。
此外掛程式會根據平台採用不同的 GPU 加速方法:
- Windows 與 Linux:使用 Vulkan 進行 GPU 加速,可大幅加快辨識過程
- Mac 與 iOS:使用 Metal 進行 GPU 加速,效能可媲美(甚至超越)Windows 或 Linux 的 Vulkan 加速
- 其他平台:使用 CPU + 內建函式進行加速(以原生方式執行時可能較慢,例如在 Android 或 Meta Quest 上)。在這些平台上,可考慮將 Vosk 擴充功能 作為更輕量的替代提供者。
其他資源
- 在 Fab 上取得
- 產品網站
- 下載試用版(Windows)
- 影片教學(較舊的影片)
- 外掛程式支援與客製化開發:[email protected](為團隊與組織提供的量身打造解決方案)
Join our Discord
online · support