Runtime Speech Recognizer
Runtime Speech Recognizer 插件文档。
- 在 Fab 上获取
- 产品网站
- 下载演示 (Windows)
- 视频教程
- 插件支持与定制开发:[email protected] (为团队和组织提供量身定制的解决方案)
Join our Discord
online · support
概述
Runtime Speech Recognizer Documentation
如何使用插件
Runtime Speech Recognizer 插件旨在从传入的音频数据中识别单词。它使用了略微修改版的 whisper.cpp 以与引擎协同工作。要使用该插件,请按照以下步骤操作:
选择并下载语言模型
目前,该插件设计为支持单个语言模型,该模型需事先在编辑器中选定,以便与项目一起打包和使用。请按照以下步骤选择、下载并暂存特定的语言模型:
识别参数列表
这些参数只能在识别器未运行时设置。
支持的语言
这是可用语言模型支持的完整语言列表。
命令识别
计算莱文斯坦相似度
故障排除
语言模型暂存问题
演示项目
适用于 Windows 的打包演示项目。
如何提升性能
该插件根据平台使用不同的 GPU 加速方法:在 Windows 和 Linux 上使用 Vulkan,在 Mac 和 iOS 平台上使用 Metal,这显著加快了识别过程。在其他平台上,插件使用 CPU + 内部函数进行加速。然而,您可以通过遵循以下建议进一步提升插件的性能:
Vosk 扩展
默认情况下,Runtime Speech Recognizer 插件使用 whisper.cpp 进行识别。在 whisper.cpp 不支持 GPU 加速的平台上,最典型的是 Android 以及基于 Android 的平台(如 Meta Quest),识别会回退到 CPU + 内部指令集,速度较慢且更耗电。Vosk 扩展插件提供了一种基于 Vosk 的替代提供程序,Vosk 是一个轻量级语音识别工具包,在硬件受限的设备上表现出色,在 Meta Quest 上表现尤为出色。