概述

Runtime Speech Recognizer 是一个跨平台插件,可实现实时、离线语音识别。它基于 Whisper OpenAI 技术,尤其是 whisper.cpp 库,并附带预训练语言模型目录,你可以从插件设置中下载这些模型,且在使用多语言模型时支持自动语言检测。
安装语言模型
首次运行时,编辑器会提示您自动下载语言模型。有关选择、下载和打包模型的详细信息,请参阅如何使用语言模型。
基本描述
此插件基于 whisper.cpp 库提供实时语音识别,该库使用先进算法,并采用宽松的 MIT 许可证。它将传入的音频数据(以流式或非流式输入提供,例如文件或音频数据缓冲区)与预训练的语言模型进行匹配。使用多语言模型时,插件可以自动检测所说语言,并在提供识别文本的同时提供该信息。
该插件根据平台使用不同的 GPU 加速方法:
- Windows 和 Linux:使用 Vulkan 进行 GPU 加速,可显著加快识别过程
- Mac 和 iOS:使用 Metal 进行 GPU 加速,性能与 Windows 或 Linux 的 Vulkan 加速相当,甚至更快
- 其他平台:使用 CPU + 内建函数进行加速(在原生运行时可能较慢,例如在 Android 或 Meta Quest 上)。在这些平台上,可考虑使用 Vosk 扩展 作为更轻量的替代提供程序。
附加资源
- 在 Fab 上获取
- 产品网站
- 下载演示版 (Windows)
- 视频教程 (旧版视频)
- 插件支持与定制开发:[email protected](为团队与组织量身定制的解决方案)
Join our Discord
online · support