概述

Runtime Speech Recognizer 是一款跨平台插件,支持实时离线语音识别。基于 Whisper OpenAI 技术,特别是 whisper.cpp 库,并支持在插件设置中预选的多种语言模型,具备自动语言检测功能。
如何安装
首次运行时,安装语言模型(将自动弹出对话框提示您进行此操作)。
基本描述
该插件利用基于whisper.cpp库的先进算法提供实时语音识别,该库采用宽松的MIT许可证。它能将输入的音频数据(以流或非流形式提供,如文件或音频数据缓冲区)与预训练语言模型进行匹配。当使用多语言模型时,插件可自动检测所说的语言,并将其与识别出的文本一同提供。
该插件根据不同平台使用不同的GPU加速方法:
- Windows 和 Linux:使用 Vulkan 进行 GPU 加速,可显著提升识别速度
- Mac 和 iOS:使用 Metal 进行 GPU 加速,其性能与 Windows 或 Linux 的 Vulkan 加速相当,甚至更快
- 其他平台:使用 CPU + 内部指令进行加速(在原生运行时可能较慢,例如在 Android 或 Meta Quest 上)
其他资源
- 在Fab上获取
- 产品网站
- 下载演示版(Windows)
- 视频教程(旧版视频)
- 插件支持与定制开发:[email protected](为团队和组织提供量身定制的解决方案)
Join our Discord
online · support