跳到主要内容

概述

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer 是一款跨平台插件,支持实时离线语音识别。基于 Whisper OpenAI 技术,特别是 whisper.cpp 库,并支持在插件设置中预选的多种语言模型,具备自动语言检测功能。

如何安装

首次运行时,安装语言模型(将自动弹出对话框提示您进行此操作)。

基本描述

该插件利用基于whisper.cpp库的先进算法提供实时语音识别,该库采用宽松的MIT许可证。它能将输入的音频数据(以流或非流形式提供,如文件或音频数据缓冲区)与预训练语言模型进行匹配。当使用多语言模型时,插件可自动检测所说的语言,并将其与识别出的文本一同提供。

该插件根据不同平台使用不同的GPU加速方法:

  • Windows 和 Linux:使用 Vulkan 进行 GPU 加速,可显著提升识别速度
  • Mac 和 iOS:使用 Metal 进行 GPU 加速,其性能与 Windows 或 Linux 的 Vulkan 加速相当,甚至更快
  • 其他平台:使用 CPU + 内部指令进行加速(在原生运行时可能较慢,例如在 Android 或 Meta Quest 上)

其他资源

Join our Discord
online · support