メインコンテンツまでスキップ

概要

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer は、リアルタイムかつオフラインでの音声認識を可能にするクロスプラットフォームプラグインです。Whisper OpenAI テクノロジー、特に whisper.cpp ライブラリに基づいており、プラグインの設定からダウンロードできる事前学習済み言語モデルのカタログが同梱されています。多言語モデルを使用する場合は、自動言語検出が行われます。

言語モデルのインストール

初回起動時、エディターは言語モデルを自動的にダウンロードするよう促します。モデルの選択、ダウンロード、パッケージ化の詳細については、言語モデルの使用方法 を参照してください。

基本的な説明

このプラグインは、whisper.cpp ライブラリに基づく高度なアルゴリズムを使用して、リアルタイム音声認識を提供します。このライブラリは寛容なMITライセンスの下で利用可能です。ストリームまたは非ストリーム入力(オーディオデータのファイルやバッファなど)として提供される入力オーディオデータを、事前学習済みの言語モデルと照合します。多言語モデルを使用する場合、プラグインは話されている言語を自動的に検出し、認識されたテキストとともにこの情報を提供できます。

このプラグインは、プラットフォームに応じて異なるGPUアクセラレーション方式を使用します:

  • Windows と Linux: GPU アクセラレーションに Vulkan を使用し、認識プロセスを大幅に高速化します
  • Mac と iOS: GPU アクセラレーションに Metal を使用し、Windows や Linux の Vulkan アクセラレーションに匹敵する、場合によってはそれ以上のパフォーマンスを発揮します
  • その他のプラットフォーム: CPU + intrinsics を使用したアクセラレーション(Android や Meta Quest でネイティブ実行する場合など、遅くなる可能性があります)。これらのプラットフォームでは、より軽量な代替プロバイダーとして Vosk 拡張機能 を検討してください。

追加リソース

Join our Discord
online · support