メインコンテンツまでスキップ

概要

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer は、リアルタイムでオフラインの音声認識を実現するクロスプラットフォームプラグインです。Whisper OpenAI 技術、特に whisper.cpp ライブラリに基づいており、プラグインの設定で事前選択された複数の言語モデルと自動言語検出機能をサポートしています。

インストール方法

初回実行時に、言語モデルをインストールしてください(自動的にこれを行うよう促すダイアログボックスが表示されます)。

基本説明

このプラグインは、whisper.cpp ライブラリに基づく高度なアルゴリズムを使用してリアルタイム音声認識を提供します。このライブラリは、寛容なMITライセンスの下で利用可能です。ストリームまたは非ストリーム入力(オーディオデータのファイルやバッファなど)として提供される入力オーディオデータを、事前学習された言語モデルと照合します。多言語モデルを使用する場合、プラグインは話されている言語を自動的に検出し、認識されたテキストと共にこの情報を提供できます。

このプラグインは、プラットフォームに応じて異なるGPUアクセラレーション方式を使用します。

  • Windows および Linux: Vulkan を使用した GPU アクセラレーションにより、認識プロセスが大幅に高速化されます
  • Mac および iOS: Metal を使用した GPU アクセラレーションにより、Windows や Linux の Vulkan アクセラレーションと同等かそれ以上のパフォーマンスを実現します
  • その他のプラットフォーム: CPU + intrinsics を使用したアクセラレーション(Android や Meta Quest などでネイティブ実行する場合、遅くなる可能性があります)

追加リソース

Join our Discord
online · support