Runtime Speech Recognizer
Runtime Speech Recognizer プラグインのドキュメントです。
- Fabで入手する
- 製品ウェブサイト
- デモをダウンロード (Windows)
- ビデオチュートリアル
- プラグインサポート & カスタム開発: [email protected] (チームや組織向けのカスタマイズされたソリューション)
概要
Runtime Speech Recognizer Documentation
プラグインの使い方
Runtime Speech Recognizer プラグインは、入力されたオーディオデータから単語を認識するように設計されています。エンジンで動作するために、whisper.cpp を少し変更したバージョンを使用しています。プラグインを使用するには、次の手順に従ってください。
言語モデルの選択とダウンロード
現在、このプラグインは単一の言語モデルをサポートするように設計されており、そのモデルは事前にエディタで選択され、プロジェクトに同梱して使用されます。特定の言語モデルを選択、ダウンロード、ステージングするには、以下の手順を実行してください。
認識パラメータ一覧
これらのパラメータは、認識器が実行中でない場合にのみ設定できます。
対応言語
これは利用可能な言語モデルでサポートされている完全な言語リストです。
コマンド認識
レーベンシュタイン類似度の計算
トラブルシューティング
言語モデルのステージングの問題
デモプロジェクト
Windows用パッケージデモプロジェクト.
パフォーマンスを向上させる方法
このプラグインは、プラットフォームに応じて異なるGPUアクセラレーション手法を使用します。WindowsとLinuxではVulkan、MacとiOSプラットフォームではMetalを使用し、認識プロセスを大幅に高速化します。その他のプラットフォームでは、CPU + 組み込み関数によるアクセラレーションを使用します。ただし、以下の推奨事項に従うことで、プラグインのパフォーマンスをさらに向上させることができます:
Vosk エクステンション
デフォルトでは、Runtime Speech Recognizer プラグインは認識に whisper.cpp を使用します。whisper.cpp で GPU アクセラレーションをサポートしていないプラットフォーム(特に Android や Meta Quest などの Android ベースのプラットフォーム)では、認識は CPU とイントリンシクスにフォールバックするため、速度が遅く、バッテリーへの負担が大きくなります。Vosk 拡張プラグインは、Vosk に基づく代替プロバイダーを追加します。Vosk は軽量な音声認識ツールキットであり、制約のあるハードウェアでもうまく動作し、特に Meta Quest で優れた性能を発揮します。