Ana içeriğe geç

Genel Bakış

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer, gerçek zamanlı, çevrimdışı konuşma tanımayı mümkün kılan çapraz platform bir eklentidir. Whisper OpenAI teknolojisi, özellikle whisper.cpp kütüphanesi temel alınmıştır ve otomatik dil algılama özellikleriyle eklenti ayarlarında önceden seçilmiş birden çok dil modelini destekler.

Nasıl kurulur

İlk çalıştırmada, dil modellerini yükleyin (bunu otomatik olarak yapmanızı isteyen bir diyalog kutusu görünecektir).

Temel açıklama

Bu eklenti, hoşgörülü MIT lisansı altında sunulan whisper.cpp kütüphanesine dayalı gelişmiş algoritmalar kullanarak gerçek zamanlı konuşma tanıma sağlar. Gelen ses verilerini (akış veya akış olmayan girdi olarak, örneğin bir dosya veya ses verisi tamponu) önceden eğitilmiş dil modelleriyle karşılaştırır. Çok dilli modeller kullanıldığında, eklenti konuşulan dili otomatik olarak algılayabilir ve bu bilgiyi tanınan metinle birlikte sağlayabilir.

Eklenti, platforma bağlı olarak farklı GPU hızlandırma yöntemleri kullanır:

  • Windows ve Linux: GPU hızlandırması için Vulkan kullanır, bu da tanıma sürecini önemli ölçüde hızlandırır
  • Mac ve iOS: GPU hızlandırması için Metal kullanır, Windows veya Linux Vulkan hızlandırmasına kıyasla daha hızlı olmasa da benzer performans sunar
  • Diğer platformlar: Hızlandırma için CPU + intrinsics kullanır (yerel olarak çalıştırıldığında Android veya Meta Quest'te olduğu gibi daha yavaş olabilir)

Ek Kaynaklar

Join our Discord
online · support