Genel Bakış

Runtime Speech Recognizer, gerçek zamanlı, çevrimdışı konuşma tanımayı mümkün kılan platformlar arası bir eklentidir. Whisper OpenAI teknolojisine, özellikle whisper.cpp kütüphanesine dayanır ve eklenti ayarlarından indirilebilen önceden eğitilmiş dil modelleri kataloğuyla birlikte gelir; çok dilli modeller kullanıldığında otomatik dil algılama da sunar.
Dil Modellerini Kurma
İlk çalıştırmada, editör otomatik olarak bir dil modeli indirmenizi ister. Model seçme, indirme ve paketleme hakkında ayrıntılar için Dil modelleri nasıl kullanılır bölümüne bakın.
Temel açıklama
Bu eklenti, izin verici MIT lisansı altında sunulan whisper.cpp kütüphanesine dayanan gelişmiş algoritmalar kullanarak gerçek zamanlı konuşma tanıma sağlar. Akış veya akış olmayan girdi (bir dosya ya da ses verisi arabelleği gibi) olarak sağlanan gelen ses verisini, önceden eğitilmiş dil modelleriyle eşleştirir. Çok dilli modeller kullanıldığında, eklenti konuşulan dili otomatik olarak algılayabilir ve bu bilgiyi tanınan metinle birlikte sağlayabilir.
Eklenti, platforma bağlı olarak farklı GPU hızlandırma yöntemleri kullanır:
- Windows ve Linux: GPU hızlandırma için Vulkan kullanır; bu, tanıma sürecini önemli ölçüde hızlandırır.
- Mac ve iOS: GPU hızlandırma için Metal kullanır; Windows veya Linux Vulkan hızlandırmasıyla karşılaştırılabilir, hatta daha hızlı bir performans sunar.
- Diğer platformlar: Hızlandırma için CPU + intrinsics kullanır (örneğin Android veya Meta Quest üzerinde yerel olarak çalıştırıldığında daha yavaş olabilir). Bu platformlarda, daha hafif bir alternatif sağlayıcı olarak Vosk uzantısını değerlendirin.
Ek Kaynaklar
- Fab'dan edinin
- Ürün web sitesi
- Demo İndir (Windows)
- Video eğitimi (eski video)
- Eklenti Desteği ve Özel Geliştirme: [email protected] (ekipler ve kuruluşlar için özel çözümler)