Chuyển tới nội dung chính

Tổng quan

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer là plugin đa nền tảng cho phép nhận dạng giọng nói theo thời gian thực, ngoại tuyến. Dựa trên công nghệ Whisper OpenAI, đặc biệt là thư viện whisper.cpp, và đi kèm với một danh mục các mô hình ngôn ngữ được huấn luyện sẵn mà bạn có thể tải xuống từ cài đặt của plugin, có tính năng tự động phát hiện ngôn ngữ khi sử dụng các mô hình đa ngôn ngữ.

Cài đặt mô hình ngôn ngữ

Trong lần chạy đầu tiên, trình biên tập sẽ nhắc bạn tải xuống mô hình ngôn ngữ một cách tự động. Xem Cách sử dụng mô hình ngôn ngữ để biết chi tiết về cách chọn, tải xuống và đóng gói các mô hình.

Mô tả cơ bản

Plugin này cung cấp tính năng nhận dạng giọng nói theo thời gian thực bằng các thuật toán tiên tiến dựa trên thư viện whisper.cpp, được phát hành theo giấy phép MIT cho phép. Plugin khớp dữ liệu âm thanh đầu vào, được cung cấp dưới dạng luồng hoặc đầu vào không phải luồng (chẳng hạn như tệp hoặc bộ đệm dữ liệu âm thanh), với các mô hình ngôn ngữ đã được huấn luyện trước. Khi sử dụng các mô hình đa ngôn ngữ, plugin có thể tự động phát hiện ngôn ngữ được nói và cung cấp thông tin này cùng với văn bản đã nhận dạng.

Plugin này sử dụng các phương pháp tăng tốc GPU khác nhau tùy thuộc vào nền tảng:

  • Windows và Linux: Sử dụng Vulkan để tăng tốc GPU, giúp tăng tốc đáng kể quá trình nhận dạng
  • Mac và iOS: Sử dụng Metal để tăng tốc GPU, mang lại hiệu suất tương đương với tăng tốc Vulkan trên Windows hoặc Linux, thậm chí có thể nhanh hơn
  • Nền tảng khác: Sử dụng CPU + intrinsics để tăng tốc (có thể chậm hơn, chẳng hạn như trên Android hoặc Meta Quest, khi chạy native). Trên các nền tảng này, hãy cân nhắc sử dụng tiện ích mở rộng Vosk như một nhà cung cấp thay thế nhẹ hơn.

Tài nguyên bổ sung

Join our Discord
online · support