본문으로 건너뛰기

개요

Runtime Speech Recognizer Documentation

Runtime Speech Recognizer는 실시간 오프라인 음성 인식을 지원하는 크로스 플랫폼 플러그인입니다. OpenAI의 Whisper 기술, 특히 whisper.cpp 라이브러리를 기반으로 하며, 플러그인 설정에서 다운로드할 수 있는 사전 훈련된 언어 모델 카탈로그를 제공합니다. 다국어 모델을 사용할 때는 자동 언어 감지 기능이 지원됩니다.

언어 모델 설치

첫 실행 시 편집기에서 언어 모델을 자동으로 다운로드하라는 메시지가 표시됩니다. 모델 선택, 다운로드 및 패키징에 대한 자세한 내용은 언어 모델 사용 방법을 참조하세요.

기본 설명

이 플러그인은 허용적인 MIT 라이선스로 제공되는 whisper.cpp 라이브러리를 기반으로 한 고급 알고리즘을 사용하여 실시간 음성 인식을 제공합니다. 스트림 또는 비스트림 입력(예: 오디오 데이터 파일 또는 버퍼)으로 제공되는 수신 오디오 데이터를 사전 훈련된 언어 모델과 매칭합니다. 다국어 모델을 사용하는 경우, 플러그인은 음성 언어를 자동으로 감지하고 인식된 텍스트와 함께 이 정보를 제공할 수 있습니다.

이 플러그인은 플랫폼에 따라 서로 다른 GPU 가속 방식을 사용합니다:

  • Windows 및 Linux: GPU 가속에 Vulkan을 사용하여 인식 과정을 크게 가속화합니다.
  • Mac 및 iOS: GPU 가속에 Metal을 사용하여 Windows 또는 Linux의 Vulkan 가속과 필적하거나 더 빠른 성능을 제공합니다.
  • 기타 플랫폼: 가속에 CPU + 내장 함수(intrinsics)를 사용합니다(네이티브로 실행할 경우 Android 또는 Meta Quest에서처럼 더 느릴 수 있습니다). 이러한 플랫폼에서는 더 가벼운 대체 공급자로 Vosk 확장 기능을 고려하세요.

추가 리소스

Join our Discord
online · support