Runtime Speech Recognizer
Runtime Speech Recognizer 플러그인에 대한 문서입니다.
- Fab에서 구입하기
- 제품 웹사이트
- 데모 다운로드 (Windows)
- 비디오 튜토리얼
- 플러그인 지원 및 맞춤형 개발: [email protected] (팀 및 조직을 위한 맞춤형 솔루션)
개요
Runtime Speech Recognizer Documentation
플러그인 사용 방법
Runtime Speech Recognizer 플러그인은 들어오는 오디오 데이터에서 단어를 인식하도록 설계되었습니다. 엔진과 함께 작동하도록 약간 수정된 버전의 whisper.cpp를 사용합니다. 플러그인을 사용하려면 다음 단계를 따르세요.
언어 모델 선택 및 다운로드
현재 플러그인은 사전에 편집기에서 선택된 단일 언어 모델을 지원하도록 설계되어 있으며, 해당 모델은 프로젝트와 함께 패키징되어 사용됩니다. 특정 언어 모델을 선택, 다운로드 및 스테이징하려면 다음 단계를 따르세요:
인식 매개변수 목록
이 매개변수들은 인식기가 실행 중이지 않을 때만 설정할 수 있습니다.
지원 언어
이것은 사용 가능한 언어 모델에서 지원하는 전체 언어 목록입니다.
명령어 인식
Levenshtein 유사도 계산
문제 해결
언어 모델 스테이징 문제
데모 프로젝트
윈도우용 패키지 데모 프로젝트.
성능 향상 방법
이 플러그인은 플랫폼에 따라 다른 GPU 가속 방법을 사용합니다
Vosk 확장 프로그램
기본적으로 Runtime Speech Recognizer 플러그인은 인식을 위해 whisper.cpp를 사용합니다. whisper.cpp에서 GPU 가속을 지원하지 않는 플랫폼, 특히 Meta Quest와 같은 Android 기반 플랫폼에서는 인식이 CPU + intrinsics로 대체되어 속도가 느리고 배터리 소모가 큽니다. Vosk 확장 플러그인은 제한된 하드웨어에서 잘 작동하고 특히 Meta Quest에서 뛰어난 성능을 보이는 경량 음성 인식 툴킷인 Vosk 기반의 대체 제공자를 추가합니다.