개요

Runtime MetaHuman Lip Sync는 MetaHuman과 커스텀 캐릭터 모두를 위한 실시간, 오프라인, 크로스 플랫폼 립싱크를 가능하게 하는 플러그인입니다. 다양한 소스의 오디오 입력에 반응하여 캐릭터의 입술을 애니메이션화할 수 있습니다. 입력 소스는 다음과 같습니다:

Runtime Audio Importer의 캡처 가능한 사운드 웨이브를 통한 마이크 입력
Runtime Text To Speech 또는 Runtime AI Chatbot Integrator에서 합성된 음성
Runtime Audio Importer를 통해 여러 형식으로 스트리밍되거나 임포트된 오디오 데이터
float PCM 형식(부동 소수점 샘플 배열)의 모든 오디오 데이터

이 플러그인은 내부적으로 오디오 입력을 기반으로 비짐(음소의 시각적 표현)을 생성합니다. 텍스트가 아닌 오디오 데이터를 직접 처리하기 때문에, 이 플러그인은 영어, 스페인어, 프랑스어, 독일어, 일본어, 중국어, 한국어, 러시아어, 이탈리아어, 포르투갈어, 아랍어, 힌디어를 포함하되 이에 국한되지 않는 다국어 입력을 지원합니다. 말 그대로 모든 언어가 지원됩니다. 립싱크가 언어별 텍스트 처리가 아닌 오디오 음소에서 생성되기 때문입니다.

표준 모델은 14개의 비짐을 생성하고 미리 정의된 포즈 애셋을 사용하여 립싱크 애니메이션을 수행합니다. 반면, 리얼리스틱 모델(MetaHuman 캐릭터 전용)은 미리 정의된 포즈 애셋에 의존하지 않고 81개의 얼굴 제어 변화를 생성하여 훨씬 더 사실적인 얼굴 애니메이션을 만들어냅니다.

캐릭터 호환성

이름과 달리, Runtime MetaHuman Lip Sync는 MetaHuman뿐만 아니라 광범위한 캐릭터와 함께 작동합니다:

애니메이션 표준 지원

FACS 기반 블렌드쉐이프 시스템
Apple ARKit 블렌드쉐이프 표준
Preston Blair 음소 세트
3ds Max 음소 시스템
얼굴 표정을 위한 커스텀 모프 타겟이 있는 모든 캐릭터

MetaHuman이 아닌 캐릭터와 플러그인을 사용하는 자세한 방법은 커스텀 캐릭터 설정 가이드를 참조하세요.

애니메이션 미리보기

다양한 캐릭터 유형과 모델에서 플러그인이 생성하는 립싱크 애니메이션의 품질을 확인하려면 이 짧은 애니메이션을 확인하세요:

MetaHuman 캐릭터를 사용한 사실적인 모델

MetaHuman 캐릭터가 적용된 표준 모델

커스텀 캐릭터를 사용한 표준 모델

Standard model with custom character

주요 기능

마이크 입력을 통한 실시간 립싱크
오프라인 오디오 처리 지원
모델별 플랫폼 지원을 포함한 크로스 플랫폼 호환성
다중 캐릭터 시스템 및 애니메이션 표준 지원
커스텀 캐릭터를 위한 유연한 비즘(viseme) 매핑
오디오 분석을 통한 모든 구어 언어 지원 - 범용 언어 지원
표현력 향상을 위한 감정 인식 얼굴 애니메이션
구성 가능한 출력 타입 (전체 얼굴 또는 입 부분만 제어)

립싱크 모델

이 플러그인은 다양한 프로젝트 요구사항에 맞춰 여러 립싱크 모델을 제공합니다:

Standard Model
Realistic Model
Mood-Enabled Realistic Model

표준 립싱크 모델은 광범위한 캐릭터 호환성과 효율적인 크로스 플랫폼 성능을 제공합니다:

MetaHumans 및 모든 커스텀 캐릭터 타입과 작동
실시간 성능에 최적화됨
낮은 리소스 요구사항
플랫폼 지원: Windows, Android, Android 기반 플랫폼 (Meta Quest 포함)

확장 플러그인 필요

Standard Model을 사용하려면 추가 확장 플러그인을 설치해야 합니다. 설치 지침은 필수 조건 섹션을 참조하세요.

성능, 캐릭터 호환성, 시각적 품질, 타겟 플랫폼 및 기능 요구사항에 따라 적절한 모델을 선택할 수 있습니다.

작동 방식

이 플러그인은 다음과 같은 방식으로 오디오 입력을 처리합니다:

오디오 데이터는 지정된 채널 및 샘플 레이트를 가진 PCM 형식의 float로 수신됩니다
플러그인은 모델에 따라 얼굴 제어 데이터 또는 **비즘(visemes)**을 생성하기 위해 오디오를 처리합니다
감정 활성화 모델의 경우, 감정적 컨텍스트가 얼굴 애니메이션에 적용됩니다
애니메이션 데이터가 캐릭터의 얼굴 움직임을 실시간으로 구동합니다

성능 아키텍처

Runtime MetaHuman Lip Sync는 CPU 전용 추론을 사용하여 실시간 애플리케이션에 적합한 일관되고 낮은 지연 시간의 립싱크 결과를 제공합니다. 기본적으로 플러그인은 10밀리초마다 립싱크 처리를 수행합니다 (조정 가능 - Processing Chunk Size, 스레드 수 및 기타 성능 매개변수를 포함한 모든 사용 가능한 설정은 플러그인 구성 참조).

모델 아키텍처 개요

립싱크 모델은 멜-스펙트로그램 분석을 통해 오디오를 처리하는 컴팩트한 트랜스포머 기반 신경망을 사용합니다. 이 경량 아키텍처는 효율적인 CPU 추론과 최소 메모리 사용량으로 실시간 성능을 위해 특별히 설계되었습니다.

왜 CPU 추론인가요?

실시간 립싱크와 같은 작고 빈번한 추론 작업의 경우, CPU 처리가 GPU보다 더 나은 지연 시간 특성을 제공합니다. 배치 크기 1과 10-100ms 추론 간격에서 PCIe 전송 및 커널 실행으로 인한 GPU 오버헤드는 실제 계산 시간을 초과하는 경우가 많습니다. 또한 게임 엔진에서 GPU는 이미 렌더링, 셰이더 및 물리 작업으로 포화 상태여서 예측 불가능한 지연 시간 급증을 일으키는 리소스 경합을 생성합니다.

하드웨어 호환성

이 플러그인은 전용 그래픽 하드웨어 없이도 대부분의 중간 수준 이상의 CPU에서 효율적으로 작동하여 데스크톱, 모바일 및 VR 플랫폼 전반에 걸쳐 실시간 성능을 제공합니다. 약한 하드웨어의 경우 Model Type을 Semi-Optimized 또는 Highly Optimized로 조정하거나, **Processing Chunk Size**를 증가시켜 약간 감소된 반응성으로 실시간 성능을 유지할 수 있습니다.

빠른 시작

다음은 캐릭터에 립싱크를 활성화하기 위한 기본 설정입니다:

MetaHuman 캐릭터의 경우, 설치 가이드를 따르세요
커스텀 캐릭터의 경우, 커스텀 캐릭터 설치 가이드를 따르세요
선호하는 립싱크 모델을 선택하고 구성하세요
Blueprint에서 오디오 입력 처리를 설정하세요
Animation Blueprint에서 적절한 립싱크 노드를 연결하세요
오디오를 재생하고 감정을 담아 말하는 캐릭터를 확인하세요!

추가 자료

📦 다운로드 및 링크

데모 프로젝트:

Speech-to-Speech Demo (Full AI Workflow):
- 패키지된 데모 다운로드 (Windows) ⭐ NEW
- 소스 파일 다운로드 (UE 5.6+) ⭐ NEW
- 전체 음성 인식 + AI 챗봇 + TTS + 립싱크 워크플로우
- 필요 사항: 이 플러그인 + Runtime Audio Importer + Runtime Speech Recognizer + Runtime AI Chatbot Integrator, 선택 사항: Runtime Text To Speech
Basic Lip Sync Demo:
- 패키지된 데모 다운로드 (Windows)
- 소스 파일 다운로드 (UE 5.6+)
- 기본 워크플로우: 마이크 입력, 오디오 파일, TTS
- 필요 사항: 이 플러그인 + Runtime Audio Importer, 선택 사항: Text To Speech / AI Chatbot
표준 모델은 작은 확장 플러그인이 필요합니다 (여기 참조)

🎥 비디오 튜토리얼

주요 데모:

Speech-to-Speech AI Assistant Demo ⭐ NEW
Realistic Model Demo – 향상된 정확도

Realistic Model (고품질) 튜토리얼:

Standard Model 튜토리얼:

일반 설정:

💬 지원

Discord 지원 서버
커스텀 개발: [email protected] (팀 및 조직을 위한 맞춤형 솔루션)

캐릭터 호환성​

인기 있는 상업용 캐릭터 시스템​

애니메이션 표준 지원​

애니메이션 미리보기​

주요 기능​

립싱크 모델​

작동 방식​

성능 아키텍처​

모델 아키텍처 개요​

왜 CPU 추론인가요?​

하드웨어 호환성​

빠른 시작​

추가 자료​

📦 다운로드 및 링크​

🎥 비디오 튜토리얼​

주요 데모:​

Realistic Model (고품질) 튜토리얼:​

Standard Model 튜토리얼:​

일반 설정:​

💬 지원​