개요

Runtime MetaHuman Lip Sync은 MetaHuman 및 커스텀 캐릭터 모두를 위한 실시간, 오프라인, 크로스 플랫폼 립싱크를 지원하는 플러그인입니다. 이 플러그인을 사용하면 다양한 소스의 오디오 입력에 따라 캐릭터의 입술을 애니메이션할 수 있습니다. 포함된 소스는 다음과 같습니다:
- Runtime Audio Importer의 캡처 가능한 사운드 웨이브를 통한 마이크 입력
- Runtime Text To Speech 또는 Runtime AI Chatbot Integrator에서 합성된 음성
- Runtime Audio Importer를 통해 여러 형식의 스트리밍 또는 가져온 오디오 데이터
- 부동 소수점 PCM 형식(부동 소수점 샘플 배열)의 모든 오디오 데이터
플러그인은 오디오 입력을 기반으로 내부적으로 비지엠(음소의 시각적 표현)을 생성합니다. 텍스트가 아닌 오디오 데이터로 직접 작동하므로 플러그인은 영어, 스페인어, 프랑스어, 독일어, 일본어, 중국어, 한국어, 러시아어, 이탈리아어, 포르투갈어, 아랍어, 힌디어를 포함한 다국어 입력을 지원하며, 이에 국한되지 않습니다. 사실상 모든 언어가 지원됩니다. 립싱크는 언어별 텍스트 처리에서 비롯되는 것이 아니라 오디오 음소에서 생성되기 때문입니다.
Standard Model은 14개의 비세임을 생성하고 사전 정의된 포즈 애셋을 사용하여 립싱크 애니메이션을 수행합니다. 반면, Realistic Models는 (MetaHuman 및 ARKit 기반 캐릭터 전용) 사전 정의된 포즈 애셋에 의존하지 않고 81개의 얼굴 제어 변경을 생성하므로 훨씬 더 사실적인 얼굴 애니메이션을 구현합니다.
캐릭터 호환성
이름에도 불구하고, Runtime MetaHuman Lip Sync은 MetaHuman 외에도 다양한 캐릭터에서 작동합니다:
인기 상업용 캐릭터 시스템
- Daz Genesis 8/9 캐릭터
- Reallusion Character Creator 3/4/5 (CC3/CC4/CC5) 캐릭터
- Mixamo 캐릭터
애니메이션 표준 지원
- FACS 기반 블렌드셰이프 시스템
- Apple ARKit 블렌드셰이프 표준
- Preston Blair 음소 세트
- 3ds Max 음소 시스템
- 얼굴 표정용 커스텀 모프 타깃이 있는 모든 캐릭터
Reallusion CC4/CC5 및 Daz Genesis 8.1/9를 비롯한 널리 사용되는 많은 시스템도 ARKit 표준 블렌드 셰이프 이름을 사용하도록 변환할 수 있습니다. 이를 통해 Standard Model의 수동 비짐 매핑 대신, 더 높은 품질의 얼굴 애니메이션을 제공하는 Realistic Model을 해당 캐릭터에 사용할 수 있습니다. 자세한 내용은 캐릭터를 ARKit 블렌드 셰이프로 변환하기를 참조하세요.
표준 모델을 사용하는 비-MetaHuman 캐릭터는 커스텀 캐릭터 설정 가이드를 참조하세요. 리얼리스틱 모델을 사용하는 ARKit 기반 캐릭터는 모프 타깃 세트 선택을 참조하세요.
애니메이션 미리보기
이 짧은 애니메이션들을 확인하여 플러그인이 다양한 캐릭터 유형과 모델에서 생성하는 립싱크 애니메이션의 품질을 살펴보세요:
주요 기능
- 마이크 입력에서 실시간 립싱크
- 오프라인 오디오 처리 지원
- 모델별 플랫폼 지원을 포함한 크로스 플랫폼 호환성
- 다양한 캐릭터 시스템 및 애니메이션 표준 지원
- 커스텀 캐릭터용 유연한 비지엄 매핑
- 범용 언어 지원 - 오디오 분석을 통해 모든 음성 언어에서 작동합니다.
- 향상된 표현력을 위한 감정 인식 얼굴 애니메이션
- 구성 가능한 출력 유형 (전체 얼굴 또는 입 전용 컨트롤)
- (선택 사항) 깜빡임 및 시선 추적용 눈 애니메이션 보조 도구
립싱크 모델
이 플러그인은 각기 다른 프로젝트 요구 사항에 맞는 여러 립싱크 모델을 제공합니다:
- 표준 모델
- 사실적인 모델
- 감정 지원 실사 모델
표준 립싱크 모델은 효율적인 크로스 플랫폼 성능과 폭넓은 캐릭터 호환성을 제공합니다:
- MetaHumans 및 모든 커스텀 캐릭터 유형과 호환됩니다.
- 실시간 성능에 최적화되었습니다.
- 리소스 요구 사항이 낮습니다.
- 플랫폼 지원: Windows, Android, Android 기반 플랫폼(Meta Quest 포함)
Standard Model을 사용하려면 추가 확장 플러그인을 설치해야 합니다. 설치 지침은 사전 요구 사항 섹션을 참조하세요.
현실적인 립싱크 모델은 특히 MetaHuman 캐릭터를 위해 향상된 시각적 충실도를 제공합니다:
- MetaHuman 및 ARKit 기반 캐릭터와 호환되며 고급 얼굴 애니메이션(81개의 얼굴 컨트롤) 지원
- 더 자연스러운 입 움직임과 더 높은 시각적 품질
- 약간 더 높은 성능 요구 사항
- 실시간 애플리케이션을 위한 스트리밍 오디오 처리
- 시네마틱 경험과 근접 캐릭터 인터랙션에 이상적
- 세 가지 최적화 수준: Original, Semi-Optimized, Highly Optimized
- 구성 가능한 모프 타겟 세트 (모프 타겟 세트 선택 참조)
- 플랫폼 지원: Windows, Mac, iOS, Linux, Android, Android 기반 플랫폼(Meta Quest 포함)
Realistic Model은(는) 메인 플러그인에 포함되어 있으며, 사용하기 위해 추가 확장 기능이 필요하지 않습니다.
무드를 지원하는 실감형 모델은 MetaHuman 캐릭터를 위한 감정 인식 얼굴 애니메이션을 제공합니다:
- MetaHuman 및 ARKit 기반 캐릭터와 호환되며, 감정 반응형 얼굴 애니메이션(81개의 얼굴 컨트롤)을 지원합니다.
- 12가지 서로 다른 감정 유형 (중립, 행복, 슬픔, 자신감 등)
- 조절 가능한 감정 강도 (0.0 ~ 1.0)
- 동기화 개선을 위한 조절 가능한 룩어헤드 타이밍 (20ms ~ 200ms)
- 선택 가능한 출력 유형: 전체 얼굴 또는 입 전용 컨트롤
- 실시간 애플리케이션을 위한 스트리밍 오디오 처리
- 구성 가능한 모프 타깃 세트 (모프 타깃 세트 선택 참조)
- 플랫폼 지원: Windows, Mac, iOS, Linux, Android, Android 기반 플랫폼 (Meta Quest 포함)
감정 지원 실사 모델은 메인 플러그인에 포함되어 있으며, 사용 시 추가 확장 기능이 필요하지 않습니다.
성능, 캐릭터 호환성, 시각적 품질, 대상 플랫폼 및 기능 요구 사항 등 프로젝트 요구 사항에 따라 적절한 모델을 선택할 수 있습니다.
작동 방식
플러그인은 다음과 같은 방식으로 오디오 입력을 처리합니다.
- 오디오 데이터는 지정된 채널 및 샘플 레이트를 가진 float PCM 포맷으로 수신됩니다.
- 플러그인은 모델에 따라 오디오를 처리하여 얼굴 제어 데이터 또는 비젬을 생성합니다.
- 무드 기능이 활성화된 모델의 경우, 감정적 맥락이 얼굴 애니메이션에 적용됩니다.
- 애니메이션 데이터가 캐릭터의 얼굴 움직임을 실시간으로 구동합니다.
성능 아키텍처
Runtime MetaHuman Lip Sync는 CPU 전용 추론을 사용하여 실시간 애플리케이션에 적합한 일관되고 저지연의 립싱크 결과를 제공합니다. 기본적으로 플러그인은 10밀리초마다 립싱크 처리를 수행합니다 (조정 가능 - 사용 가능한 모든 설정은 플러그인 구성을 참조하세요. 여기에는 처리 청크 크기, 스레드 수 및 기타 성능 매개변수가 포함됩니다).
모델 아키텍처 개요
립싱크 모델은 멜 스펙트로그램 분석을 통해 오디오를 처리하는 컴팩트한 트랜스포머 기반 신경망을 사용합니다. 이 경량 아키텍처는 효율적인 CPU 추론과 최소한의 메모리 사용량으로 실시간 성능을 내도록 특별히 설계되었습니다.
왜 CPU 추론인가?
작고 빈번한 추론 작업(예: 실시간 립싱크)의 경우 CPU 처리가 GPU보다 더 나은 지연 특성을 제공합니다. 배치 크기 1, 10-100ms 추론 간격에서는 PCIe 전송 및 커널 실행으로 인한 GPU 오버헤드가 실제 연산 시간을 초과하는 경우가 많습니다. 또한 게임 엔진에서 GPU는 이미 렌더링, 셰이더, 물리 연산으로 포화 상태여서 리소스 경합이 발생하고, 이로 인해 예측할 수 없는 지연 시간 급증이 나타납니다.
하드웨어 호환성
이 플러그인은 전용 그래픽 하드웨어 없이도 대부분의 중급 이상 CPU에서 효율적으로 작동하며, 데스크톱, 모바일, VR 플랫폼에서 실시간 성능을 제공합니다. 성능이 낮은 하드웨어에서는 모델 유형을 Semi-Optimized 또는 Highly Optimized로 조정하거나, **처리 청크 크기**를 늘려 응답성이 다소 낮아지더라도 실시간 성능을 유지할 수 있습니다.
빠른 시작
캐릭터에 립싱크를 활성화하기 위한 기본 설정 방법은 다음과 같습니다:
- MetaHuman 캐릭터의 경우 설정 가이드를 따르세요.
- 커스텀 캐릭터의 경우 커스텀 캐릭터 설정 가이드를 따르세요.
- 원하는 립싱크 모델을 선택하고 구성하세요.
- Blueprint에서 오디오 입력 처리를 설정하세요.
- Animation Blueprint에서 적절한 립싱크 노드를 연결하세요.
- 오디오를 재생하고 캐릭터가 소리에 맞춰 애니메이션되는지 확인하세요.
선택적 눈 애니메이션
이 플러그인에는 MetaHumans의 자동 눈 깜빡임 및 시선 추적을 위한 선택적 헬퍼도 포함되어 있습니다. 이들은 립싱크와 독립적이며, 단독으로 사용하거나 립싱크 위에 겹쳐 사용할 수 있습니다. 눈 애니메이션 헬퍼를 참조하세요.
추가 리소스
📦 다운로드 및 링크
데모 프로젝트:
즉시 사용 가능한 두 개의 데모 프로젝트가 제공됩니다. 자세한 내용, 다운로드 및 둘러보기는 전용 데모 프로젝트 페이지를 참조하세요:
- 종합 AI 대화형 NPC 워크플로 - 음성 인식 + LLM 챗봇 + TTS + 립싱크
- 기본 립싱크 데모 - 마이크 입력, 오디오 파일, TTS
두 데모 모두 크로스 플랫폼(Windows, Mac, Linux, iOS, Android, Meta Quest)을 지원하며, 패키징된 빌드와 전체 UE 5.6+ 소스 프로젝트로 제공됩니다.
🎥 영상 튜토리얼
추천 데모:
사실적인 모델(고품질) 튜토리얼:
- 오디오 파일/버퍼 기반 고품질 립싱크
- 무드 컨트롤 및 로컬 TTS 지원 고품질 립싱크
- ElevenLabs 및 OpenAI TTS 지원 고품질 립싱크
- 라이브 마이크 기반 고품질 립싱크
- ARKit 캐릭터용 고품질 립싱크
표준 모델 튜토리얼:
일반 설정:
- 데모 프로젝트에 커스텀 MetaHuman 캐릭터 추가하기
- 설정 튜토리얼 비디오
- MetaHuman 눈 깜빡임 및 카메라 추적
- 얼굴 및 신체 애니메이션과 결합하기
- 데모 프로젝트 둘러보기 (구버전)
💬 지원
- 맞춤 개발: [email protected] (팀 및 조직을 위한 맞춤형 솔루션)