Tổng quan

Runtime MetaHuman Lip Sync là một plugin cho phép đồng bộ khẩu hình (lip sync) theo thời gian thực, ngoại tuyến và đa nền tảng cho cả MetaHuman lẫn các nhân vật tùy chỉnh. Plugin cho phép bạn tạo chuyển động môi cho nhân vật phản hồi theo đầu vào âm thanh từ nhiều nguồn khác nhau, bao gồm:
- Đầu vào micrô thông qua sóng âm có thể thu được của Runtime Audio Importer
- Giọng nói tổng hợp từ Runtime Text To Speech hoặc Runtime AI Chatbot Integrator
- Dữ liệu âm thanh được phát trực tuyến hoặc nhập vào ở nhiều định dạng thông qua Runtime Audio Importer
- Bất kỳ dữ liệu âm thanh nào ở định dạng float PCM (một mảng các mẫu dấu chấm động)
Plugin tự động tạo ra các viseme (biểu thị trực quan của âm vị) dựa trên dữ liệu âm thanh đầu vào. Vì plugin hoạt động trực tiếp với dữ liệu âm thanh thay vì văn bản, plugin hỗ trợ đầu vào đa ngôn ngữ, bao gồm nhưng không giới hạn ở tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Nhật, tiếng Trung, tiếng Hàn, tiếng Nga, tiếng Ý, tiếng Bồ Đào Nha, tiếng Ả Rập và tiếng Hindi. Trên thực tế, mọi ngôn ngữ đều được hỗ trợ vì khớp môi được tạo ra từ các âm vị trong âm thanh thay vì xử lý văn bản theo từng ngôn ngữ cụ thể.
Sản phẩm Standard Model tạo ra 14 viseme và thực hiện hoạt hình khớp môi bằng cách sử dụng pose asset được xác định trước. Ngược lại, Realistic Models (dành riêng cho nhân vật dựa trên MetaHuman và ARKit) tạo ra 81 thay đổi điều khiển khuôn mặt mà không dựa vào pose asset được xác định trước, nhờ đó tạo ra hoạt hình khuôn mặt thực tế hơn đáng kể.
Khả năng tương thích của nhân vật
Mặc dù tên của nó, Runtime MetaHuman Lip Sync hoạt động với nhiều loại nhân vật ngoài MetaHuman:
Các hệ thống nhân vật thương mại phổ biến
- Nhân vật Daz Genesis 8/9
- Nhân vật Reallusion Character Creator 3/4/5 (CC3/CC4/CC5)
- Nhân vật Mixamo
Hỗ trợ các tiêu chuẩn hoạt ảnh
- Hệ thống blendshape dựa trên FACS
- Chuẩn blendshape Apple ARKit
- Bộ âm vị Preston Blair
- Hệ thống âm vị 3ds Max
- Bất kỳ nhân vật nào có morph target tùy chỉnh cho biểu cảm khuôn mặt
Nhiều hệ thống phổ biến, bao gồm Reallusion CC4/CC5 và Daz Genesis 8.1/9, cũng có thể được chuyển đổi để sử dụng các tên blendshape chuẩn ARKit. Điều này cho phép bạn dùng Realistic Model cho các nhân vật này, với hoạt ảnh khuôn mặt chất lượng cao hơn, thay thế cho việc ánh xạ viseme thủ công của Standard Model. Xem Chuyển đổi nhân vật sang Blendshape ARKit để biết chi tiết.
Đối với các nhân vật không phải MetaHuman sử dụng Standard Model, hãy xem Hướng dẫn thiết lập nhân vật tùy chỉnh. Đối với các nhân vật dựa trên ARKit sử dụng Realistic Models, hãy xem Lựa chọn bộ Morph Target.
Xem trước hoạt ảnh
Hãy xem các đoạn animation ngắn này để thấy chất lượng hoạt hình lip sync do plugin tạo ra trên nhiều loại nhân vật và mô hình khác nhau:
Tính năng chính
- Khớp khẩu hình môi theo thời gian thực từ đầu vào micro
- Hỗ trợ xử lý âm thanh ngoại tuyến
- Tương thích đa nền tảng với hỗ trợ nền tảng riêng theo từng mô hình
- Hỗ trợ nhiều hệ thống nhân vật và tiêu chuẩn hoạt ảnh
- Ánh xạ viseme linh hoạt cho nhân vật tùy chỉnh
- Hỗ trợ ngôn ngữ phổ quát – hoạt động với mọi ngôn ngữ nói thông qua phân tích âm thanh
- Hoạt ảnh khuôn mặt theo cảm xúc để tăng biểu cảm
- Các loại đầu ra có thể cấu hình (điều khiển toàn bộ khuôn mặt hoặc chỉ miệng)
- Tùy chọn công cụ hỗ trợ hoạt ảnh mắt cho việc chớp mắt và theo dõi ánh nhìn
Các mô hình Lip Sync
Plugin cung cấp nhiều mô hình lip sync để đáp ứng các nhu cầu khác nhau của dự án:
- Mô hình tiêu chuẩn
- Mô hình chân thực
- Mô hình chân thực hỗ trợ cảm xúc
Mô hình lip sync tiêu chuẩn cung cấp hiệu năng cao trên nhiều nền tảng với khả năng tương thích nhân vật rộng rãi:
- Hoạt động với MetaHumans và mọi loại nhân vật tùy chỉnh
- Được tối ưu hóa cho hiệu suất thời gian thực
- Yêu cầu tài nguyên thấp hơn
- Hỗ trợ nền tảng: Windows, Android, các nền tảng dựa trên Android (bao gồm Meta Quest)
Để sử dụng Standard Model, bạn cần cài đặt thêm một plugin mở rộng. Xem phần Điều kiện tiên quyết để biết hướng dẫn cài đặt.
Mô hình đồng bộ khẩu hình chân thực mang lại độ trung thực hình ảnh nâng cao dành riêng cho các nhân vật MetaHuman:
- Tương thích với các nhân vật MetaHuman và nhân vật dựa trên ARKit, hỗ trợ hoạt ảnh khuôn mặt nâng cao (81 điều khiển khuôn mặt)
- Chất lượng hình ảnh cao hơn với chuyển động miệng tự nhiên hơn
- Yêu cầu hiệu năng cao hơn một chút
- Xử lý luồng âm thanh cho các ứng dụng thời gian thực
- Lý tưởng cho trải nghiệm điện ảnh và tương tác nhân vật cận cảnh
- Ba cấp độ tối ưu hóa: Original, Semi-Optimized và Highly Optimized
- Các bộ morph target có thể được cấu hình (xem Lựa chọn bộ Morph Target)
- Hỗ trợ nền tảng: Windows, Mac, iOS, Linux, Android, các nền tảng dựa trên Android (bao gồm Meta Quest)
Realistic Model được tích hợp trong plugin chính và không yêu cầu bất kỳ tiện ích mở rộng bổ sung nào để sử dụng.
Mô hình chân thực hỗ trợ tâm trạng cung cấp hoạt ảnh khuôn mặt nhận biết cảm xúc cho các nhân vật MetaHuman:
- Tương thích với MetaHuman và các nhân vật dựa trên ARKit, có hoạt ảnh khuôn mặt phản ứng theo tâm trạng (81 bộ điều khiển khuôn mặt)
- 12 kiểu tâm trạng khác nhau (Trung lập, Vui, Buồn, Tự tin, v.v.)
- Cường độ cảm xúc có thể cấu hình (0.0 đến 1.0)
- Thời gian nhìn trước có thể điều chỉnh để cải thiện khả năng đồng bộ (20ms đến 200ms)
- Các loại đầu ra có thể chọn: điều khiển toàn bộ khuôn mặt hoặc chỉ miệng.
- Xử lý âm thanh theo luồng cho các ứng dụng thời gian thực
- Các bộ mục tiêu morph có thể cấu hình (xem Lựa chọn bộ mục tiêu morph)
- Hỗ trợ nền tảng: Windows, Mac, iOS, Linux, Android, các nền tảng dựa trên Android (bao gồm Meta Quest)
Mô hình chân thực hỗ trợ tâm trạng được tích hợp trong plugin chính và không yêu cầu bất kỳ tiện ích mở rộng bổ sung nào để sử dụng.
Bạn có thể chọn mô hình phù hợp dựa trên các yêu cầu của dự án về hiệu suất, khả năng tương thích nhân vật, chất lượng hình ảnh, nền tảng mục tiêu và nhu cầu tính năng.
Cách hoạt động
Plugin xử lý đầu vào âm thanh theo cách sau:
- Dữ liệu âm thanh được nhận dưới dạng float định dạng PCM với số kênh và tần số lấy mẫu được chỉ định
- Plugin xử lý âm thanh để tạo dữ liệu điều khiển khuôn mặt hoặc viseme tùy thuộc vào mô hình
- Đối với các mô hình hỗ trợ tâm trạng, ngữ cảnh cảm xúc được áp dụng vào hoạt ảnh khuôn mặt
- Dữ liệu hoạt ảnh điều khiển chuyển động khuôn mặt của nhân vật theo thời gian thực
Kiến trúc hiệu năng
Runtime MetaHuman Lip Sync sử dụng suy luận chỉ trên CPU để mang lại kết quả đồng bộ khẩu hình nhất quán, độ trễ thấp, phù hợp cho các ứng dụng thời gian thực. Theo mặc định, plugin thực hiện xử lý đồng bộ khẩu hình mỗi 10 mili giây (có thể điều chỉnh - xem Cấu hình Plugin để biết tất cả các cài đặt khả dụng, bao gồm Kích thước khối xử lý, số luồng và các tham số hiệu năng khác).
Tổng quan Kiến trúc Mô hình
Các mô hình khớp khẩu hình sử dụng mạng nơ-ron gọn nhẹ dựa trên kiến trúc transformer, xử lý âm thanh thông qua phân tích phổ đồ mel. Kiến trúc nhẹ này được thiết kế đặc biệt để đạt hiệu suất thời gian thực với khả năng suy luận trên CPU hiệu quả và mức chiếm dụng bộ nhớ tối thiểu.
Tại sao suy luận bằng CPU?
Đối với các thao tác suy luận nhỏ và thường xuyên như đồng bộ khẩu hình theo thời gian thực, xử lý bằng CPU mang lại đặc tính độ trễ tốt hơn so với GPU. Ở kích thước lô bằng 1 với các lần suy luận cách nhau 10–100ms, chi phí phụ trội của GPU từ việc truyền dữ liệu qua PCIe và khởi chạy kernel thường vượt quá thời gian tính toán thực tế. Ngoài ra, trong các game engine, GPU vốn đã bị bão hòa bởi việc dựng hình, shader và vật lý, tạo ra sự tranh chấp tài nguyên làm xuất hiện những đợt tăng độ trễ không thể đoán trước.
Khả năng tương thích phần cứng
Plugin hoạt động hiệu quả trên hầu hết các CPU từ tầm trung trở lên mà không yêu cầu phần cứng đồ họa chuyên dụng, mang lại hiệu suất thời gian thực trên các nền tảng máy tính để bàn, di động và VR. Với phần cứng yếu hơn, bạn có thể điều chỉnh Loại mô hình thành Semi-Optimized hoặc Highly Optimized, hoặc tăng Kích thước khối xử lý để duy trì hiệu suất thời gian thực với độ phản hồi giảm nhẹ.
Bắt đầu nhanh
Đây là một thiết lập cơ bản để bật lip sync cho nhân vật của bạn:
- Đối với nhân vật MetaHuman, hãy làm theo Hướng dẫn thiết lập
- Đối với nhân vật tùy chỉnh, hãy làm theo Hướng dẫn thiết lập nhân vật tùy chỉnh
- Chọn và cấu hình mô hình khớp môi bạn muốn
- Thiết lập xử lý đầu vào âm thanh trong Blueprint của bạn
- Kết nối nút khớp môi phù hợp trong Animation Blueprint
- Phát âm thanh và xem nhân vật của bạn chuyển động đồng bộ
Hoạt ảnh mắt tùy chọn
Plugin cũng bao gồm các trình trợ giúp tùy chọn cho chớp mắt tự động và theo dõi ánh mắt trên MetaHumans. Các tính năng này độc lập với lip sync và có thể được sử dụng độc lập hoặc xếp chồng lên trên nó. Xem Trợ giúp Hoạt hình Mắt.
Tài nguyên bổ sung
📦 Tải xuống & Liên kết
Các dự án demo:
Có hai dự án demo sẵn sàng sử dụng - hãy xem trang Dự án Demo chuyên dụng để biết chi tiết đầy đủ, bản tải xuống và hướng dẫn từng bước:
- Quy trình NPC hội thoại AI đầy đủ - nhận dạng giọng nói + chatbot LLM + TTS + khớp khẩu hình
- Bản demo Lip Sync cơ bản - đầu vào micrô, tệp âm thanh, TTS
Cả hai bản demo đều đa nền tảng (Windows, Mac, Linux, iOS, Android, Meta Quest) và được phân phối dưới dạng các bản build đóng gói cùng với dự án nguồn UE 5.6+ đầy đủ.
🎥 Video Hướng dẫn
Bản demo nổi bật:
Hướng dẫn về mô hình chân thực (chất lượng cao):
- Lip Sync chất lượng cao từ Tệp/Bộ đệm Âm thanh
- Lip Sync chất lượng cao với Kiểm soát cảm xúc & TTS cục bộ
- Lip Sync chất lượng cao với ElevenLabs & OpenAI TTS
- Lip Sync chất lượng cao với Micrô trực tiếp
- Lip Sync chất lượng cao cho Nhân vật ARKit
Hướng dẫn Mô hình Tiêu chuẩn:
- Khớp khẩu hình tiêu chuẩn với micro trực tiếp
- Khớp khẩu hình tiêu chuẩn với Text-to-Speech cục bộ
- Khớp khẩu hình tiêu chuẩn với ElevenLabs và OpenAI TTS
Thiết lập chung:
- Thêm nhân vật MetaHuman tùy chỉnh vào dự án demo
- Video hướng dẫn thiết lập
- Chớp mắt MetaHuman & theo dõi camera
- Kết hợp với hoạt ảnh khuôn mặt và cơ thể
- Hướng dẫn chi tiết dự án demo (bản cũ)
💬 Hỗ trợ
- Phát triển tùy chỉnh: [email protected] (giải pháp phù hợp cho các nhóm & tổ chức)