Chuyển tới nội dung chính

Tổng quan

Runtime AI Chatbot Integrator Documentation

Runtime AI Chatbot Integrator là một plugin Unreal Engine đa nền tảng cho phép tích hợp liền mạch các chatbot AI và dịch vụ chuyển văn bản thành giọng nói trực tiếp vào dự án của bạn. Plugin hỗ trợ nhiều nhà cung cấp AI hàng đầu và cung cấp các tương tác trò chuyện linh hoạt với cả chế độ phản hồi streaming và không streaming, cùng khả năng chuyển đổi văn bản thành giọng nói chất lượng cao với tính năng streaming.

Các tính năng được hỗ trợ​

Trò chuyện Văn bản sang Văn bản​

Tích hợp khả năng hội thoại được hỗ trợ bởi AI với nhiều nhà cung cấp hàng đầu.

OpenAI​

  • GPT-5.6 Sol
  • GPT-5.6 Terra
  • GPT-5.6 Luna
  • GPT-5.5
  • GPT-5.4
  • GPT-5.4 Mini
  • GPT-5.4 Nano
  • GPT-5.3
  • GPT-5.2
  • GPT-5.1
  • GPT-5
  • GPT-5 Mini
  • GPT-5 Nano
  • GPT-4-1
  • GPT-4-1 Mini
  • GPT-4-1 Nano
  • GPT-4o
  • GPT-4o Mini
  • GPT-4
  • GPT-4 Turbo
  • GPT-4-32k
  • GPT-3.5 Turbo
  • GPT-3.5 Turbo 16k
  • ChatGPT-4o mới nhất
  • O1
  • O1 Pro
  • O3
  • O3 Mini
  • O4 Mini

Claude (Anthropic)​

  • Claude 5.5 Opus
  • Claude 5.5 Sonnet
  • Claude 5.1 Fable
  • Claude 5 Opus
  • Claude 5 Sonnet
  • Claude 5 Fable
  • Claude 4.8 Opus
  • Claude 4.7 Opus
  • Claude 4.6 Opus
  • Claude 4.6 Sonnet
  • Claude 4.5 Haiku
  • Claude 4.5 Sonnet
  • Claude 4.5 Opus
  • Claude 4.1 Opus
  • Claude 4 Sonnet
  • Claude 4.0 Opus
  • Claude 3.7 Sonnet
  • Claude 3.5 Haiku
  • Claude 3 Opus

DeepSeek​

  • DeepSeek V4 Pro
  • DeepSeek V4 Flash
  • DeepSeek Chat
  • DeepSeek Reasoner (với đầu ra suy luận chuyên dụng)

Gemini (Google)​

  • Gemini 3.7 Flash
  • Gemini 3.6 Flash
  • Gemini 3.1 Pro
  • Gemini 3.1 Flash Light
  • Gemini 3.5 Flash
  • Gemini 2.5 Pro
  • Gemini Flash mới nhất
  • Gemini Flash Lite mới nhất
  • Gemini 2.5 Flash
  • Gemini 2.5 Flash Lite
  • Gemini 2.0 Flash
  • Gemini 2.0 Flash Lite

Grok (xAI)​

  • Grok 4.3
  • Grok 4.1 Suy luận nhanh
  • Grok 4.1 Nhanh không suy luận
  • Grok 4 Suy luận nhanh
  • Grok 4 Nhanh không suy luận
  • Grok Code Nhanh 1
  • Grok 4 0709
  • Grok 3
  • Grok 3 Mini
  • Grok 2 Thị giác 1212

Ollama​

Chạy các mô hình AI cục bộ với quyền riêng tư hoàn toàn và không cần khóa API:

  • Bất kỳ mô hình nào có sẵn trong thư viện Ollama (ví dụ: Llama 3, Mistral, Gemma, Phi, Qwen, v.v.)
  • Các mô hình tùy chỉnh và được tinh chỉnh lưu trữ cục bộ

Chuyển văn bản thành giọng nói (TTS)​

Chuyển đổi văn bản thành giọng nói nghe tự nhiên bằng các nhà cung cấp TTS hàng đầu, với cả tùy chọn tiêu chuẩn và truyền phát trực tuyến.

OpenAI TTS​

Nhiều tùy chọn giọng nói với hỗ trợ thông thường và truyền phát:

  • Hợp kim
  • Tro
  • Khúc ca
  • San hô
  • Tiếng vang
  • Ngụ ngôn
  • Hắc ngọc
  • Tân tinh
  • Hiền triết
  • Lấp lánh
  • Vần thơ

Mô hình:

  • TTS-1
  • TTS-1-HD
  • GPT-4o Mini TTS

ElevenLabs TTS​

Nhiều mô hình với hỗ trợ thông thường và truyền phát:

  • Eleven v4 (Mô hình tổng hợp giọng nói giàu cảm xúc và biểu cảm nhất của ElevenLabs, với khả năng nhân bản giọng nói vượt trội, hỗ trợ hơn 90 ngôn ngữ và hội thoại nhiều người nói tự nhiên)
  • Eleven v4 Turbo (Mô hình tổng hợp giọng nói biểu cảm, thời gian thực với độ trễ cực thấp (~100ms trung vị), nhân bản giọng nói vượt trội và hỗ trợ hơn 90 ngôn ngữ)
  • Eleven V3 (Tạo giọng nói tự nhiên như người thật và biểu cảm, hỗ trợ hơn 70 ngôn ngữ)
  • Eleven TTV V3 (Mô hình thiết kế Text to Voice với giọng nói tự nhiên như người thật và biểu cảm, hỗ trợ hơn 70 ngôn ngữ)
  • Eleven Multilingual V2 (Tổng hợp giọng nói sống động như thật với biểu đạt cảm xúc phong phú, hỗ trợ 29 ngôn ngữ)
  • Eleven Turbo V2 (Mô hình chất lượng cao, độ trễ thấp được tối ưu hóa cho tiếng Anh)
  • Eleven Turbo V2.5 (Mô hình chất lượng cao, độ trễ thấp với hỗ trợ đa ngôn ngữ)
  • Eleven Flash V2 (Mô hình siêu nhanh được tối ưu hóa cho sử dụng thời gian thực bằng tiếng Anh)
  • Eleven Flash V2.5 (Mô hình siêu nhanh được tối ưu hóa cho sử dụng thời gian thực với hỗ trợ đa ngôn ngữ)
  • Eleven Monolingual V1

Google Cloud TTS​

Giọng nói neural chất lượng cao với hỗ trợ đa ngôn ngữ phong phú:

  • Giọng Neural2
  • Giọng Studio
  • Giọng Wavenet
  • Giọng Standard
  • Hỗ trợ Custom Voice
  • Nhiều ngôn ngữ và vùng địa phương
  • Hỗ trợ SSML để kiểm soát chi tiết

Azure TTS​

Dịch vụ giọng nói nhận thức của Microsoft với nhiều tùy chọn giọng nói phong phú:

  • Giọng nói nơ-ron đa ngôn ngữ
  • Phong cách giọng nói và cảm xúc
  • Hỗ trợ giọng nói tùy chỉnh
  • Hỗ trợ đánh dấu SSML

Các tính năng chính​

  • Tương thích đa nền tảng (Windows, Mac, Android, iOS, Linux, Meta Quest, và nhiều nền tảng khác)
  • Hỗ trợ nhiều nhà cung cấp AI và TTS
  • Hỗ trợ mô hình cục bộ qua Ollama (không cần API key, bảo mật hoàn toàn)
  • Phản hồi trò chuyện dạng streaming và không streaming
  • TTS dạng streaming để tổng hợp và xử lý âm thanh theo thời gian thực
  • Hỗ trợ mô hình suy luận với đầu ra suy luận và nội dung riêng biệt (DeepSeek, Grok)
  • Tổng hợp giọng nói chất lượng cao với độ trễ tối thiểu
  • Tích hợp dễ dàng với Unreal Engine Blueprints và C++
  • Tùy chọn cấu hình linh hoạt
  • Hỗ trợ hơn 90 ngôn ngữ với các mô hình ElevenLabs V4
  • Liệt kê và khám phá giọng nói cho Google Cloud và Azure TTS

Điều kiện tiên quyết​

Để sử dụng plugin, bạn sẽ cần thông tin xác thực truy cập API từ một trong các nhà cung cấp được hỗ trợ:

Để xử lý âm thanh, bạn có thể tự triển khai giải pháp của riêng mình hoặc sử dụng plugin Runtime Audio Importer, plugin này có thể nhập dữ liệu âm thanh ở nhiều định dạng khác nhau (MP3, WAV, FLAC, OGG VORBIS, OGG OPUS, BINK, RAW (PCM)). Để biết thêm thông tin, xem tại đây.

Tài nguyên bổ sung​

Join our Discord
online · support