概覽

Runtime Local LLM 是一個外掛,使用 llama.cpp 在裝置上完全執行大型語言模型,運行時無需網路連線。它支援 GGUF 模型檔案,並提供完整的 Blueprint API,用於載入模型、傳送訊息以及接收逐 token 的回應,所有處理均在背景執行緒中進行,並搭配遊戲執行緒的回調機制。
此外掛支援 Windows、Mac、Linux、Android(包含 Meta Quest 及其他基於 Android 的平台)以及 iOS。
主要功能
- 完整離線推論:執行時無需雲端服務或 API 金鑰
- GGUF 模型支援:載入任何 GGUF 格式的模型(Llama、Mistral、Phi、Gemma、Qwen 等)
- 最新 llama.cpp:定期在 Fab 上更新,以跟隨 llama.cpp 的發行版本,確保始終支援最新的 GGUF 模型格式
- GPU 加速:在 Windows 和 Linux 上使用 Vulkan,在 Mac 和 iOS 上使用 Metal,在 Android 和 Meta Quest 上使用 CPU + 內建指令集
- 多種模型載入方式:
- 從本地檔案路徑載入
- 透過模型名稱載入(在 Blueprints 中以下拉選單選擇)
- 從 URL 下載並自動載入
- 僅下載以預先快取模型
- 逐 token 串流:即時接收每個生成的 token 以進行即時顯示
- 非同步 Blueprint 節點:具有輸出委託的節點,用於載入、傳送訊息及下載
- 可設定推論參數:溫度 (Temperature)、Top-P、Top-K、重複懲罰、GPU 層級卸載、上下文大小、種子、執行緒計數及系統提示詞
- 對話管理:支援多輪對話、上下文重置、儲存/載入至磁碟、記憶體快照,以及針對長時間對話的自動摘要功能
- 編輯器模型管理器:直接在專案設定中瀏覽、下載、匯入、刪除及測試模型
- 跨平台封裝:模型透過 NonUFS 暫存區隨專案一併發行
運作原理
- 在編輯器中管理模型:使用外掛程式設定面板瀏覽預定義模型的目錄、下載它們,或匯入您自己的 GGUF 檔案
- 在執行階段載入模型:呼叫其中一個載入函式(透過檔案、名稱、URL 或元數據),並搭配您的推論參數
- 傳送訊息:將使用者訊息傳遞給 LLM 實例;當模型產生回應時,token 會透過委派回傳串流
- 使用回應:在聊天 UI 中顯示 token、驅動 NPC 對話、產生動態內容,或將其餵入其他系統
所有推論執行都在專用的背景執行緒上進行。回呼(token 產生、完成、錯誤)會在遊戲執行緒上觸發,因此您可以安全地從中更新 UI 和遊戲狀態。
常見使用案例
- 遊戲內聊天機器人與助手:問答、協助系統、動態教學
- NPC 對話:具有持久角色記憶的交談型 NPC,使用對話快照
- 長時角色扮演與敘事系統:自動摘要功能可將多小時的對話保持在上下文限制內,同時不遺失關鍵事實
- 程序化內容:即時生成任務描述、物品背景故事與對話樹
- 離線優先應用程式:任何需要 LLM 能力但無需網路連線的應用
模型存儲與打包
模型以 .gguf 檔案形式儲存於專案的 Content/RuntimeLocalLLM/Models 目錄中。外掛程式會自動設定 Additional Non-Asset Directories To Copy(DirectoriesToAlwaysStageAsNonUFS),確保模型檔案隨封裝後的專案一併發行,並在執行階段透過標準檔案 I/O 保持可存取性。
每個模型還附帶一個 .json 側邊欄檔案,用於儲存其元數據(顯示名稱、系列、變體、描述、參數量)。
支援的模型
此外掛程式支援任何 GGUF 格式的模型。編輯器提供常用預定義模型的目錄,可一鍵下載,同時您也能匯入任何自訂的 GGUF 檔案。常見的模型系列包括:
- Llama (Meta) — 1B、3B、8B 及更大版本
- Mistral / Mixtral — 7B 及更大版本
- Phi (Microsoft) — 2B、3B、4B
- Gemma (Google) — 2B、7B
- Qwen (Alibaba) — 1.5B、7B 及更大版本
- TinyLlama — 1.1B
- 以及眾多其他社群模型
量化
模型提供多種量化等級,可在品質與大小、速度之間取得平衡:
| 量化 | 品質 | Size | 速度 |
|---|---|---|---|
| Q2_K | 較低 | 最小 | 最快 |
| Q4_K_M | Good | 中等 | Fast |
| Q5_K_M | 更好 | 較大 | 適中 |
| Q8_0 | High | 大型 | 較慢 |
| F16 / F32 | 最高 | 最大 | 最慢 |
對於行動裝置與 VR 裝置,建議使用較小的量化等級(Q2_K 至 Q4_K_M)搭配輕量模型(1B–3B 參數)。對於桌面電腦,則可根據可用的 RAM 與 CPU/GPU 資源,使用較大的模型與更高的量化等級。
額外資源
- 在 Fab 上獲取
- 產品網站
- 下載演示版 (Windows)
- 影片教學
- 插件支援與客製化開發:[email protected](為團隊與組織量身打造的解決方案)
Join our Discord
online · support