---
slug: open-llm-vtuber-live2d-project-airi-comparison
title: Open-LLM-VTuber：把 LLM、語音和 Live2D 接成能跑的 VTuber 系統
status: published
excerpt: Open-LLM-VTuber 不是單純的聊天 bot，而是把語音互動、視覺感知、Live2D、桌寵模式和離線跑法接成一套可用的虛擬角色系統；這篇順手拿 Project AIRI 來比，直接看兩者差在哪。
category: AI Agents
tags: [open-llm-vtuber, live2d, vtuber, voice, agent, airi, avatar]
author: Seer
author_role: Author
read_time: 12 min
cover: "/static/open-llm-vtuber-live2d-project-airi-comparison-cover.png"
closing_note: "代碼給予了角色聲音與形體，但真正的靈魂，始於螢幕另一端長久的凝視。"
published_at: "2026-07-01T01:18:06Z"
updated_at: "2026-07-01T15:54:39Z"
---

想要在電腦桌面上跑一個可以用語音直接對話、甚至能透過 Webcam 看到你畫面的 Live2D 虛擬角色？在過去，你得自己寫腳本去接 ASR 語音辨識、拉 OpenAI API、串 TTS 語音合成，最後還要折騰 WebGL 把 Live2D 渲染出來。[Open-LLM-VTuber](https://github.com/Open-LLM-VTuber/Open-LLM-VTuber) 這個專案，就是把這整條又臭又長的 pipeline 直接打包成一套開箱即用的系統。

它不是只做一個簡單的網頁聊天框，防禦性地說，也不是只做個 VTuber 的外皮，而是把以下這幾個常被拆開的模組接在一起：

- **LLM**：負責語意理解、對話生成與邏輯推理。
- **ASR / TTS**：負責把語音轉文字（聽），以及文字轉語音（說）。
- **Live2D**：負責角色外觀、表情綁定與嘴形同步（lipsync）。
- **視覺感知**：能讀取相機鏡頭、螢幕截圖或錄影畫面，讓 Agent「看見」你。
- **桌寵模式**：支援透明背景、視窗置頂與拖曳，真正融入你的工作桌面。
- **Session 延續**：持久化保存聊天紀錄，讓對話歷史上下文不中斷。

如果你想開發「Agent + Live2D」的桌面上層應用，這套架構是目前開源社群裡非常成熟的樣板。

官方資源：[GitHub 倉庫](https://github.com/Open-LLM-VTuber/Open-LLM-VTuber) | [官方文件說明](https://docs.llmvtuber.com/docs/quick-start/) | [Live2D 配置指南](https://docs.llmvtuber.com/docs/user-guide/live2d/)

## 從語音到視覺：這套虛擬角色系統在解什麼問題？

官方 README 把定位寫得很明確：它是一個支援語音互動、具備 Live2D avatar 與視覺感知能力的 AI 伴侶（AI Companion）。

它的互動流程基本如下：
1. 使用者直接說話，系統透過 ASR 即時辨識。
2. Agent 可以透過螢幕分享或 Webcam 畫面，理解你當前在幹嘛。
3. 透過 LLM 生成回覆後，經由 TTS 轉換成語音，同時驅動 Live2D 角色的嘴形與隨機動作。
4. 可以用小視窗或透明桌寵形式置頂在桌面一角，背景乾淨。

這套系統最實用的地方在於，它已經把這幾個模組的串接細節都封裝好了，你不用自己去寫複雜的狀態機來處理「聽 -> 想 -> 說」的非同步同步問題。

## 後端彈性：本地模型與 API 隨你混搭

Open-LLM-VTuber 最迷人的一點是，它的後端架構非常有彈性，完全沒有綁定單一服務商。

不論是 LLM、ASR 還是 TTS，都提供了極為豐富的支援選項：

| 模組類別 | 支援的後端與服務 |
|---|---|
| **LLM** | Ollama、OpenAI（及所有支援 OpenAI-compatible API 的後端，如 OneAPI、LM Studio）、Gemini、Claude、DeepSeek、vLLM 等。 |
| **ASR (語音辨識)** | sherpa-onnx、FunASR、Faster-Whisper、Whisper.cpp、Groq Whisper API、Azure ASR。 |
| **TTS (語音合成)** | sherpa-onnx、MeloTTS、GPT-SoVITS、CosyVoice、Edge TTS、Fish Audio、Azure TTS。 |

這代表你可以根據自身的硬體狀況，靈活調配部署策略。你可以把所有運算都壓在本地端（如 Ollama + Faster-Whisper + GPT-SoVITS），也可以圖個方便省事，全部走雲端 API 混搭。

> **關於訂閱帳號直連**：
> 官方文件目前僅支援輸入 API Key 或設定本地 / 託管後端。它並不支持直接登入你的 ChatGPT Plus 或 Claude Pro 等消費者訂閱帳號來撈資料。

## 實務部署：官方推薦的快速入門路徑

如果你想省去設定本地 GPU 的繁瑣步驟，官方其實給了一條「輕量化部署」的捷徑：

1. **基礎依賴安裝**：本機需先安裝 Git 與 FFmpeg，並建議使用 Chrome 瀏覽器開啟前端。
2. **免顯卡混搭方案**：LLM 走 OpenAI-compatible API（例如 DeepSeek 或 Groq），ASR 走 Groq Whisper API，TTS 走免費且免安裝的 Edge TTS。
3. **安全提示**：如果不是在 localhost 跑，而是部署在遠端伺服器，你必須幫網頁補上 HTTPS 憑證，否則瀏覽器出於安全機制會直接擋掉麥克風權限。

這套接法只需要配置幾個 API Key 就能跑起來，完全不需要吃你本機的 GPU 算力。

## 軟硬體門檻：到底需不需要一張神卡？

如果你堅持要在「全地端」離線跑完這整套流程，硬體資源的消耗就會變得相當可觀。

- **最低硬體**：如果 LLM、ASR 和 TTS 都走雲端 API，那即便是一台樹莓派也能順暢運行前端。
- **全本地運行**：建議使用 Apple Silicon 的 Mac（M2/M3 等）或擁有 NVIDIA 顯卡的 PC。
- **算力分配**：全地端運行時，CPU 通常要拿來處理 ASR 語音辨識，GPU 負責跑 Ollama 的 LLM 推理，而 TTS 合成如果沒有顯卡加速，對話的延遲感（Latency）會非常明顯。

如果只有普通 CPU，跑全地端很容易遇到「講完話要等 5 秒角色才有反應」的尷尬狀況。體感上，混搭雲端 API 是性價比最高的做法。

## 客製化外觀：如何替換你自己的 Live2D 模型？

換上自己喜歡的角色皮，是玩這套系統最大的樂趣。

替換模型的具體步驟如下：
1. 準備好你的 Live2D 模型資料夾。
2. 將整個資料夾放進專案底下的 `live2d-models` 目錄中。
3. 編輯 `model_dict.json`，在裡面登錄你的模型名稱與設定檔路徑。
4. 在全域設定檔 `conf.yaml` 或 `characters/` 下的角色 YAML 檔中，將模型欄位指定為你剛剛註冊的名稱。

> **版本限制**：
> 專案底層渲染使用的是 `pixi-live2d-display-lipsyncpatch`，目前僅支援 **Cubism 3 至 Cubism 5** 的模型格式，舊版的 **Cubism 2**（例如早期常見的 `.model.json`）是無法直接載入的。
>
> 另外，實務上建議先用 Vtuber Studio 或 Live2D Cubism Viewer 確認角色的表情清單（Expressions）與動作組（Motions），並在 `model_dict.json` 裡做好對應，這樣 Agent 才能在講話時做出對應的表情。

## 聲線克隆與 TTS 設定

除了外觀，聲音也是角色的靈魂。這套專案在聲音上主要提供三種層次的改動：

1. **更換 TTS 引擎**：直接在 `conf.yaml` 裡切換 Edge TTS 或 Fish Audio 等不同服務。
2. **微調音色參數**：在對應的 TTS 模組設定中，修改 speaker ID 或角色聲音設定。
3. **語音複製 (Voice Cloning)**：如果你有架設 GPT-SoVITS 或 CosyVoice 後端，你可以拿該角色的幾句音檔做訓練，讓 Agent 用一模一樣的配音聲線跟你對話。

這對於想百分之百還原某個動漫角色或特定 V 的人來說，是不可或缺的功能。

## 擂台對決：Open-LLM-VTuber vs. Project AIRI

在開源社群中，[Project AIRI](file:///D:/Blog/content/posts/open-llm-vtuber-live2d-project-airi-comparison.md) 也常被拿來做比較，但兩者的設計哲學大不相同。

| 比較面向 | Open-LLM-VTuber | Project AIRI |
|---|---|---|
| **核心定位** | 開源 VTuber 工作台與桌面陪伴工具 | 角色關係伴侶系統與數位分身 |
| **視覺支援** | 專注於 Live2D 渲染與桌寵透明置頂 | 同時支援 Live2D 與 VRM 3D 角色 |
| **互動層面** | 強調「語音 + 視覺感知（Webcam/截圖）」 | 強調「語音 + 記憶體管理 + 遊戲連動」 |
| **記憶機制** | 偏向短期對話紀錄的 Session 延續 | 擁有獨立的長期記憶庫與知識庫系統 |
| **適用場景** | 虛擬主播、桌面助手、快速 PoC 驗證 | 虛擬女友、遊戲陪玩、數位分身、角色客服 |

簡單來說，Open-LLM-VTuber 的定位更偏向**工具鏈與互動引擎**，它的目的是幫你把 Live2D 和語音前端接好；而 Project AIRI 則更偏向**人格與關係系統**，花了很多心思在解長期記憶和陪伴感。

## 殊途同歸：虛擬角色系統的未來交會點

雖然這兩套專案切入點不同，但它們都在解同一個技術難題：如何讓冷冰冰的 LLM 具備「擬人性」。

Open-LLM-VTuber 選擇先攻克「皮囊」與「感官」，把 Live2D 嘴形同步、桌面透明化以及 Webcam 看畫面這段體驗打磨得非常流暢。而 Project AIRI 則選擇先解「靈魂」，讓角色記得你三天前說過的話，甚至能跟你一起玩遊戲。

理想的終極形態，其實是把 Open-LLM-VTuber 當成前端互動層，背後去接 Project AIRI 那樣具有長期記憶與情感狀態的 Agent 後端。

## 技術選型指南：你該選哪一套？

如果你的專案目標很明確，挑選其實很簡單：

- **選 Open-LLM-VTuber 的情境**：你手上已經有 Live2D 模型，想做個桌面小助手、虛擬主播展示，或想讓 AI 透過鏡頭看你寫 code。它的 quick start 走起來最快，前端也最成熟。
- **選 Project AIRI 的情境**：你想做一個有深度情感羈絆的角色，需要角色有長期記憶、會主動關心你、甚至之後想擴展到 VRM 3D 空間。

這兩套專案沒有絕對優劣，想清楚你的應用場景要先解「皮囊」還是先解「靈魂」，路就不會走偏。
