035

Open-LLM-VTuber:把 LLM、語音和 Live2D 接成能跑的 VTuber 系統

Open-LLM-VTuber:把 LLM、語音和 Live2D 接成能跑的 VTuber 系統 封面圖

Open-LLM-VTuber 不是單純的聊天 bot,而是把語音互動、視覺感知、Live2D、桌寵模式和離線跑法接成一套可用的虛擬角色系統;這篇順手拿 Project AIRI 來比,直接看兩者差在哪。

Seer

2026-07-01

想要在電腦桌面上跑一個可以用語音直接對話、甚至能透過 Webcam 看到你畫面的 Live2D 虛擬角色?在過去,你得自己寫腳本去接 ASR 語音辨識、拉 OpenAI API、串 TTS 語音合成,最後還要折騰 WebGL 把 Live2D 渲染出來。Open-LLM-VTuber 這個專案,就是把這整條又臭又長的 pipeline 直接打包成一套開箱即用的系統。

它不是只做一個簡單的網頁聊天框,防禦性地說,也不是只做個 VTuber 的外皮,而是把以下這幾個常被拆開的模組接在一起:

  • LLM:負責語意理解、對話生成與邏輯推理。
  • ASR / TTS:負責把語音轉文字(聽),以及文字轉語音(說)。
  • Live2D:負責角色外觀、表情綁定與嘴形同步(lipsync)。
  • 視覺感知:能讀取相機鏡頭、螢幕截圖或錄影畫面,讓 Agent「看見」你。
  • 桌寵模式:支援透明背景、視窗置頂與拖曳,真正融入你的工作桌面。
  • Session 延續:持久化保存聊天紀錄,讓對話歷史上下文不中斷。

如果你想開發「Agent + Live2D」的桌面上層應用,這套架構是目前開源社群裡非常成熟的樣板。

官方資源:GitHub 倉庫 | 官方文件說明 | Live2D 配置指南

從語音到視覺:這套虛擬角色系統在解什麼問題?

官方 README 把定位寫得很明確:它是一個支援語音互動、具備 Live2D avatar 與視覺感知能力的 AI 伴侶(AI Companion)。

它的互動流程基本如下:

  1. 使用者直接說話,系統透過 ASR 即時辨識。
  2. Agent 可以透過螢幕分享或 Webcam 畫面,理解你當前在幹嘛。
  3. 透過 LLM 生成回覆後,經由 TTS 轉換成語音,同時驅動 Live2D 角色的嘴形與隨機動作。
  4. 可以用小視窗或透明桌寵形式置頂在桌面一角,背景乾淨。

這套系統最實用的地方在於,它已經把這幾個模組的串接細節都封裝好了,你不用自己去寫複雜的狀態機來處理「聽 -> 想 -> 說」的非同步同步問題。

後端彈性:本地模型與 API 隨你混搭

Open-LLM-VTuber 最迷人的一點是,它的後端架構非常有彈性,完全沒有綁定單一服務商。

不論是 LLM、ASR 還是 TTS,都提供了極為豐富的支援選項:

模組類別支援的後端與服務
LLMOllama、OpenAI(及所有支援 OpenAI-compatible API 的後端,如 OneAPI、LM Studio)、Gemini、Claude、DeepSeek、vLLM 等。
ASR (語音辨識)sherpa-onnx、FunASR、Faster-Whisper、Whisper.cpp、Groq Whisper API、Azure ASR。
TTS (語音合成)sherpa-onnx、MeloTTS、GPT-SoVITS、CosyVoice、Edge TTS、Fish Audio、Azure TTS。

這代表你可以根據自身的硬體狀況,靈活調配部署策略。你可以把所有運算都壓在本地端(如 Ollama + Faster-Whisper + GPT-SoVITS),也可以圖個方便省事,全部走雲端 API 混搭。

關於訂閱帳號直連

官方文件目前僅支援輸入 API Key 或設定本地 / 託管後端。它並不支持直接登入你的 ChatGPT Plus 或 Claude Pro 等消費者訂閱帳號來撈資料。

實務部署:官方推薦的快速入門路徑

如果你想省去設定本地 GPU 的繁瑣步驟,官方其實給了一條「輕量化部署」的捷徑:

  1. 基礎依賴安裝:本機需先安裝 Git 與 FFmpeg,並建議使用 Chrome 瀏覽器開啟前端。
  2. 免顯卡混搭方案:LLM 走 OpenAI-compatible API(例如 DeepSeek 或 Groq),ASR 走 Groq Whisper API,TTS 走免費且免安裝的 Edge TTS。
  3. 安全提示:如果不是在 localhost 跑,而是部署在遠端伺服器,你必須幫網頁補上 HTTPS 憑證,否則瀏覽器出於安全機制會直接擋掉麥克風權限。

這套接法只需要配置幾個 API Key 就能跑起來,完全不需要吃你本機的 GPU 算力。

軟硬體門檻:到底需不需要一張神卡?

如果你堅持要在「全地端」離線跑完這整套流程,硬體資源的消耗就會變得相當可觀。

  • 最低硬體:如果 LLM、ASR 和 TTS 都走雲端 API,那即便是一台樹莓派也能順暢運行前端。
  • 全本地運行:建議使用 Apple Silicon 的 Mac(M2/M3 等)或擁有 NVIDIA 顯卡的 PC。
  • 算力分配:全地端運行時,CPU 通常要拿來處理 ASR 語音辨識,GPU 負責跑 Ollama 的 LLM 推理,而 TTS 合成如果沒有顯卡加速,對話的延遲感(Latency)會非常明顯。

如果只有普通 CPU,跑全地端很容易遇到「講完話要等 5 秒角色才有反應」的尷尬狀況。體感上,混搭雲端 API 是性價比最高的做法。

客製化外觀:如何替換你自己的 Live2D 模型?

換上自己喜歡的角色皮,是玩這套系統最大的樂趣。

替換模型的具體步驟如下:

  1. 準備好你的 Live2D 模型資料夾。
  2. 將整個資料夾放進專案底下的 live2d-models 目錄中。
  3. 編輯 model_dict.json,在裡面登錄你的模型名稱與設定檔路徑。
  4. 在全域設定檔 conf.yamlcharacters/ 下的角色 YAML 檔中,將模型欄位指定為你剛剛註冊的名稱。

版本限制

專案底層渲染使用的是 pixi-live2d-display-lipsyncpatch,目前僅支援 Cubism 3 至 Cubism 5 的模型格式,舊版的 Cubism 2(例如早期常見的 .model.json)是無法直接載入的。

>

另外,實務上建議先用 Vtuber Studio 或 Live2D Cubism Viewer 確認角色的表情清單(Expressions)與動作組(Motions),並在 model_dict.json 裡做好對應,這樣 Agent 才能在講話時做出對應的表情。

聲線克隆與 TTS 設定

除了外觀,聲音也是角色的靈魂。這套專案在聲音上主要提供三種層次的改動:

  1. 更換 TTS 引擎:直接在 conf.yaml 裡切換 Edge TTS 或 Fish Audio 等不同服務。
  2. 微調音色參數:在對應的 TTS 模組設定中,修改 speaker ID 或角色聲音設定。
  3. 語音複製 (Voice Cloning):如果你有架設 GPT-SoVITS 或 CosyVoice 後端,你可以拿該角色的幾句音檔做訓練,讓 Agent 用一模一樣的配音聲線跟你對話。

這對於想百分之百還原某個動漫角色或特定 V 的人來說,是不可或缺的功能。

擂台對決:Open-LLM-VTuber vs. Project AIRI

在開源社群中,Project AIRI 也常被拿來做比較,但兩者的設計哲學大不相同。

比較面向Open-LLM-VTuberProject AIRI
核心定位開源 VTuber 工作台與桌面陪伴工具角色關係伴侶系統與數位分身
視覺支援專注於 Live2D 渲染與桌寵透明置頂同時支援 Live2D 與 VRM 3D 角色
互動層面強調「語音 + 視覺感知(Webcam/截圖)」強調「語音 + 記憶體管理 + 遊戲連動」
記憶機制偏向短期對話紀錄的 Session 延續擁有獨立的長期記憶庫與知識庫系統
適用場景虛擬主播、桌面助手、快速 PoC 驗證虛擬女友、遊戲陪玩、數位分身、角色客服

簡單來說,Open-LLM-VTuber 的定位更偏向工具鏈與互動引擎,它的目的是幫你把 Live2D 和語音前端接好;而 Project AIRI 則更偏向人格與關係系統,花了很多心思在解長期記憶和陪伴感。

殊途同歸:虛擬角色系統的未來交會點

雖然這兩套專案切入點不同,但它們都在解同一個技術難題:如何讓冷冰冰的 LLM 具備「擬人性」。

Open-LLM-VTuber 選擇先攻克「皮囊」與「感官」,把 Live2D 嘴形同步、桌面透明化以及 Webcam 看畫面這段體驗打磨得非常流暢。而 Project AIRI 則選擇先解「靈魂」,讓角色記得你三天前說過的話,甚至能跟你一起玩遊戲。

理想的終極形態,其實是把 Open-LLM-VTuber 當成前端互動層,背後去接 Project AIRI 那樣具有長期記憶與情感狀態的 Agent 後端。

技術選型指南:你該選哪一套?

如果你的專案目標很明確,挑選其實很簡單:

  • 選 Open-LLM-VTuber 的情境:你手上已經有 Live2D 模型,想做個桌面小助手、虛擬主播展示,或想讓 AI 透過鏡頭看你寫 code。它的 quick start 走起來最快,前端也最成熟。
  • 選 Project AIRI 的情境:你想做一個有深度情感羈絆的角色,需要角色有長期記憶、會主動關心你、甚至之後想擴展到 VRM 3D 空間。

這兩套專案沒有絕對優劣,想清楚你的應用場景要先解「皮囊」還是先解「靈魂」,路就不會走偏。

代碼給予了角色聲音與形體,但真正的靈魂,始於螢幕另一端長久的凝視。

Visits

--

Waiting for Cloudflare metrics.