004

SysMocap:用攝影機把 3D 虛擬人物動起來

SysMocap:用攝影機把 3D 虛擬人物動起來 封面圖

SysMocap 是一個即時動作捕捉工具,把攝影機輸入、骨架映射、3D 角色輸出串成一條線,適合 VTuber、直播、AR/VR 和互動展示。

Seer

2026-05-28

拿一般 Webcam 甚至手機鏡頭做 Mocap (動作捕捉),直接把 3D 角色驅動起來,是這幾年 VTuber 和互動展示的標配。實務上常常卡在設定複雜、或是 Bone Mapping 不好調,搞得像在做學術研究一樣痛苦。SysMocap 是一個把這整條 Pipeline 幫你打包好的開源工具,開箱就能直接用。

整條流程說穿了就是 Input → Mapping → Output。它把攝影機輸入、骨架映射、3D 角色輸出串在一塊,拿來做直播、AR/VR 互動,或任何需要即時角色驅動的 Demo 都很省事。

它能抓到什麼程度?

Full-body (全身)、Half-body (半身) 以及帶手指的模式都支援,臉部表情也有基本的 Tracking。

輸出端除了可以接 OBS 做直播疊圖,也能透過 WebXR API 做動作資料轉發 (Mocap Forwarding),不過這條路徑因為安全限制只能走 HTTPS。它不是只會播動作的 Viewer,而是把動作訊號源與角色渲染兩端都打通了。

平台與介面

Windows 和 macOS(Intel / Apple Silicon)有現成的安裝檔可以直接點,至於 Linux 使用者就得自己抓 Source Code 來編譯:

git clone https://github.com/xianfei/SysMocap.git
cd SysMocap
npm install && npm run build

這段指令能讓你在 Linux 環境下把 SysMocap 的 Source Code 抓下來並編譯成 Executable,適合想客製化功能或在 Ubuntu 等系統上部署的開發者。

主要介面是 GUI 桌面程式,採用 Material Design 3 風格,支援 Dark Mode,3D 模型直接拖進視窗就能匯入,對美術或非程式背景的人很友善。

模型支援與骨架映射

格式上支援 VRM 0.x、VRM 1.0 和 Mixamo FBX,這幾類的自動骨架辨識做得蠻直接的。其他像 glTF、glb、一般 FBX 也能匯入,但角色能不能動,完全看你的骨架命名和節點對不對得上。

匯入後會進到 Model Viewer 介面,裡面可以看骨架,還有 Dressing Controller 可以調整外觀。

README 列了一組必要骨架節點:HipsNeckChestSpine,加上四肢的 UpperArm / LowerArmUpperLeg / LowerLeg。其中 Hips 是主節點,需要 Position 和 Rotation 資訊,其他節點主要吃 Rotation 角度。

實務上,撈過來的 3D 模型骨架通常千奇百怪,特別是從不同平台或 Sketchfab 下載下來的資產,預設 Mapping 很容易對不準。這時候就得手動去調 Bone Mapping 重新對齊。如果一開始就打算用這套系統,強烈建議在建模或 Rigging 階段,就把骨架命名先對齊它的標準,可以省下大量在介面上拉連線的時間。

實作上的踩坑點

動作捕捉的核心不只是演算法有多炫,難在整條 Pipeline 上的每個節點都得能穩穩地串起來。

Webcam 撈到的影像訊號要防抖、人體骨架跟臉部 Tracking 資料要即時 Merge、骨架關節要精準映射到 VRM 上,最後還要能極低延遲地送給 OBS。只要其中一個 Endpoint 或 Hook 稍微慢個幾毫秒,畫面上的 3D 角色就會出現反關節的詭異擺動,這在直播現場就是直接翻車的事故。

適合哪些場景?

虛擬直播和 VTuber 工具鏈是最直接的,再來是低成本的動作捕捉工作站、展場的互動角色,或是遊戲角色的動作預覽。

如果你本來就在做 3D、直播或網頁互動,它就是一個很實用的中間層:不用自己去寫複雜的姿態估計演算法,又比單純的播放器有彈性得多。

連結

皮囊只是媒介,真正賦予靈魂的,是螢幕另一端未曾停下的心跳。

Visits

--

Waiting for Cloudflare metrics.