031

Z-Image-Turbo + D-OPSD:不破壞 8-step 推理的持續微調方法

Z-Image-Turbo + D-OPSD:不破壞 8-step 推理的持續微調方法 封面圖

Z-Image-Turbo 已經把推理壓到 8 NFEs,D-OPSD 則提供一條 on-policy self-distillation 路線,讓它後續還能繼續微調,卻不把 few-step 優勢弄壞。

Seer

2026-06-26

在消費級顯卡(例如 16GB VRAM)上跑 Diffusion 模型生圖,大家最在意的就是推理速度。Z-Image-Turbo 這類 Step-Distilled Diffusion Model,直接把推理步數壓到極致的 8 NFEs (Number of Function Evaluations),完全不需要高昂的採樣步數就能生出高品質的圖。但這時工程師會遇到另一個尷尬的問題:這種已經被蒸餾壓縮過、步數極少的模型,後續還能自己拿資料微調(Finetune)嗎?

這就是 D-OPSD (On-Policy Self-Distillation) 要解的痛點。它不是一個全新的生成模型,而是一種專門用來持續微調 Step-Distilled Diffusion Model 的訓練框架。它的核心目標是,讓模型在吃進新概念的同時,還能保住Few-step的快速推理優勢,並且維持訓練與推理時的 State 一致性。

先講定位

把這套組合拆開來看:

  • Z-Image-Turbo:已經蒸餾好、能極速出圖的底座模型。
  • D-OPSD:讓這個底座能夠持續微調、且不把 Few-step 推理能力調壞的訓練方法。

實務上,如果我們直接拿一般的 SFT (Supervised Fine-Tuning) 去微調蒸餾模型,會很容易破壞它原本的 Train-Inference Consistency,導致出圖品質雪崩式下滑。D-OPSD 的優勢在於:它是 On-policy 的設計、不需要額外的 Reward Model,且能利用 Self-distillation 直接把新的 Image-Text Pairs 灌進去。

D-OPSD 怎麼做?

它的設計思路非常乾淨,主要分為幾個步驟:

1. 角色拆分

在訓練時,將同一個模型拆成兩個角色:

  • Student:只餵給它文字 Prompt。
  • Teacher:餵給它文字 Prompt 加上 Target Image 的 Multimodal Context。

這裡的 Teacher Model 僅在訓練期存在,用來提供更強的引導訊號。

2. On-policy Trajectory 模擬

讓 Student Model 只看文字 Prompt,照原本極少步數(例如 8 步)的 Pipeline 進行 Rollout,產生生成軌跡 (Trajectory)。

3. State 對齊

Teacher Model 在相同的軌跡狀態下,去對齊兩者的 Velocity,而不是讓 Teacher 重新生一張圖丟給 Student。這樣可以保證在少步推理的限制下,Student 的參數能學到 Teacher 的特徵。

4. 拋棄 Teacher

訓練結束後,直接把 Teacher Branch 砍掉。Inference 時,我們拿到的依然是那個只需要 8 步就能出圖的純淨 Student Model。

實際微調示範

在實務部署中,我們可以透過 D-OPSD 提供的指令來為 Z-Image-Turbo 掛載 LoRA:

python train_dopsd.py \
  --base_model "Tongyi-MAI/Z-Image-Turbo" \
  --dataset_path "./custom_dataset" \
  --use_lora \
  --steps 8

這行腳本會載入 Z-Image-Turbo 作為底模,並利用 D-OPSD 框架對你自訂的 Dataset 進行 8 步推理的 LoRA 持續微調,保證在引入新概念的同時不損害原本的少步推理能力。

這意味著我們不需要更動任何 Inference Runtime 的程式碼,原本 8-step 的 Pipeline 怎麼跑,微調後的模型就怎麼跑,完全做到 Zero Inference-Time Cost。

適合什麼場景?

  • 小樣本風格客製化:你只有數十張特定的品牌視覺或二次元貼圖,想要讓快速模型學會這個特徵。
  • 領域自適應 (Domain Adaptation):將原本大眾化的生成模型轉移到特定的工業或醫療素材 domain。
  • 持續學習:當需要不斷向模型餵入新資料,又不想每次都重頭訓練整個大底座。

限制與邊界

雖然 D-OPSD 能保住少步推理,但它依然不是萬靈丹。你還是需要手動準備高品質的 Image-Text Dataset;此外,如果 Teacher-side 的 Context 給得不夠好,微調出來的品質也會打折扣。目前這套架構對於 Multi-expert 的蒸餾微調仍在早期探索階段。

官方連結

參考

  1. Z-Image GitHub README
  2. D-OPSD 專案說明
  3. D-OPSD GitHub README
  4. Z-Image-Turbo Hugging Face 頁面
  5. Z-Image Hugging Face 頁面

壓縮是為了前行,而持續微調,則是讓輕裝上陣的行者不失去前進的方向。

Visits

--

Waiting for Cloudflare metrics.