---
slug: z-image-turbo-d-opsd-continuous-tuning
title: Z-Image-Turbo + D-OPSD：不破壞 8-step 推理的持續微調方法
status: published
excerpt: Z-Image-Turbo 已經把推理壓到 8 NFEs，D-OPSD 則提供一條 on-policy self-distillation 路線，讓它後續還能繼續微調，卻不把 few-step 優勢弄壞。
category: AI
tags: [diffusion, image-generation, finetune, z-image, dopsd]
author: Seer
author_role: Author
read_time: 8 min
cover: "/static/z-image-turbo-d-opsd-continuous-tuning-cover.png"
closing_note: "壓縮是為了前行，而持續微調，則是讓輕裝上陣的行者不失去前進的方向。"
published_at: "2026-06-26T10:28:40Z"
updated_at: "2026-07-01T15:54:39Z"
---

在消費級顯卡（例如 16GB VRAM）上跑 Diffusion 模型生圖，大家最在意的就是推理速度。Z-Image-Turbo 這類 Step-Distilled Diffusion Model，直接把推理步數壓到極致的 8 NFEs (Number of Function Evaluations)，完全不需要高昂的採樣步數就能生出高品質的圖。但這時工程師會遇到另一個尷尬的問題：**這種已經被蒸餾壓縮過、步數極少的模型，後續還能自己拿資料微調（Finetune）嗎？**

這就是 **D-OPSD** (On-Policy Self-Distillation) 要解的痛點。它不是一個全新的生成模型，而是一種專門用來持續微調 Step-Distilled Diffusion Model 的訓練框架。它的核心目標是，讓模型在吃進新概念的同時，還能保住Few-step的快速推理優勢，並且維持訓練與推理時的 State 一致性。

## 先講定位

把這套組合拆開來看：

- **Z-Image-Turbo**：已經蒸餾好、能極速出圖的底座模型。
- **D-OPSD**：讓這個底座能夠持續微調、且不把 Few-step 推理能力調壞的訓練方法。

實務上，如果我們直接拿一般的 SFT (Supervised Fine-Tuning) 去微調蒸餾模型，會很容易破壞它原本的 Train-Inference Consistency，導致出圖品質雪崩式下滑。D-OPSD 的優勢在於：它是 On-policy 的設計、不需要額外的 Reward Model，且能利用 Self-distillation 直接把新的 Image-Text Pairs 灌進去。

## D-OPSD 怎麼做？

它的設計思路非常乾淨，主要分為幾個步驟：

### 1. 角色拆分
在訓練時，將同一個模型拆成兩個角色：
- **Student**：只餵給它文字 Prompt。
- **Teacher**：餵給它文字 Prompt 加上 Target Image 的 Multimodal Context。

這裡的 Teacher Model 僅在訓練期存在，用來提供更強的引導訊號。

### 2. On-policy Trajectory 模擬
讓 Student Model 只看文字 Prompt，照原本極少步數（例如 8 步）的 Pipeline 進行 Rollout，產生生成軌跡 (Trajectory)。

### 3. State 對齊
Teacher Model 在相同的軌跡狀態下，去對齊兩者的 Velocity，而不是讓 Teacher 重新生一張圖丟給 Student。這樣可以保證在少步推理的限制下，Student 的參數能學到 Teacher 的特徵。

### 4. 拋棄 Teacher
訓練結束後，直接把 Teacher Branch 砍掉。Inference 時，我們拿到的依然是那個只需要 8 步就能出圖的純淨 Student Model。

## 實際微調示範

在實務部署中，我們可以透過 D-OPSD 提供的指令來為 Z-Image-Turbo 掛載 LoRA：

```bash
python train_dopsd.py \
  --base_model "Tongyi-MAI/Z-Image-Turbo" \
  --dataset_path "./custom_dataset" \
  --use_lora \
  --steps 8
```
這行腳本會載入 Z-Image-Turbo 作為底模，並利用 D-OPSD 框架對你自訂的 Dataset 進行 8 步推理的 LoRA 持續微調，保證在引入新概念的同時不損害原本的少步推理能力。

這意味著我們不需要更動任何 Inference Runtime 的程式碼，原本 8-step 的 Pipeline 怎麼跑，微調後的模型就怎麼跑，完全做到 Zero Inference-Time Cost。

## 適合什麼場景？

- **小樣本風格客製化**：你只有數十張特定的品牌視覺或二次元貼圖，想要讓快速模型學會這個特徵。
- **領域自適應 (Domain Adaptation)**：將原本大眾化的生成模型轉移到特定的工業或醫療素材 domain。
- **持續學習**：當需要不斷向模型餵入新資料，又不想每次都重頭訓練整個大底座。

## 限制與邊界

雖然 D-OPSD 能保住少步推理，但它依然不是萬靈丹。你還是需要手動準備高品質的 Image-Text Dataset；此外，如果 Teacher-side 的 Context 給得不夠好，微調出來的品質也會打折扣。目前這套架構對於 Multi-expert 的蒸餾微調仍在早期探索階段。

## 官方連結

- [Z-Image-Turbo 模型頁 (Hugging Face)](https://huggingface.co/Tongyi-MAI/Z-Image-Turbo)
- [Z-Image 底座模型頁 (Hugging Face)](https://huggingface.co/Tongyi-MAI/Z-Image)
- [D-OPSD 專案官網](https://vvvvvjdy.github.io/d-opsd/)
- [D-OPSD GitHub 程式庫](https://github.com/vvvvvjdy/D-OPSD)

## 參考

1. [Z-Image GitHub README](https://github.com/Tongyi-MAI/Z-Image)
2. [D-OPSD 專案說明](https://vvvvvjdy.github.io/d-opsd/)
3. [D-OPSD GitHub README](https://github.com/vvvvvjdy/D-OPSD)
4. [Z-Image-Turbo Hugging Face 頁面](https://huggingface.co/Tongyi-MAI/Z-Image-Turbo)
5. [Z-Image Hugging Face 頁面](https://huggingface.co/Tongyi-MAI/Z-Image)
