17 | Z-Image Turbo<2>2> 秒一张图,本地生图的速度天花板
发布时间<2025-11-27>2025-11-27>(Turbo);2026-04 生态成型 文体<极客评测>极客评测>/跑分报告(数据密集、技术狂热、直给) 一句话<4090>4090> 上 2-5 秒出一张 1024² 图——6B 参数、8 步推理,这就是 2026 年本地生图的速度天花板。
先看跑分
| 指标 | 数值 |
|---|---|
| 参数 | 6B |
| 推理步数 | 8-9 步(NFE≈8) |
| 出图时间(4090) | 2-5 秒 |
| 出图时间(H800) | 亚秒级 |
| 最低显存 | 6GB(GGUF) |
| 许可 | Apache 2.0(可商用) |
它为什么这么快<四个数字拆穿>四个数字拆穿>
- 蒸馏压缩步数<约>约> 8 次模型评估出图,对比 SDXL/FLUX dev 的 20-30 步,单图算力降约 3 倍。
- 紧凑骨干<6b>6b> 参数,约为 FLUX.1(12B)的一半。
- CFG 关闭
以 CFG≈1 运行,每步单次前向——普通模型 CFG>1 要双倍前向。 - S3-DiT 架构
Single-Stream Diffusion Transformer——文本、视觉语义、图像 VAE token 拼成单一序列,比 FLUX 的并行双流更简更快。
综合效果<消费卡秒级出图>消费卡秒级出图>,质量对标 20B 级闭源模型(尤其写实人像)。
家族三兄弟
| 变体 | 步数 | 用途 |
|---|---|---|
| Turbo | 8-9 | 主力日常,最快,无负向提示词 |
| Base | 20-30 | LoRA 训练/高质量,支持负向提示词 |
| Edit | 20-30 | 自然语言指令编辑 |
显存与量化
| 精度 | 显存 | 显卡 |
|---|---|---|
| BF16 | 14-16GB | 4080/4090/3090 |
| FP8 | ~8GB | 中端 |
| GGUF Q3/Q4 | 6GB | 入门 |
部署三件套(别踩坑)
- 扩散模型 + 文本编码器(
qwen_3_4b.safetensors放text_encoders/)+ VAE——缺一不可。 - CFG 必须 1.5-2.0<蒸馏模型对参数挑剔>蒸馏模型对参数挑剔>,SD 的 6-9 会让它过饱和。
- LoRA 架构绑定<只能用>只能用> Z-Image 架构 LoRA,SDXL LoRA 不兼容。
对比实测<它>它> vs FLUX
- 短文字渲染<打平>打平>。
- 长文字渲染
胜(FLUX 会出错)。 - 代价
文字偏”过整齐”,略欠自然融入。
实测场景
- 线稿上色
+ ControlNet Canny,1024² 约 6.3 秒(RTX 4060),对比 SDXL+ControlNet 11.7 秒——快近一半。 - 批量草稿<秒级出>秒级出> 100+ 候选,交互式体验。
FAQ
Q1<为什么这么快>为什么这么快>? 蒸馏(8 步)+ 6B 骨干 + CFG 关闭 + S3-DiT。
Q2
实战配方
A<实时交互生图>实时交互生图> — 4090 部署 Turbo → 边聊边改秒出图 → 灵感风暴/客户演示。
B<批量草稿流水线>批量草稿流水线> — Turbo 秒级 100+ 候选 → 筛选 → Base 精修。
C<线稿上色>线稿上色> — ControlNet Canny(0.85)→ Turbo 16 步 → 分镜/漫画批量。
D
提示词与参数
| 目标 | 配置 |
|---|---|
| Turbo 正常 | 8-9 步 + CFG 1.5-2.0 |
| 负向提示词 | 切 Base(20-30 步) |
| 长文字 | 用 Z-Image(优于 FLUX) |
| LoRA | 仅 Z-Image 架构;≤3 个 |
| ControlNet | Strength 0.85;16 步 |
风险清单
- 参数敏感
/步数挑剔,新手易踩坑。 - 生态早期
/ControlNet 少。 - 无负向提示词
无法用负面约束。 - 长文字”过整齐”<氛围场景需权衡>氛围场景需权衡>。
- 架构封闭
无法跨架构复用。
写在最后
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





