中文文字海报
准确呈现中英标题、招牌与活动版式。
Z-Image 是一款轻量级图片生成工具,采用高效的 8-Step 推理架构,可在消费级 GPU 上快速生成高质量 AI 图片,同时显著降低计算成本。
先用简单模式快速出图,需要时再展开精确控制。
针对常见创作目标设计的实用起点。
准确呈现中英标题、招牌与活动版式。
快速生成干净电商图与高级棚拍广告。
精确控制镜头、灯光与构图的策划型人像。
适配平台比例、文字层级清晰的竖版创意。
每张保存图片都会带着提示词、尺寸、Seed、积分成本和父级参考进入下一步。
建立第一版方向
把结果用作参考
控制画面变化程度
重新适配构图
导出不再收费
简单/高级生成模式与可视化风格预设。
1 积分
对私密参考图进行增强、微调、换风格或重绘。
1 积分
自由添加真实感、镜头、灯光、构图和准确文字。
免费
从已有结果继续增强,并保留图片关系。
1 积分
为产品和素材输出透明 PNG。
1 积分
用参考图控制姿势、深度或边缘。
3 积分









填补了轻量级模型与巨型模型之间的空白,Z-Image-Turbo 在速度、质量和易用性之间找到了完美的平衡点。
内置 Qwen 3.4B 大语言模型作为大脑。不再有乱码的汉字,无论是书法、招牌还是复杂的中文排版,都能精准渲染。
激进的架构创新。将文本与图像 Token 统一处理,类似 GPT-4 的处理方式,每一分参数都在同时服务于图像生成和语义理解。
真正的开源自由。不同于 Flux.1 的商业限制,您可以自由商用、修改、集成,是初创企业和游戏工作室的理想基座。
传统模型采用“双流”架构,图像和文本各跑各的。Z-Image-Turbo 采用 可扩展单流扩散 Transformer (S3-DiT)。
在性能、成本与生态之间,我们提供了最优解。
| 指标 | Z-Image-Turbo | Flux.1 (Dev) | SDXL Base |
|---|---|---|---|
| 参数量 | 6B (黄金平衡) | 12B (庞大) | 2.6B |
| 显存需求 | 12GB (原生 BF16) | 24GB+ (或量化) | 8GB |
| 推理步数 | 8 步 (Distilled) | 20-50 步 | 20-50 步 |
| 文本编码器 | Qwen 3.4B (中英双语) | T5 + CLIP | OpenCLIP |
| 中文排版 | ⭐️⭐️⭐️⭐️⭐️ 完美 | ⭐️⭐️ 较差 | ⭐️ 乱码 |
| 开源协议 | Apache 2.0 (可商用) | Non-Commercial | OpenRAIL++ |
| 单图成本 | API $0.005 起 | 高昂 | 低 |
得益于 6B 参数规模和 8 步蒸馏技术,Z-Image-Turbo 可以在 RTX 3090/4090 等显卡上实现 2-3 秒的高清出图。对于企业用户,H800 更是能实现亚秒级响应。
# 使用 Diffusers 快速加载
from diffusers import DiffusionPipeline
import torch
# 加载 8-Step Turbo 模型
pipe = DiffusionPipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16
).to("cuda")
# 生成图像
image = pipe(
prompt="赛博朋克侦探,雨夜,霓虹灯,中文招牌写着"通义实验室"",
num_inference_steps=8,
guidance_scale=1.0 # 蒸馏模型无需高 CFG
).images[0]
关于模型部署、使用与授权的疑问。
对于原生精度(BF16)运行,推荐使用 16GB VRAM 或更高的显卡。如果使用 GGUF/NF4 量化版本,8GB VRAM 的显卡也可以流畅运行,且画质损失极小。
完全可以。 Z-Image-Turbo 采用宽松的 Apache 2.0 许可证。这意味着您可以免费将其用于商业用途,无需支付授权费。
像与人聊天一样自然即可。得益于 Qwen 3.4B 强大的语言理解能力,您可以使用复杂的中文长句。如果需要生成特定文字,请使用引号包裹。
是的。ComfyUI 已实现零日支持(Day-0 Support)。Automatic1111 WebUI 的支持也在开发分支中,预计近期合并。
Z-Image-Turbo 主要是为了解决 效率 和 易用性 问题。推理速度快了 3 倍,显存占用少了一半,并且对中文的支持远超 Flux。