Z-Image

Z-Image は、効率的な 8-Step 推論アーキテクチャを採用した軽量な画像生成ツールです。一般向け GPU でも高速かつ高品質な AI 画像を生成し、計算コストを大幅に削減します。

1クレジット = 画像1枚 新規登録で10クレジット デフォルトで非公開

生成・リミックス・調整をひとつの場所で

まずはシンプルに。必要なときだけ精密な設定を開けます。

0/1500

無料プロンプトは 1500 文字までです。クレジットパックを購入すると 4000 文字まで利用できます。

ログインして解除

スタイルプリセット

見た目を先に確認。プリセットは無料で、生成時のみクレジットを使います。

画像サイズ

1クレジット = 標準画像1枚 ダウンロードは常に無料
ログインして 10 無料クレジットを受け取りましょう。

今日は何を作りますか?

よくある制作目的に合わせた、すぐ使えるスタート地点です。

中国語テキストポスター

日中・英中の見出し、看板、キャンペーンレイアウトを正確に表現。

商品写真

クリーンなEC画像から上質なスタジオ広告まで生成。

エディトリアルポートレート

カメラ、光、構図を細かく制御した演出ポートレート。

SNSキャンペーン

媒体比率と明快な文字階層に対応した縦型クリエイティブ。

完成画像は終点ではなく、次の一歩

保存画像のプロンプト、サイズ、Seed、クレジット、参照元を引き継いで次の編集へ進めます。

01

生成

最初の方向性を作る

02

リミックス

結果を参照画像にする

03

調整

変化量を制御する

04

リフレーム

構図を新しい比率へ

05

ダウンロード

無料で書き出す

今使える機能と、次に追加される機能

クレジット料金を見る

テキストから画像

利用可能

シンプル/詳細モードと視覚的なスタイルプリセット。

1クレジット

画像リミックス

利用可能

非公開の参照画像を強化、調整、スタイル変更、再構成。

1クレジット

プロンプトビルダー

利用可能

写実性、カメラ、照明、構図、表示テキストを追加。

無料

HD高画質化

利用可能

画像の履歴を保ちながら結果をさらに強化。

1クレジット

背景削除

近日対応

商品や素材向けに透過PNGを出力。

1クレジット

インペイント

利用可能

マスクを塗り、選択範囲だけを置き換え。

4クレジット

制作を始める

ControlNet

近日対応

参照画像からポーズ、深度、輪郭を制御。

3クレジット

ただ速いだけではない、完全なる進化

軽量モデルと巨大モデルの間隙を埋め、Z-Image-Turboは速度、品質、使いやすさの完璧なバランスを見出しました。

ネイティブバイリンガル対応

Qwen 3.4B LLMを脳として搭載。漢字の文字化けはもうありません。書道、看板、複雑な中国語のタイポグラフィも正確にレンダリングされます。

S3-DiTシングルストリーム

急進的なアーキテクチャ革新。テキストと画像のトークンを一貫して処理し、GPT-4と同様に、すべてのパラメータを生成と理解の両方に活用します。

Apache 2.0ライセンス

真のオープンソースの自由。Flux.1の商用制限とは異なり、商用利用、改変、統合が自由です。スタートアップやゲームスタジオに最適です。

6B パラメータ 黄金のバランス
8 Steps 推論ステップ Decoupled-DMD
Qwen 3.4B テキストエンコーダー ネイティブバイリンガル
12GB VRAM要件 量子化不要

S3-DiT:モータルの壁を破る

従来のモデルは「デュアルストリーム」アーキテクチャを採用していました。Z-Image-Turboはスケーラブルなシングルストリーム拡散Transformer (S3-DiT)を採用しています。

  • 統合入力ストリーム:テキストトークンと画像Latentを直接連結。
  • 全パラメータ相互作用:すべてのTransformer層で深いテキスト-画像注意計算を実行。
  • Decoupled-DMD:推論をわずか8ステップに圧縮するコアアルゴリズム。
  • CFG拡張:高いCFG値なしで鮮明な画像を得るための独立最適化されたガイダンス信号。
Architecture_v1.0
Text Token
+
Img Latent
Unified Transformer Block Self-Attention (All-to-All)
High-Fidelity Output (8 Steps)

なぜZ-Image-Turboを選ぶのか?

パフォーマンス、コスト、エコシステムのバランスが取れた最適なソリューションを提供します。

指標Z-Image-TurboFlux.1 (Dev)SDXL Base
パラメータ6B (バランス)12B (巨大)2.6B
VRAM要件12GB (ネイティブBF16)24GB+ (または量子化)8GB
ステップ数8ステップ (蒸留)20-50ステップ20-50ステップ
テキストエンコーダーQwen 3.4B (中英)T5 + CLIPOpenCLIP
タイポグラフィ⭐️⭐️⭐️⭐️⭐️ 完璧⭐️⭐️ 劣る⭐️ 文字化け
ライセンスApache 2.0 (商用可)非商用OpenRAIL++
1枚あたりコストAPI $0.005〜高価

コンシューマーハードウェアの恩恵

6Bパラメータ規模と8ステップ蒸留技術により、Z-Image-TurboはRTX 3090/4090などのグラフィックカードで2〜3秒の生成を実現します。企業向けH800ではサブ秒のレスポンスが可能です。

Nvidia H800 (Enterprise) < 1 s
RTX 4090 (Consumer High-End) ~ 2.5 s
Flux.1 Dev (RTX 4090) ~ 10 s+

クイックスタート

# Diffusersで高速ロード

from diffusers import DiffusionPipeline

import torch


# 8ステップTurboモデルをロード

pipe = DiffusionPipeline.from_pretrained(

  "Tongyi-MAI/Z-Image-Turbo",

  torch_dtype=torch.bfloat16

).to("cuda")


# 画像生成

image = pipe(

  prompt="サイバーパンクな探偵、雨の夜、ネオンライト、「通義実験室」と書かれた看板",

  num_inference_steps=8,

  guidance_scale=1.0 # 蒸留モデルは高いCFG不要

).images[0]

よくある質問

モデルのデプロイ、使用、ライセンスに関する質問。

GPU要件は?

ネイティブ精度(BF16)での実行には、16GB VRAM(RTX 4080/3090)以上を推奨します。GGUF/NF4量子化版を使用すれば、8GB VRAMのカード(RTX 3060)でもスムーズに動作し、画質劣化も最小限です。

商用利用は可能ですか?

はい、可能です。 Z-Image-Turboは寛容なApache 2.0ライセンスを採用しています。ライセンス料なしで商用製品に自由に使用できます。

中国語プロンプトの書き方は?

自然にチャットするように書けます。Qwen 3.4Bの強力な言語理解能力のおかげで、複雑な長文も理解します。特定の文字を生成する場合は引用符で囲んでください。

ComfyUIやWebUIはサポートされていますか?

はい。ComfyUIはDay-0サポート済みです。Automatic1111 WebUIのサポートも開発ブランチにあり、間もなくマージされる予定です。

Flux.1と比較した利点は?

Z-Image-Turboは主に効率使いやすさの問題を解決します。Fluxは究極の画質に優れていますが、Z-Imageは3倍高速で、VRAM使用量は半分、そして中国語サポートはFluxを遥かに凌駕します。