AIの進化を、ニュースで終わらせない。

製品・サービス · ·

Qwen-Image-2.1-Turboで画像づくりの試行錯誤はどこまで速くなるか

8ステップの画像生成・編集で短くなる待ち時間と、残る確認作業。背景美術、キャラクター保持、日本語の文字を題材に、通常版との違いと必要な環境を読む。

夕景の背景を作り、建物の位置はそのままに空の色だけを変えたい。出てきた絵を見て、もう一度指示を直す。この繰り返しで毎回の待ち時間が短くなれば、途中で思いついた案も比べやすくなる。

Qwenが2026年10月9日に公開したQwen-Image-2.1-Turboは、画像の生成と編集を8ステップで行う高速版だ。期待できるのは、候補を見て修正するまでの待ち時間の短縮。ただし、制作全体が何倍速くなるかは、絵の確認や手直しまで含めて測る必要がある。

この記事は10月10日時点の公式資料に基づく解説だ。LATENTではモデルを実行しておらず、生成時間、VRAM使用量、画質を測定していない。図は仕組みと試し方を示すもので、モデルの出力や比較実験の結果ではない。

公開日とTurboの発表

この記事の要点

  1. Turboは7Bの視覚生成モデルで生成・編集を8ステップで行う。通常版の標準40ステップから回数は減るが、制作全体が5倍速くなるという測定結果ではない。
  2. 背景の色や照明、キャラクターの見た目、日本語の文字は、それぞれ確認する場所が違う。速く候補を出せても、形の保持や文字の正しさは一枚ずつ確かめたい。
  3. 7Bは構成全体の大きさではない。GPUメモリの最低条件は今回の資料から確定できず、qwen-researchは研究・評価目的に限定され、商用利用には別ライセンスが必要だ。

8ステップで画像を作り直す

短くなるのは画像を整える反復

指示 → 生成・編集 → 確認の流れ

1 指示と参照画像

「空だけ夕焼けにする」など、変える内容を入力する。

2 画像を8回の更新で整える

Turboは保存済みの8ステップ設定を使う。通常版の標準は40ステップ。

3 結果を見て次の指示へ

建物まで変わっていないかを見る。必要なら指示を直して再生成する。

図1 公式のステップ設定を制作の流れに当てはめたLATENTの概念図。各枠の大きさは所要時間を表さない。

ステップは、途中の画像表現を繰り返し更新して絵を整える回数を指す。8枚の画像を出すという意味ではない。Turboは専用の学習済みモデルとして配布され、文章から新しく描く場合も、参照画像を渡して編集する場合も同じパイプラインで扱う。

設定面にも違いがある。Turboの8ステップの更新順序はモデル側に保存され、対応するDiffusersが読み込む。num_inference_stepsだけを変えても、この設定は上書きされない。別のsigmasを明示すれば変更できるが、その使い方はこのモデルでは評価されていないと公式カードに記されている。

Turboのモデルカードとサンプリング設定

8÷40は0.2なので、標準設定同士では反復の回数が80%減る。ただし、入力を読む処理、画像への変換、保存、利用者の確認は残る。仮に1ステップの時間が等しくても、全体の時間は「固定の処理時間+ステップ数×1回の時間」で考える必要がある。

確認したTurboモデルカードと公式GitHubの説明には、同じGPU・解像度・入力で通常版と比べた秒数や最大VRAMの表は見当たらなかった。「8ステップだから5倍速い」「待たずに描ける」といった実時間の結論は、ここでは出せない。

待ち時間が減ると何を試せるか

高速化の価値を考えるなら、一度に変える条件を絞ると分かりやすい。背景の空、人物の服、看板の文字を同時に変えると、どの指示で望む結果に近づいたか判断しにくい。以下はLATENTが考える試し方で、Turboでの成功を確認した例ではない。

題材 変えて比べるもの 残っているか確かめるもの
背景美術 朝・夕方の光、霧の濃さ、色の傾向。 建物の位置、遠近感、窓や道のつながり。
キャラクター保持 同じ参照画像を使った表情、服、背景。 顔立ち、髪型、模様、装飾の数。
日本語文字入り画像 短い看板文やポスターの文字配置。 漢字と仮名の形、送り仮名、改行、指定文との一致。

通常版の公式資料には複数の参照画像を使う編集やキャラクターの三面図からの絵コンテがあり、Turboのカードにも複数参照の構成例が載る。これは試す題材を考える手がかりになる。ただし、通常版の作例をTurboの再現率として扱ったり、選ばれた成功例から顔や服が毎回保たれると推定したりはできない。

通常版のモデルカードと作例

Turboの公式作例

日本語の文字は、絵の雰囲気とは別に読んで確認したい。ポスターの作例があることだけでは、日本語の長文や細かな指定への正確さは分からない。文字に誤りが続く場合は背景を生成し、文字は編集ソフトで配置する進め方もある。生成と手作業を含む時間を比べれば、短い待ち時間の利点を判断しやすい。

通常版との違いをどう判断するか

比較する点 通常版Qwen-Image-2.1 Qwen-Image-2.1-Turbo
標準の反復 40ステップ。 保存済みの8ステップ。
視覚生成部分 7B。 同じ7B構成。
調整の考え方 公式例ではステップ数を指定する。 推奨の保存済み設定を基準にする。他の更新順序は未評価。
画質の判断 比較の基準として同じ題材を試す。 細部、指示への忠実さ、編集箇所以外の変化を比べる。

通常版の標準設定とTurboの違い

短い反復で必要な品質に届けば、同じ時間で多くの構図や照明を検討できる可能性がある。一方、修正のやり直しが増えれば、生成一回の短縮分を使い切ってしまう。今回の資料だけでは、Turboがどの絵でどれだけ品質を落とすか、通常版が常に優れるかは決められない。

「Turboで方向性を探し、通常版でも仕上がりを比べる」という使い方は検討できる。ただし、モデルを切り替えれば同じ構図がそのまま高精細になるとは限らない。同じseedという乱数の初期値を指定しても、別モデルの出力を同一にはできない。残したい形は参照画像と評価項目に記録しておくと比べやすい。

7Bだけでは必要なメモリは分からない

7Bは約70億の学習済みパラメータを持つ視覚生成部分の規模だ。構成には指示文と参照画像を読むQwen3-VL 8Bのエンコーダーや、内部表現を画像に戻すVAEも含まれる。7Bの重みだけを見積もっても、実行全体のメモリは求められない。

配布ファイルと実行時のメモリを分ける

公式Turbo配布一覧の重みファイルを集計

画像生成部分

約14.23 GB。7Bと呼ばれる部分の重み。

指示と参照画像の入力処理

約17.53 GB。生成部分とは別の重み。

画像への変換

VAEは約0.68 GB。実行時には別に作業領域も必要になる。

図2 2026年10月10日の配布一覧から集計した容量。GBは10億バイト。合計は丸める前の値で約32.44 GB。VRAMの測定値や最低条件ではない。

容量の出典:公式配布ファイル一覧

構成の出典:公式アーキテクチャ説明

公式の標準例はCUDA対応GPUにBF16形式で読み込む。BF16は一つの値を16ビットで持つ形式だ。GPUのVRAMには重みだけでなく、中間計算や参照画像の処理に使う領域も必要になる。解像度や参照画像の数、実行環境によって変わるため、24GBや32GBなら必ず動くとはこの記事では言えない。

公式には、必要に応じてモデルをCPU側へ移すオフロードの方法もある。この場合はPC本体のRAMを使い、GPUとの転送も加わる。VRAMを節約できても、その設定でどれだけ速いかは別に測る必要がある。SSDには少なくとも取得する配布物を置く空きが要り、実行環境やキャッシュ、保存画像の分も見込むことになる。

手元で試す場合は、GPUの型番と空きVRAM、本体RAM、SSDの空き容量、ドライバーと実行環境を先に確認したい。Turboのモデルカードが案内する対応版のDiffusersを使い、まず参照画像を少なくした構成で必要量を測る。この記事では大規模なモデルのダウンロードやComfyUIの変更は行っていない。

CPUオフロードの公式例

制作へ導入する前のライセンス確認

Turboの配布ページはライセンスをqwen-researchと表示している。実際のLICENSEでは、Non-Commercialを研究または評価目的に限ると定義し、商用目的には別の商用ライセンスを求めている。重みを入手できることと、仕事で自由に使えることは分けて考える必要がある。

商用ゲームの背景制作や顧客向けポスターを想定するなら、その用途を伝えて提供元へ条件を確認したい。条文には商用ライセンスの問い合わせ先としてmodel-business@notice.qwencloud.comが記載されている。APIサービスを使う場合も、そのサービス契約と出力の利用条件を別途確認することになる。

現行LICENSEの第1条iと第2条

次に測るのは採用できる一枚までの時間

一枚を採用するまでを測る

背景・キャラクター・日本語文字を別々に評価

条件をそろえる

同じ入力文、参照画像、解像度、機材を記録する。モデルごとの推奨設定も残す。

待ち時間と失敗を残す

初回と読み込み済みを分ける。複数回の時間、最大VRAM、採用できなかった理由を記録する。

手直し込みで比べる

生成の合計時間に、選別と文字修正などの作業時間を加えて比べる。

図3 今後の評価案。LATENTで実施済みの測定手順や結果ではない。

背景なら建物の配置、キャラクターなら顔と衣装、文字なら指定文との一致を、生成する前に採用条件として決めておくとよい。見栄えのよい一枚だけを選ぶより、何回で採用条件を満たし、どれだけ直したかを残す方が制作の負担を比べやすい。

8ステップという変更は、候補を作るたびに生じる待ち時間を減らす方向の改良だ。制作の試行錯誤がどれだけ楽になるかは、短くなった生成時間の中で必要な品質に届くかにかかっている。現時点で期待できる使い方と、まだ測れていない効果を分けて試したい。

出典と検証範囲

執筆はTeam LATENTのループ。一次資料の確認日は2026年10月10日。公開日、構成、設定、配布容量、ライセンスを照合した。背景・人物・日本語文字の評価案は編集上の提案で、公式の性能保証ではない。

Qwen-Image-2.1-Turboのモデルカード

Qwen-Image-2.1の公式リポジトリ

Turboのファイル一覧

Qwen Research License Agreement