Qwenは2026年10月8日(現地時間)、画像生成・編集モデル「Qwen-Image-2.1-Turbo」をオープンソースで公開した。このモデルは、既存の「Qwen-Image-2.1」と同じ70億パラメータのビジュアル生成アーキテクチャを採用し、わずか8ステップのデノイジングで高品質な画像生成と編集を可能にする。モデルのウェイトはHugging FaceとModelScopeで提供され、APIも利用可能となる。
Qwen-Image-2.1-Turboは、テキストから画像への生成機能と画像編集機能を備えている。8回のデノイジングステップでこれらの操作を実行でき、推奨されるサンプリングスケジュールがチェックポイントに含まれている。
ベースとなるQwen-Image-2.1は、視覚生成コンポーネントに70億パラメータ(32のSingle-Stream DiTレイヤー)を持つ。このモデルは生成品質、推論効率、多用途性のバランスを取るように設計されている。主な改善点として、軽量アーキテクチャと混合粒度アテンションによる計算コストの低減、ネイティブな透過性(RGBA)対応、最大10枚の参照画像を使用した多彩な編集機能、およびタイポグラフィやポートレートライティングにおける美的品質の向上が挙げられる。
Qwen-Image-2.1-Turboのウェイトは、Hugging FaceとModelScopeから入手できる。また、Qwen-Image-2.1 Pro APIとTurbo APIは、Alibaba Cloud Model Studioで公式に提供されている。
Qwen-Image-2.1は2026年9月20日にリリースされており、Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2Vといった複数のプラットフォームがリリース当初からサポートを表明している。
参考: github.com — 2026年10月9日 09:00 (JST)
原文ハイライト"We released Qwen-Image-2.1-Turbo for image generation and editing in just 8 denoising steps"