MarkTechPost短讯
阿里通义千问发布 Qwen-Image-2.1-Turbo,8步去噪的7B图像模型
阿里Qwen团队发布开源权重模型Qwen-Image-2.1-Turbo。该模型基于7B架构,将图像生成和编辑的去噪步骤从基础模型的40步加速至8步,实现5倍速度提升,并提供托管API选项。
阿里巴巴 Qwen 团队发布了 Qwen-Image-2.1-Turbo,这是其开源权重模型 Qwen-Image-2.1 的加速检查点。它在 8 个去噪步骤中生成和编辑图像,而基础模型的默认值为 40 步。对于开发者而言,这意味着在相同的 7B 架构下,去噪步骤减少了 5 倍,并且提供了托管 API 选项。
TL;DR
- 规模:视觉生成器包含 70 亿参数,搭配 Qwen3-VL 8B 文本编码器。
- 运行环境:通过 Diffusers 在支持 CUDA 的 GPU 上以 BF16 格式运行。Qwen 未公布 Turbo 版本的最低显存要求。Unsloth 估计基础模型在使用 GGUF 时仅需 11 GB 显存,使用 INT8/FP8 时需 24 GB。
- 性能:与 Qwen-Image-2.1 一样支持 2K 分辨率输出和编辑功能集,但仅需 8 步而非 40 步。
- 最佳表现:基础版 Qwen-Image-2.1 在 Qwen-Image-Bench 上得分 60.28,这是 Qwen 报告的最高开源权重分数。
- 核心优势(最佳):单个开源检查点即可实现 8 步 2K 分辨率的生成与编辑。
- 核心劣势(最差):仅限研究许可,因此商业自托管需要单独获得授权。
什么是 Qwen-Image-2.1-Turbo?
Qwen-Image-2.1-Turbo 是阿里巴巴 Qwen 团队推出的一个支持 8 步图像生成和编辑的检查点。它基于 Qwen-Image-2.1 构建。Turbo 保持了相同的 7B 视觉生成架构。它可以通过 Diffusers 中的 QwenImage21Pipeline 直接加载。
该检查点内置了推荐的 8 步采样调度方案。生成过程默认使用 CFG=1。前缀 KV 缓存可在去噪步骤之间复用文本和参考图像的上下文。
Qwen-Image-2.1-Turbo 是如何工作的?
底层架构是一个具有 32 层和 70 亿参数的单流 DiT(Diffusion Transformer)。它使用块因果注意力机制。文本标记采用标记级别的因果掩码,而图像则使用块级别的双向掩码。
- 文本编码器:Qwen3-VL 8B 对指令和条件图像进行编码。
- VAE:一个具有 16 倍空间压缩率的 64 通道 RGBA 自动编码器,支持原生透明度。
- 调度器:采用带有欧拉离散调度和动态偏移的流匹配(Flow Matching)。
注意力设计使得前缀缓存成为可能。输入图像和文本仅在第一步计算一次。随后的每一步都会复用该缓存。由于仅有 8 个步骤,缓存的前缀覆盖了大部分条件计算成本。

它能生成和编辑什么?
Turbo 模型卡展示涵盖了 8 个类别。包括肖像、人体姿态、透明图像、排版海报以及 UI 布局。编辑示例包括单图变换、多参考构图以及四图室内场景构图。基础模型支持最多 10 张参考图像,并支持通过圆圈、绘制注释或蒙版进行局部编辑。
如何运行 Qwen-Image-2.1-Turbo?
设置需要从源码安装 Diffusers,并配合 transformers>=5.17.0。该检查点需要 Diffusers PR #14950,该补丁添加了管道配置的采样 sigma 值。
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A ceramic teapot on a wooden table, soft window light",
width=2048, height=2048, use_kv_cache=True,
).images[0]对于编辑任务,传入 image=input_image 并附带指令提示词。支持的预设尺寸从 2048×2048 的正方形到 2752×1536 的 16:9 比例不等。
这里需要注意一点。仅设置 num_inference_steps 不会覆盖已保存的调度方案。只有显式指定 sigmas 参数才行,且 Qwen 指出其他调度方案未经测试。
API 费用是多少?
阿里云 Model Studio 现在同时托管了 Turbo 和 Pro 版本。在大多数地区,qwen-image-2.1-turbo 每张图像收费 0.1 元人民币,限制为每分钟 120 次请求(RPM)。qwen-image-2.1-pro 每张图像收费 0.25 元人民币,限制为每分钟 20 次请求。Turbo 版本的单张图像成本低 2.5 倍,且允许 6 倍的请求速率。
Qwen-Image-2.1-Turbo 与竞争快速图像模型对比
关键要点
- Qwen-Image-2.1-Turbo 在相同的 7B 架构上将去噪步骤从 40 步减少到 8 步。
- 单个检查点支持 2K 文本生成图像、多参考编辑以及透明 RGBA 输出。
- API 每张图像收费 0.1 元人民币,比 Pro 版本便宜 2.5 倍。
- 权重采用研究许可协议,因此商业自托管需要单独获得许可。
- 目前尚无针对 Turbo 版本的基准测试;基础版 Qwen-Image-2.1 在 Qwen-Image-Bench 上的得分为 60.28。
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一名富有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的举措是推出人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深度报道而脱颖而出,内容既技术严谨又易于被广大受众理解。该平台每月浏览量超过 200 万次,彰显了其在受众中的受欢迎程度。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。