图像视频上手难度 🔧 进阶#文生图#图像编辑#透明通道#通义千问#Qwen#开源 SOTA#Hugging Face#7B
Qwen-Image-2.1 · 通义千问 Qwen-Image-2.1 统一图像生成与编辑模型
7B 参数统一文生图+图像编辑,原生 RGBA 透明通道+10 张参考图,Qwen-Image-Bench 开源第一(60.28 分)
指标同步中,请稍后刷新查看 在 GitHub 查看源码
5 分钟上手
消费级 GPU(8-12GB 显存)可运行;推荐 16GB+ 显存获得最佳体验# Hugging Face 加载
from transformers import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen-Image-2.1")
# 默认输出 2048×2048,40 步推理
# 生成透明图:prompt 中自然描述即可,模型自动判断输出 RGBA项目速览
Qwen-Image-2.1 是阿里巴巴通义千问团队于 2026 年 9 月 20 日开源的新一代统一图像模型(Qwen Research License),将文生图与图像编辑整合在同一框架中。视觉生成部分采用 32 层 Single-Stream DiT 架构,仅 7B 参数,配合 Qwen3-VL 8B 文本编码器和 64 通道 RGBA VAE,原生输出 2048×2048 分辨率(40 步推理),支持透明通道 RGBA 图像生成。
在 Qwen-Image-Bench 公开评测中取得 60.28 分,位列开源模型第一,超过 Nano Banana 2.0(59.82)和 GPT Image 1.5(59.65)。模型核心创新包括:混合粒度注意力结构降低推理开销、KV Cache 复用加速多图编辑场景、原生透明通道 VAE 支持设计稿图层交付。已同步开源到 Hugging Face、ModelScope 和 GitHub。
能做什么
- 文生图:从文本描述生成高质量图像,原生支持 2048×2048 分辨率和 7 种宽高比预设
- 透明图生成:自动判断输出普通图像或带 RGBA 透明通道的图像,支持透明图层文字编辑
- 多参考图合成:最多 10 张参考图输入,多主体融合与群像合成,人物/商品特征一致性保持
- 局部编辑:圈选、涂抹、独立掩码三种方式,仅修改指定区域不影响画面其他部分
- KV Cache 复用:多图编辑场景下推理效率显著提升
怎么部署
模型权重已发布在 Hugging Face(Qwen/Qwen-Image-2.1)、ModelScope 和 GitHub(QwenLM/Qwen-Image-2.1)。可通过 Hugging Face Transformers 或 Diffusers 加载,支持 vLLM 等推理框架。权重采用 Qwen Research License,商用需单独向阿里云企业侧申请授权。
适合谁
需要文生图+编辑一体化能力的 AI 应用开发者、电商/广告行业的设计师与运营人员、研究轻量级图像生成技术的研究者。
✅ 优点
- •7B 轻量参数实现文生图+编辑一体化,部署门槛低
- •Qwen-Image-Bench 开源第一(60.28),超部分闭源模型
- •原生 RGBA VAE 免抠图,透明图层可编辑
- •10 张参考图+3 种局部编辑方式,灵活应对复杂场景
⚠️ 局限与坑
- •Qwen Research License 限制商用,需单独授权
- •7B 参数在复杂构图/多人场景下细节不如大参数模型
- •文字渲染能力虽提升但复杂排版仍有局限
💼 典型应用场景
- 1.电商商品素材的透明背景生成与多商品合成
- 2.广告海报从文案到视觉的一站式生成与局部修图
- 3.设计工作流中快速产出多方案参考图
🔗 资源直达
图像视频· 同类项目推荐
返回全部开源项目指标每周自动更新,数据来自 GitHub API