产品简介
Qwen-Image-2.1 是通义千问团队 9 月 20 日开源的图像模型,用一个 7B 检查点同时做文生图与基于指令的图像编辑,原生支持生成和编辑带 alpha 通道的 RGBA 透明图像。单次最多接受 10 张参考图,可以用圆形、涂鸦和独立蒙版三种方式指定局部改动,架构上靠混合粒度注意力与 KV cache 复用控制算力开销。9 月 23 日它在 Arena 的 Image Edit 榜单拿到 1367 分,位列开源模型第一,总榜第 16,距 GPT-Image-1.5-high-fidelity 只有三分,文生图榜同样排开源第一。vLLM-Omni、SGLang-Diffusion 与 ComfyUI 当日完成适配,Unsloth 的 GGUF 版本让 12GB 显存的消费级显卡也能本地跑。需要注意权重按严格非商用许可开放。
核心功能
- 生成与编辑统一:文生图与指令编辑共用一个 7B 检查点,不用按任务切模型,部署和维护都省事。
- 原生透明图像:直接输出带 alpha 通道的 RGBA 图,透明底素材不用再抠图。
- 三种局部指定方式:最多 10 张参考图,可用圆形、涂鸦与独立蒙版圈定改动范围,未圈区域保持不动。
- 低门槛起量:混合粒度注意力加 KV cache 复用压低推理开销,GGUF 量化后 12GB 显存可本地运行,vLLM-Omni、SGLang-Diffusion 与 ComfyUI 均已适配。
适合谁用
以下类型的用户会特别受益于 Qwen-Image-2.1:
- 电商与设计素材:直接生成透明底商品图与贴纸素材,省掉抠图环节
- 参考图改写:基于产品图或人像做局部换背景、换元素,未指定区域保持原样
- 本地化部署:ComfyUI 工作流与 GGUF 量化让个人显卡和工作站都能跑
优点亮点
- Arena 图像编辑榜 1367 分开源第一,总榜第 16,距闭源榜首只有三分
- 7B 参数规模对部署友好,12GB 显存的消费级显卡即可本地运行
- 原生 RGBA 输出,透明底场景省去后处理
- 生态适配快,ComfyUI、vLLM-Omni、SGLang-Diffusion 当日可用
价格与方案
权重在 Hugging Face 以严格非商用许可开源,个人与内部用途可免费自行部署;商业项目需仔细核对许可条款,商用场景建议走阿里云百炼等官方 API 渠道并按调用量计费。具体许可与价格以官方公示为准。
总结与建议
Qwen-Image-2.1 把开源图像模型的天花板抬了一截:一个 7B 检查点同时覆盖生成与编辑,原生透明输出加三种局部指定方式,实用细节做得很足。Arena 两个榜单的开源第一,加上 12GB 显存可跑的部署门槛,让它成为当下最值得本地部署的开源图像模型之一。主要限制在许可证,严格非商用条款下商业项目要走官方 API。
版本演进
- Qwen-Image-2.1 登顶 Arena 图像编辑与文生图开源榜第一 (2026-09-23):Qwen-Image-2.1 在 Arena 的 Image Edit 榜单拿到 1367 分,位列开源模型第一,总榜第 16,落后 GPT-Image-1.5-high-fidelity 三分,文生图榜同为开源第一。模型是 7B 单检查点,同时支持图像生成与基于指令的编辑,原生输出 RGBA 透明通道,最多可接受 10 张参考图,vLLM-Omni、SGLang-Diffusion 与 ComfyUI 均已当日适配,Unsloth 的 GGUF 版本可在 12GB 显存本地运行。权重按严格非商用许可开放。
- Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像 (2026-09-20):通义千问团队开源 Qwen-Image-2.1,把文生图与图像编辑合进同一个 7B checkpoint,原生支持生成与编辑透明图像并输出带 alpha 通道的 RGBA 图。单次最多基于 10 张参考图做指令编辑,支持圆形、涂鸦与独立蒙版指定局部改动,通过混合粒度注意力与 KV cache 复用提升推理效率,可原生 2K 直出,覆盖全景图、信息图与分镜等任务。