阿里开源Qwen-Image-2.1:7B参数集齐生图、改图、抠图,AI绘画本地部署门槛再降一档

9月20日,阿里通义千问团队开源了图像模型Qwen-Image-2.1。消息放出几个小时,Hacker News冲上407分、143条讨论,热度压过同日多数硅谷新闻。

这个版本的关键词是”统一”和”紧凑”。视觉生成组件只有7B参数,32层Single-Stream DiT结构。生图、改图、透明图生成,全部收进同一个模型。

四个升级点,个个实用

体积压到7B。 混合粒度注意力加上前缀KV缓存复用,让模型在低算力下也能跑出高质量结果。前代Qwen-Image是20B MMDiT结构,2.1版本瘦身明显。消费级显卡本地部署的可行性大幅提高。

原生支持RGBA透明图。 输入一句提示词,模型直接生成带Alpha通道的透明底图片。电商贴纸、表情包、UI素材,省掉了抠图这一步。透明层的编辑、照片主体提取,也由同一个模型完成。

编辑能力大幅扩展。 最多支持10张参考图。局部修改提供三种方式:画圈、涂抹标记、独立蒙版。人物身份与商品外观在编辑后保持稳定,这一点对商业摄影场景非常关键。

质感与排版提升。 官方展示中,雨夜霓虹招牌的文字渲染干净利落,人像光影层次更接近真实摄影。六张人像参考图合成一张合影的案例,展示了多参考图的一致性控制能力。

上手代码,五行跑通

Diffusers已经原生支持,`QwenImage21Pipeline`开箱即用:

“`python

import torch

from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(

“Qwen/Qwen-Image-2.1”, torch_dtype=torch.bfloat16

).to(“cuda”)

image = pipe(

prompt=’A neon shop sign that reads “QWEN IMAGE 2.1”, rainy night’,

width=2048, height=2048,

num_inference_steps=40,

).images[0]

image.save(“out.png”)

“`

原生分辨率2048×2048。宽高比支持1:1、4:3、16:9等七种,16:9下达到2752×1536。显存吃紧的话,加一行`pipe.enable_model_cpu_offload()`即可缓解。

生态跟进速度是另一个信号。发布不到一天,Hugging Face上已经出现18个量化版本、16个微调模型、23个在线Spaces。此前Qwen-Image-2512在AI Arena经过10,000+轮盲测,拿到过开源图像模型第一的位置。LightX2V、vLLM-Omni这些推理框架对Qwen-Image系列一直保持Day 0支持,2.1的加速方案大概率已经在路上。GitHub上QwenLM/Qwen-Image仓库的星标数已到8.3k。

一点提醒:License变了

早期的Qwen-Image采用Apache 2.0协议。Qwen-Image-2.1改用Qwen Research License Agreement,研究用途没有问题,商用需要仔细核对条款。个人玩家和内容创作者影响不大,团队选型前建议先读一遍协议全文。

谁该现在就试

三类人值得立刻动手。设计师和电商运营,透明图直出加多图合成,能省掉大量抠图拼图时间。本地部署爱好者,7B的体量让一张24G显存显卡就有流畅体验。应用开发者,生成加编辑统一在一个管线里,架构里的胶水代码可以砍掉一半。

对比闭源方案,Qwen-Image-2.1的意义在于把”能跑”和”跑得好”之间的距离缩短了。数据留在本地不外泄,单张成本趋近于电费,这两个优势在批量出图场景下会被持续放大。

AI绘画这一轮竞争,主战场正在从”谁的图更好看”转向”谁的模型更小、更全能、更好部署”。Qwen-Image-2.1交出了阿里方面的答案。下一张牌,看谷歌和OpenAI怎么接。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号