创新日报

7B小模型跑赢GPT Image 1.5,阿里把抠图这一步删了

设计师的电脑里,一张商品图要过抠图、补边、叠底三道工序。现在有人把这三步压成了一句提示词。近日,阿里通义千问团队开源图像模型Qwen-Image-2.1,视觉生成部分采用20层Single-Stream DiT架构,参数量7B,原生支持2K分辨率与最多10张参考图输入,开放权重已发布至Hugging Face与ModelScope。

希鸥网观察到,Qwen-Image-Bench评测中该模型总分60.28,压过Nano Banana 2.0的59.82与GPT Image 1.5的59.65。它能直接输出RGBA透明图,A通道描述每个像素的透明程度。用户在提示词里写明透明背景,节庆插画、人物素材、装饰元素就能直接落地,抠图环节省掉。这项能力此前由独立的Qwen-Image-Layered试水,如今被并入通用模型。

能力的底子在推理优化。图像编辑时,参考图和指令不随每一步生成而改变,重复计算全是浪费。Qwen-Image-2.1用混合粒度注意力结构处理:文本部分走Token级因果掩码,逐词保证语义连贯;图像生成走Chunk级掩码,首步算完就把静态上下文塞进KV Cache,后续步骤直接复用。多图输入时省显存的效果最明显。

多图编辑是这次升级的重头。模型最多吃进10张参考图,任务从单人换装扩展到多人合照、场景拼装。测试里用7张图让两个人物同框对谈:两张对峙照片调整表情,再加房间、单人沙发、咖啡杯、落地灯、电壁炉和矮桌。难点不在输入数量,在于每个对象能否各就其位,比例、位置与整体风格不打架。

商业场景真正在意的是保真。换了发型或场景,人像还得是同一个人;商品换了摆放环境,包装文字、纹理、形状要对得上。否则画面再好看也上不了详情页。Qwen-Image-2.1在人像光影、发丝、服装纹理上做了增强,同时给出圈选、涂抹、独立掩码三种编辑入口,多区域修改互不遮挡,原图信息完整喂进模型。

希鸥网认为,这场博弈的受损方是中间环节。7B参数意味着单卡可跑,开源权重意味着零授权费,靠抠图API、透明素材包订阅、多图合成工具收月费的服务商,定价空间会被直接压扁。获益的是开发者和中小设计团队,过去要排期三天的素材流程,现在能塞进一条工作流。真正的变量在生态,谁能把模型能力包成场景化工具,谁就接得住这波溢出。

Qwen-Image系列没有一步跳到位。上一代先推独立模块试水透明图,这一代才把原生透明生成与编辑并进通用模型。好产品的生命力来自持续的微小改进,而非一次惊艳的颠覆。创业者每个季度该问自己一句:这三个月产品哪里变好了。这比追一个爆款概念实在。客户信任同样是慢变量,抠图省下的那点授权费,换不来设计师的长期留存。

开源模型的迭代节奏会把应用层拖进消耗战。今天60.28分领先,明天可能被下一次权重更新抹平。创业者要算的是活下去的账,保有持续经营能力,比押注某项能力领先更优先。认知接口也得留着,定期看行业外的做法。做设计工具的可以研究电商客服的自动化路径,做素材平台的去看看短视频剪辑的交付逻辑,跨界借鉴常在关键节点救场。

动作层面别等。10张参考图、RGBA输出、掩码编辑,这些能力已经躺在权重文件里。给自己定条24小时规则:今天决定接不接,明天就得跑出第一张透明素材图,哪怕只是一个按钮的demo。行动本身就是最便宜的信息收集方式,跑一遍才知道多图输入下显存、精度、分辨率的真实代价。想法停在计划书里不会变好,跑起来才有资格谈优化。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo

阅读量:1537
阅读时间:4分钟