通义千问Qwen Image 2.1开源:RTX3090就能跑,多图合成神了
阿里通义千问团队近日端出了一道让开源社区眼前一亮的菜:开放权重的图像生成与编辑模型Qwen-Image-2.1正式登场。一次最多吞下十张参考图,群像合成、虚拟试穿、房间设计都在这套框架里跑通。想局部修改也不必重画整张图,画个圈、涂个遮罩、随手点几下做标记,模型就明白该动哪一块。
拥有70亿参数规模的开源图像模型竟然压过了闭源模型, 通义千问推出的Qwen-Image-2.1版本将使用的门槛降低到了消费级显卡级别, 不过它的研究许可严格禁止商业用途, 这条界限划分得是非常清晰且坚决的。
7B参数跑赢闭源 底气从哪来
这个由阿里巴巴团队推出的Qwen-Image-2.1视觉生成组件, 它的参数规模仅仅只有7B。在阿里自家使用的评测基准上面进行运行和测试的时候, 它战胜或者超过市面上绝大多数的闭源技术方案的情况是比较常见的, 因此该团队在面对外界进行宣告或者表达观点的时候, 会表现出非常充足的信心底气。
目前的第三方独立评测工作, 还在进行的途中。所以这份成绩单, 只能当作是预先的演练。社区方面想要给予真正的认可, 还必须等待外部数据的落地。
合照合成和透明通道
在官方展示的场景里, 群像这个功能会起作用。它会动手去把好几个人的单独相片给拼接起来。结果是弄出一张看起来很自然的合影。注意看, 里面的每一张面孔都是来自不同的人物。这样的做法让过渡不会显得突兀。
更令人觉得方便的, 是可以输出原生的RGBA格式。这个格式带有透明通道。所以, 物体能够被单独地抠出来。而且, 文字也能够在透明的图层之上, 直接地对排版进行修改和重新设计。
一次吞十张参考图
参考图的数量上限是十张, 群像合成这一环节、虚拟试穿这一环节以及房间设计这一环节, 全部都在同一套框架里面实现了完整的流程打通, 用户不需要去切换其他的工具即可完成操作。
在进行局部的修改工作的时候, 完全没必要重新绘制整一张图片了。比如画个圈、涂个遮罩、或者只是随手点几下标记, 模型自己就会去判断究竟该动哪一块区域了。
推理提速靠架构和缓存
在架构层面进行的改动, 以及关键变量缓存复用的策略相互配合在一起, 随着所参考图片的数量变得越来越庞大, 速度提升所带来的直观感受就变得越来越明显。针对那种需要多个参考场景的情况, 用户所需要等待的时间被直接砍掉了一大截。
对于那些一般的用户而言, 他们在使用十张参考图的时候, 再也不用去做那种要花费很长的时间去进行无望等待的事情了, 他们其实是可以去切实感觉到那个实际出来图片的一个速度的节奏的。
上线渠道和在线Demo
该模型已经同步上线到了Hugging Face和魔搭社区这两个平台上面, 并且配套有在线的Demo程序在, 只要进行注册操作以后就可以直接把玩, 完全不需要额外搭建使用环境。
个人玩家和学术研究者基本上可以零门槛地就开始使用, 把权重下载下来, 并且进行推理运算, 只要有一块主流的、面向消费的显卡就足以支撑得起这样的需求了。
研究许可禁止商用
那个授权条款它是明确写着包含了对研究方面的许可, 但是商业应用方面是被直接给卡住了, 也就是说企业如果想要把这个技术落地使用, 那么必须去单独找千问团队这个机构来申请那个商业上面的授权。
这一条线是不能不碰的。如果是个人拿出来把玩、敞开来说, 那还没有问题。但是, 如果你想要真正地赚钱来做生意的话, 那么你就必须先要通过授权这个关卡。只有这样, 才能避免因没有合规而踩到雷区, 从而确保安全。
大家觉得那个表示拥有7B参数量的模型能够超越那些封闭源代码模型的观点, 在等待第三方机构提供的评测数据正式公开之后是否依然具有可信度呢? 十分欢迎大家在接下来的评论区域之中分享自身的判断与看法, 如果您认为这个内容有价值的话, 请不要吝啬您的点赞操作并把它转发给身边那些从事人工智能相关工作的朋友。