2026云栖大会:阿里Qwen4启动训练,剑指ASI通用人工智能
云栖大会在杭州开幕。Agentic智能体、CodeArena前端编程等评测中位居前列。在推理优化和芯片模型协同设计方面,RSI也已实现落地。阿里称,Perplexity、Airbnb、Pinterest及路透社等企业已基于Qwen开展Agent、AI助手或自研模型等应用。
在9月22日这一天举行的杭州云栖大会上面, 阿里巴巴非常果断且迅速地公布了一系列非常重要的消息, 这些消息具体包含了Qwen4已经正式开启运行的情况, 以及模型实现零参与并且进行了多达33轮迭代的成果, 特别是那个12.5%的自主提升数字出现之后, 使得众多在这个行业里面从业的人们都感觉到心里很难平静下来, 纷纷表现出一种按捺不住的状态。
万亿参数Qwen4正式开训
9月22日, 2026云栖大会在杭州开幕了。阿里巴巴在那个会上公布了信息, 基于下一代架构的Qwen4已经正式投入到训练中去了。同时, Qwen4.5和Qwen5的参数规模也计划扩展到万亿级别的范围了, 这个数字是在5万亿到10万亿之间的。
在Qwen3.8-Max发布后, 它在智能体、前端编程等多项评测中表现突出, 位居前列。Qwen大模型项目组的负责人刘大一恒在会上明确指出, 递归自我改进是实现AGI强人工智能系统这一终极目标的必经之路。
模型自己训练自己
更关键的还有这么一点儿, Qwen3.8-Max这个模型, 它已经能够自己搭建起训练的那个流程, 能够自己去构造数据, 能够自己去设计实验, 还能够自己定位缺陷, 在人类完全零参与的那个状况之下, 模型持续进行迭代, 时间超过了1个月, 累计完成33轮有效的迭代。
经过了三十三轮的迭代, 模型的得分提升了百分之十二点五, 这一情况表明模型已经具备了初步的自我进化能力, 同时在推理优化以及芯片模型协同设计这些方面, RSI也已经完成了工程上的落地工作, 它现在已经不再仅仅局限在论文的讨论阶段了。
训练成本砍掉九成
Qwen3.8-Flash利用到了注意力机制这样的架构创新手段, 把训练所需的成本给压下去了, 降低的幅度差不多能到百分之九十的程度, 它是在使用得相对较少的参数激活量的情况下, 让推理的效率得到了进一步的提升的, 对于中小类型的团队而言的话, 其性价比是出现了非常显著的进步的。
把训练成本削减到了百分之九十, 这样的做法是能让中小型团队也能够承担起大模型训练的费用的以及承担得起部署的花费的, 不再是说只有最前面那一些公司才有资格去操作的, 而是整个行业当中对于大模型的直接使用的最低限度的要求是被大幅度地降低了的。
多模态全家桶升级
在多模态这个领域里面, Qwen3.8-Omni-Flash这个地方是统一起来处理视频的、还有音频的、以及图片的、和文字的。Wan3.0呢它支持单次生成的时候做出30秒的视频, 同时也支持结构化的输入。至于下代视频生成模型会是在11月正式发布的这个事情也是确定的。
Qwen-Audio-3.1系列覆盖ASR和TTS, Qwen3.8将字均延迟降至2.3秒, Qwen-Image-3.1、2.1等也同步推进, 多模态能力矩阵变得相当完整。
开源生态数据亮眼
开源生态数据表现很亮眼: 在仅仅一个月时间内, Qwen3.8这一相关模型的下载量就超过了5600万次。与此同时, 衍生出来的模型数量也超过了1900个。再来看整体情况: 直到现在为止, 阿里已经陆续开源了460多个千问模型。这些模型的整体下载量累计突破了30亿次。
衍生出来的模型数量超过了30万个, 这说明开发者社区的活跃程度是很高的。很多团队并不是从零开始进行训练的, 而是基于千问去进行二次开发和微调的, 生态飞轮已经转起来了。
大厂已接入千问
阿里已经进行披露了, 有多家企业都已经基于Qwen来开展开发了。这些开发的领域包括Agent相关的技术应用, 也包括AI助手的构建, 还有自研模型等方面的应用场景在运行中。
路透社以及其他的媒体机构也在使用千问来进行工作内容的生产和处理工作方面的工作。实际的落地场景范围正在持续的扩大之中, 这是目前观察到的一些动态发展情况。
从模型能力到生态落地, 这次阿里公布的内容覆盖面是极其宽广的。5万亿参数以及10万亿参数的实际训练效果到底怎么样, 我们还得看后续的基准测试, 以及真实业务场景里的最终表现究竟如何。
你认为这个模型依靠自身的力量去进行训练, 最终它能够达到的深度和广度究竟有多高呢? 非常欢迎大家在前面的评论区域里面参与交谈。如果你觉得这样的观点是有用的, 那么就请你点击赞的这个按钮, 并且把这个内容转发给你的那些同行人员知晓。