AI资讯

阿里发布新原生全模态大模型Qwen3.8-Omni-Flash 音视频理解直接涨25%

智能摘要

阿里的意图很明确——让模型不只是看懂或听懂音视频,还能在理解之后规划任务、调用工具、把活干完。Gemini主要体现在整体音频和音视频能力上。团队这次主打智能体交付:模型能分析长视频、定位关键内容,再调工具完成视频编辑、内容整理、会议总结和字幕生成。

过去处理音视频的人工智能应用价格高得离谱, 让那些规模中等的团队几乎完全负担不起。如今阿里巴巴将音频处理的费用大幅度削减了百分之九十八。现在的实际问题在于, 这究竟是一项能让大家都得到实惠的真正举措, 还是仅仅是为了推广产品而使用的一套营销说辞。

原生全模态不是简单拼接

Qwen3.8-Omni-Flash这个模型, 它能够支持文本、图像、音频、视频这四种输入方式。它的上下文窗口大小达到了100万Token的级别。

如果拿它跟上一代的Qwen3.5-Omni-Plus来进行相比的话, 根据官方公布的数据来看, 在29项基准测试中的平均分有了提升, 而且提升幅度超过了百分之二十五。

最核心的区别就在于“原生”这两个字。它并不是简单地把语音识别模型和图像识别模型分别做成模块, 然后再把各个部分拼凑糊弄在一起, 而是让模型在底层的架构中, 直接对多种不同类型的数据流进行处理。

当系统将音频和视频信息彻底理解之后, 它还具备后续的能力, 能够主动去规划具体的工作流程、调用相应的工具, 最终把需要完成的任务给彻底做完。

音频是这次最硬的指标

阿里发布新原生全模态大模型Qwen3.8-Omni-Flash 音视频理解直接涨25%

在进行多模态工具调用测试的过程中, Qwen3.8-Omni-Flash在第一项里拿到了71.0分, 与此同时, 其对手获得了58.9分;在另一项任务里, 双方得分分别是85.1分和84.0分;另外还有一项任务的得分为67.2对比39.7。

到了MMAU这个评测集上, 成绩体现为81.8对76.9。由此可见, 四组比赛结果都是全赢的状态。

多说话人会议识别方面的进步表现得非常迅猛。说话人错误率DER数值从上一代模型的88.11直接大幅度下降到了3.35。与此同时, 带归属的词错误率cpWER也出现了显著降低, 从89.61降到了17.18。那些从事会议转录工作以及多人访谈项目的团队, 最应该去密切关注这些关键数据指标。

价格才是真正的核武器

按照官方的计算公式, 音频输入的每小时成本下降幅度超过了98%。音视频混合输入的成本下降幅度也超过了93%。具体的算法逻辑是, 先取出两分钟素材的处理价格, 然后将这个数值乘以30。

对于视频部分, 是按照720p分辨率、每秒钟计算1帧的方式来估算的。在国际区内, 每输入一百个万Token的价格是0.15美元。如果是缓存命中后的输入, 价格是每百万Token 0.016美元。输出内容则是每百万Token 0.47美元。

中国大陆境内以及部分区域地区的费用需要另外计算, 具体情况请参阅阿里云官方网站。对于从事播客制作、直播回放以及长期会议录音的团队而言, 以往的计费方式是按照小时来核算的, 而现在则支持按照天或者甚至以周为单位进行批量处理的模式, 这导致整体的预算逻辑发生了根本性的变化。

百万上下文意味着不用切片了

最大输入量接近99.2万Token, 开启思考模式时约为98.4万Token, 并且支持13.1万的最高输出。开发者只需将数小时的音频内容或长短视频资料整个提交即可, 彻底免去了之前需要将内容切割为数百个微小片段、分别送入各类模型进行处理后再重新拼接组合的繁琐步骤。

此外, 它能够处理多达113种语言和方言的音频数据。它也支持对双声道立体声以及四声道空间音频进行分析工作。再加上具备函数调用功能、联网搜索能力, 还有上下文缓存机制, 所以仅仅依靠这一个模型, 就可以覆盖过去需要三四套工具链才能完成的工作任务。

智能体交付才是终局设计

Qwen团队这次重点展示的不是仅仅看得懂内容, 而是看懂之后再能够真正去干活。这个模型先来分析长长的视频, 然后定位出关键片段, 接着再去调用各种工具来完成剪辑、整理内容、做会议总结以及生成字幕这一系列工作, 整个业务流程一条线走下去, 中间完全不需要人去插手操作。

配套的工具已经公布了, 针对多模态智能体开发的Qwen-MM是可以直接拿来用的, Qwen-Live也提上了日程, 服务是通过阿里云百炼来提供的, 覆盖了北京、新加坡、香港、东京、法兰克福、弗吉尼亚等区域。

别高兴太早还有短板

这情形根本就不是那种毫无悬念的全面碾压局面。你去看看某些具体的测试项目, 对手拿到了45.0分, 而Qwen只拿到了36.8分;还有另一项测试, 得分分别是78.6和74.0;甚至在部分视频理解的场景里, 对手的优势依然存在。

所以, 要是说“逼近”, 那这话实在说得太过委婉、太过客气了一些, 用“整体音视频能力追平”这个说法, 才算得上是更准确、更切中要害的事实描述。

模型的权重并没有直接对外提供公开, 这次释放出来的内容是多模态插件以及相关的开发工具, 如果想要进行私有化部署的团队, 在现阶段是无法利用这些资源的。与此同时, 由于Qwen产品和竞争产品在多模态领域展开了激烈的角逐, 使得相关技术的迭代速度会变得更加快速, 这意味着当前对于选型的选择窗口期并不长。

请问当前阶段你是不是仍然采用那种将几个不同的模型进行拼接的方式, 来处理音频和视频内容呢? 假如转换使用这一套全新的解决方案, 你判断哪一个具体的应用场景能够最快地顺利跑通, 并且带来的回报也最为显著?

欢迎大家在评论区分享交流你的观点, 如果你认为这些内容具有不错的参考价值, 那么就给点个赞, 并将其转发给你团队里负责人工智能相关工作的团队成员去阅读。

相关文章