千问Qwen-Audio降价,开发者API接入新选项
基于下代架构,把音频理解从语音中的文字扩展至情绪、环境声与机械声,支持声音描述、事件定位与音频问答推理。眼镜等智能硬件结合,延续语音成为人机交互自然入口的趋势。
语音大模型在从前那个时期, 其高昂的费用水平让小型团队完全负担不了。在九月二十三日那一天, 通义千问一口气大幅度降低了所有产品线的相关价格指标。文本转语音方面的成本削减比例达到了七成左右,而语音识别方面的成本则大幅压低了百分之九十五之多, 从而使得使用门槛被直接压低至极低的程度底线。
五件套一次全给你

在9月23日这一天, 千问方面发布了Qwen-Audio-3.1这一系列的产品。这个系列总共推出了五个关键的模块, 具体包括ASR、ASR-Next、TTS、TTS-Next以及实时交互这五个部分。
这些模块的能力范围非常广泛, 基本上覆盖了从语言理解到内容生成, 再到人机交互以及内容创作这一整个全链路流程。目前, 相关的API接口都已经成功上架到了千问AI平台之上。与此同时, 关于ASR-Next的API服务, 也即将上线投入使用。
这个组合拳背后的逻辑是很直接的, 它把从听这一环节, 还有说到理解, 再到最后的创作, 统统都放在一个平台上面来全搞定了, 这样就不需要再去东拼西凑着去调动好几家供应商了。
方言识别和润色是杀手锏
该ASR模型, 具备支持30种语言以及16种中文方言的能力, 在进行流式识别时, 首个字的响应时间, 大约为160毫秒。系统新增了原生转写润色功能, 能够自动去除语气词与重复表达, 同时还支持端到端分角色转写, 实现联合输出说话人标签、时间戳以及文本内容。
通过对实测数据进行查看, 可以发现针对开源方言测试集展开的分析中平均字错率为4.55%, 面对中文方言自建有规模的数据集时其字错率呈现为百分之十点三八即10.38%, 而在将方言转换为普通话以获取语义信息这一环节, 句子级别的准确率达到了百分之八十二点一零即82.10%。
下一代把耳朵彻底打开了
ASR-Next是基于下代架构的, 他把声音的理解这一件事, 从以前简单的把语音变成文字, 扩展到了一个更大的范围, 这个范围里面包括了情绪, 还有环境声以及机械声, 他支持对声音进行描述, 支持事件定位, 也支持音频问答推理。
ASR-Flash-Next和ASR-Flash, 在四个测试集里的八项指标上, 分别拿到了五项最优和三顶最优的头衔, 它们全面超越了以前的Fun-ASR级联系统。
音色跨语言迁移加音频创作
TTS 支持同音色在不同语言之间进行自然的迁移, 用户只用发出指令就能对情绪和语速进行控制。TTS-Next 主要是面向音频创作领域而打造的, 它统一完成了人声、音效还有环境音的生成工作, 不仅支持多角色的音色复刻, 还支持细粒度的时间戳以及提供 48kHz 的输出。
像播客啦、还有有声书以及影视和游戏这些场景, 它们都是直接能够得到好处的, 因为这样一来, 你们就完全不需要再去单独地寻找音效素材和配音这方面的资源了。
全双工交互随时能插话
它是依托于多教师蒸馏这样的体系架构来把全双工互动的功能给实现的, 用户能够随时随地插话, 直接打断当前的状态, 它支持在多语言之间进行实时切换, 还具备了情绪理解的能力, 此外还能实现在对话的过程间中直接与工具相互调用。
现在的情况是, 人们正在把语音这种和人机交互比较自然的入口方式, 和好多东西进行结合。这些被结合的东西里面, 包括像Qoder这样的Agent, 还有千问办公之类的Agent, 再就是比如千问AI眼镜那样的硬件设备等等。
随着这样一步步的结合深入下去, 那种认为语音是人机交互的自然入口趋势, 就变得越来越真实了。
价格直接打到地板
语音转文字这项技术的费用大概减少了七成, 自动语音识别这项技术的费用达到了九成的降幅, 还有那个叫做ASR-Next的东西它的费用也降了差不多八成五。这么一换算的话, 那些规模比较小或者中等的团队去搞语音相关产品的每月平均的花费就直接削减到了原本花费的几分之一那么少的一个程度。
对于独立开发者这个群体而言, 之前是一个月都难以承受的语音服务用量, 在目前的情况下, 几乎就等于不用花钱。
你当前正在运用语音这一技术形式的模型来开展哪一些具体的项目事务呢? 请你前往评论区的位置, 去交流讨论一下你所具体使用的相关场景内容是什么, 如果你认为该内容是有实际价值的, 那么你应当进行点赞的动作操作, 并且将其转发分享给那些可能有需要的同事人员。