AI资讯

千问语音模型大降价,TTS降70%,ASR直降95%

智能摘要

系列语音大模型。则把处理对象从“语音中的文字”扩展为“完整音频信息”,可理解人物情绪、环境声与机械声,完成声音描述、事件定位与音频问答推理。在这些场景中,用户无需始终打开电脑或手机,即可通过语音直接发起任务,并在实时对话中追加条件、修改需求或了解执行情况。

千问一口气发布了五款语音模型, ASR的价格直接下降了百分之九十五, TTS也降低了百分之七十, 过去只有大厂才能承担得起的语音能力, 现在小团队甚至是个人开发者都能够直接接入使用了。

五款模型一次发完价格集体跳水

千问语音模型大降价,TTS降70%,ASR直降95%

在2026年9月24日这一天, 千问正式发布了Qwen-Audio-3.1这一系列内容。这个系列里面包含了五个部分, 分别是ASR、ASR-Next、TTS、TTS-Next以及实时交互模型。

这些模型的作用是覆盖全链路, 具体来说就是能够处理理解、生成、交互以及创作这几个方面的任务, 它们是同时亮相的, 一共五款。

在价格这个层面儿, TTS降价了大约百分之70, 常规ASR降价了大约百分之85, ASR-Next降幅达到了百分之95。千问把全线语音模型的使用门槛拉到了接近免费的水位。

ASR新模型不止转文字还能听懂情绪

Qwen-Audio-3.1-ASR增加了原生转写润色功能, 系统会自动把嗯、那个这些语气词给去掉, 然后重新组织一下语义的表达方式, 它还能按照不同的角色来记录谁在什么时候说了什么话, 这样在处理会议或者访谈的时候, 直接就生成出结构化的纪要了。

ASR-Next这一技术把处理对象从文字扩展到了完整音频, 能够识别人物情绪、环境声和机械声, 完成声音描述与事件定位, 11个子集平均字错误率仅4.55%。

TTS-Next一次生成人声音效环境音

Qwen-Audio-3.1-TTS支持多语种和方言合成, 同一个音色能跨越语言进行自然迁移, 可以用指令去控制情绪、语速与表达方式, 不需要换掉原本的音色就能完成对种语言的切换。

TTS-Next更进一步, 围绕文本、时间戳和参考音频统一生成人声、音效与环境音, 支持48kHz输出与细粒度时间戳控制, 一次创作满足播客、有声书、影视和游戏需求。

实时交互能打断还能看情绪说话

Qwen-Audio-3.1这个实时交互模型, 它用了全双工的架构。所以用户可以随时插话把它打断。它能在说的同时听清楚用户的声音。当它识别到用户语气低落的时候, 它会自动把语速放慢。它还会调整一下措辞。它不会像那样机械地照着稿子念。

千问语音模型大降价,TTS降70%,ASR直降95%

它支持语言的实时多语言切换。在对话的过程中。它会直接去调用API。它会直接去调用知识库里的内容。它会直接去调用业务系统里的那些工具。通过这些操作来完成相应的任务。这是基于一个叫做多教师蒸馏的那个架构来做的。这样可以在延迟很低的情况下去运行的。同时它也强化了事实是可靠的那一面。同时它也强化了安全边界。

三十种语言十六种方言一套搞定

这套ASR模型支持三十种语言以及十六条中文方言, 能够支持行业词汇以及分级热词的识别情况, 首次字符响应大约需要一百六十毫秒, 在中文方面对内部测试集的平均字错误率进行统计, 其结果为百分之十点三八。

对于一些团队来说, 他们从事跨境电商业务, 或者做多语种的客服服务, 甚至是在进行方言保护的项目。这些团队现在可以不用再为每一种不同的语言去单独训练模型了。只需要使用一套接口, 就可以完全覆盖全部的各种应用场景。这样做的话, 开发和部署的成本就会直接被砍掉很大的一大截。

眼镜办公Agent全接上了

现在, Qwen-Audio-3.1已经和千问办公、Qoder等Agent结合到一起了。它还和AI眼镜、乐奇AI眼镜等硬件也连上了。用户根本不需要打开电脑或者手机。只要通过语音就能直接发起任务。还能追加条件。查看执行进度也是一样的方便。

千问把话说是, 他强调这一次升级, 可不是那种盯着单单个指标去搞优化的那一套路数。它是沿着五条技术路径在往前头的推进的。其目标, 是想让语音变成连接人、还有内容和人工智能的一个非常自然的入口, 说白点儿, 就是别再把它当成是一个孤零零的只有识别功能的简单工具来使唤了。

在你的项目里面, 哪个语音的环节是最让人束手无策、制约整体进展的关键点呢? 是识别的效果不够准确, 还是声音的合成需要花费太多的成本, 又或者是交互过程中出现了太高的延迟问题? 请在评论区里面分享你的看法。如果你也觉得这个内容有一定的价值, 不妨点赞并且分享给你的同事看看。

相关文章