AI资讯

阿里千问语音降价:TTS降70% ASR砍95%,全栈升级超便宜

智能摘要

阿里千问在9月23日把自家语音栈整体翻了个新。

九月二十三日这一天, 阿里千问一口气把五款语音模型全部释放出来了, 识别的费用直接降到了原来的十分之一也就是下降了百分之九十五左右, 合成的费用也砍掉了差不多百分之七十, 这就直接把语音能力的门槛给砸到了地板上去了, 这套组合拳打出来之后的潜台词说白了就是不再藏着掖着了。

识别先学会听懂上下文

Qwen-Audio-3.1-ASR新增了原生的转写润色功能。这个功能会自动去掉语气词, 还会删除重复的表达内容, 并且对语义进行重组。这样吐出来的文字会更加通顺, 也更有逻辑。

它不再是一堆原始录音转录的杂乱文本。分角色转写功能能够完整地把谁在什么时候说了什么内容还原出来。这会给会议和访谈留下可以追溯的结构化记录。

这个模型可以覆盖30种语言, 同时还能支持16种中文方言, 它不仅能识别行业里面的词汇、专业实体和不同级别的热门词语, 而且, 它还会参考长音频里面的历史上下文, 以此来确保人名的术语保持一致性, 首字响应时间被压缩到了160毫秒, 在公开的方言数据集上面测得平均字错误率为4.55, 其中的温州话的提升幅度尤其明显。

下代架构能听整个音频

阿里千问语音降价:TTS降70% ASR砍95%,全栈升级超便宜

ASR-Next这个系统, 它的识别对象, 从之前的语音里的文字, 扩展到完整的音频信息了, 它能听懂人物的情绪, 环境声和机械声, 完成声音描述, 事件定位和音频问答推理的任务, 面对混着对话和背景音的音频, 它不光是输出字幕, 而且还能告诉你具体的哪些声音, 以及对应的事件在什么时候发生。

在分角色ASR测试这个场合里, ASR-Flash-Next这一系统在八项指标当中拿下了五项最优的结果, 同时ASR-Flash这一个系统拿下了三项, 这样的表现是全方位压制了此前的Fun-ASR级联系统。

合成不再只求字音对

阿里千问语音降价:TTS降70% ASR砍95%,全栈升级超便宜

Qwen-Audio-3.1-TTS强调的是真实的表达。它支持多语种的合成, 也支持方言的合成。当同一音色跨语言的时候, 它能实现自然的迁移。另外, 它还能依靠指令来控制情绪、控制语速, 以及控制表达方式。这么做是为了让声音能够贴合具体的内容, 贴合具体的场景。

我们把TTS-Next升级成了一个通用的音频生成系统, 这个系统是围绕文本和时间戳以及参考音频来构建的, 使用一个统一的模型去生成人声、音效还有环境音, 在有声书里面旁白和两个角色的对话还有城市的低鸣声以及晚风声会同时出现, 系统是支持细粒度时间戳和48kHz输出的, 这样的能力能够满足播客需求、影视需求、游戏需求和广告需求。

全双工交互像真人通话

实时交互采用了全双工的方式, 用户在过程中随时都可以进行插话并且实现打断的效果, 整体体验非常贴近于真人的直接通话场景。

模型所能够理解的内容已经不再仅限于单纯的文字信息, 还包括了隐藏在声音背后的情绪状态以及用户的真实意图, 当系统察觉到你当前的语气呈现出低落的趋势时, 它会主动放慢说话的语速并对措辞进行相应的调整;而在进行语言切换操作的时候, 上下文逻辑和说话节奏都做到了没有出现断档的情况。

我们采用了多教师蒸馏架构, 这样既能让系统保持较低延迟, 同时又能有效地提升推理能力以及安全性, 当遇到存在不确定性的信息时, 我们会选择不进行编造, 面对那些具备较高风险的内容, 我们会始终坚守相关边界, 此外我们还能够在实时对话的过程中直接调整智能体工具, 利用这些工具去连接应用程序接口、查询知识库以及操作业务系统, 从而获取数据并执行任务, 最终将得到的结果自然地呈现在对话之中。

落地已经在路上

当前, Qwen-Audio-3.1 正逐渐与 Qoder、千问办公等 Agent 产品相结合, 同时也开始适配 AI 眼镜这类硬件设备。

这意味着用户在日常使用时, 无需再打开电脑或者掏出手机进行操作, 而是可以通过直接说话的方式来发起任务请求。在对话过程中, 用户还能够随时补充相关条件, 或者对原有的需求进行修改和调整。

咱们得从ASR润色方言这事儿说起, 再到ASR-Next泛音频理解那个环节, 紧接着是TTS跨语言音色这一块, 然后是TTS-Next完整音频创作这一项工作, 最后还得算上拟人共情与工具调用这个点, 这五款模型嘛, 它们各自沿着那五条清清楚楚的路径, 就那样的同时往前推进了。

价格是真砍了

TTS的价格直降了大约百分之七十, ASR的价格砍掉了百分之九十五, 全线的价格都在狠狠地往下拉, 对于开发者来说, 一套模型就可以覆盖理解、生成、交互和创作所有这些环节, 而不再需要东拼西凑地去搭配了, 所以成本一下子降低了一个量级。

语音这个东西, 它变成了连接人和内容, 还有那个叫人工智能的东西的一个入口, 而且是最自然的那种入口。那次降价幅度达到了百分之九十五。因为这个降的价格太多了, 所以这道入口前面的门槛, 几乎就变成了地平线以下的水平了, 意思就是门槛变得几乎没有了或者非常低了这件事。

你手边有会议记录的素材, 还是有音频书的资源, 又或者是针对客服使用场景的需求? 请问你最想先拿来试试看的是哪一款工具? 请在评论区里讨论交流, 要是觉得这些内容有帮助的话, 就顺便点赞转发给你的同行业的伙伴们吧。

相关文章