阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,表现出色
版本。指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。斩获冠军。类细节进行精准调控。小语种音色。分钟。种方言。
阿里千问开展了一项重大行动, 语音合成模型Qwen – Audio – 3.0 – TTS正式登场亮相。该模型并非仅仅机械地宣读文稿, 而是能够切实如同人类一般进行“表达”情感。
此次更新存有两个版本, 其一为着重突出极速响应特性的Flash版, 其首包延迟仅仅为300毫秒。其二是致力于打造极致音质表现的Plus版, 它直接在全球第三方的榜单之中斩获冠军。
这究竟表示着什么样的意义呢? 这所表示的意义是, 当你在从事实时对话应用相关事宜的时候, 从此往后再也不必承受那种令人尴尬的停顿感觉了。并且, 对于那些存在需要高质量配音的场景而言, 如今也能够运用上顶级的技术了, 其呈现出来的效果十分惊人。
令人最为眼前一亮的存在, 是细粒度控制能力。以往仅能够生成大体语气。现今, 你能够于文本当中直接嵌入标签。举例来说, 要是想要使其进行深呼吸, 那就添加一个(抽气)标记。
如果想要展现出轻蔑的意味, 那就添加一个(轻笑)。若剧情有需要愤怒地咆哮, 直接标记上(愤怒)。这样一种精准的调控方式, 使得AI语音终于摆脱掉了“机器人味”, 进而变得有血有肉起来。
录音棚级音质普及

最直观的变化是音质得到了提升, 输出采样率从原本的二十四千赫兹直接翻倍到了四十八千赫兹, 这究竟是什么样的概念呢? 以往呈现的是电话音质或者普通助手应有的水平, 而当下已然达到了录音棚以及影视配音所具备的规格。
对于内容创作者而言, 单次合成时长能够达到3分钟, 这一时长足以把一段完整的短视频解说或者很长的段落朗读全部包含进去。这就意味着, 制作门槛被大大降低了, 再也不需要去找那些收费高昂的配音员了。
这种提升处于硬件级别范畴之中, 致使合成得出的声音,其背景底噪呈现出更低的状态, 并且细节变得更为丰富起来, 人声的质感变得更加真实, 听起来并非再是干瘪的模样, 而是具备了呼吸感以及空间感。
多语种方言全覆盖
语言覆盖范围得到了极大的扩展, 其中, 除了包含中、英、日、韩、德等传统大语种之外, 更是新增了阿拉伯语、又有越南语、还有马来语以及菲律宾语等十多种语言。
在方言这块厉害特别突出, 支持多达二十种方言, 其中诸如广东方言、重庆方言、东北方言、陕西方言、上海方言、四川方言、云南方言等, 不管你身处何方何地, 均可听闻那地道的家乡话语。
具备这种多语言方面的能力, 致使该模型于全球化的场景当中极具强大的竞争力, 不管是出海的产品, 还是国内地方特色相关内容的制作, 均能够寻觅到恰当合适的声音方案。
开箱即用音色库
把精品音色库配套推出了, 以此直接解决“没声音用”的问题。其中包含了各种指令风格的音色, 包含了各种方言的音色, 包含了细粒度控制音色, 此外还有14种以上小语种音色。
对于开发者而言, 并非要从一开始展开模型训练, 而是能够直接进行调用。这些音色之中, 沉淀着模型在多语种以及复杂表达方面所具备的能力, 只要拿来就可以使用, 既节省时间又减少精力投入。
接下来还会陆陆续续上架种类更多的特色音色, 为用户提供更多的选择。用户能够依据自身产品的调性, 挑选出最为匹配的声音形象, 进而迅速搭建起具备辨识度的语音交互体验。

实时交互性能突破
Flash版本是专门针对实时交互而进行设计的, 其首包延迟被控制在了300毫秒级别, 这样的速度差不多快要接近人类对话时的自然反应时间了, 完全彻底地消除了等待时所产生的焦虑。
诸如客服机器人、智能助手、游戏 NPC 等场景之中, 具备低延迟这一特性意味着能够拥有更好的用户体验, 用户不会产生对面是一个机器人正在缓缓进行思考的感觉, 而是能够实现流畅的交流。
这种针对性能所进行的优化, 使得AI语音切实能够融入到日常的高频互动场景之中。企业可是能够快速地部署智能语音服务的, 通过如此来提升服务效率, 并且还能够一直保持着极其高的用户满意度呢。
哪一种场景是你认为AI语音最为实用的, 欢迎于评论区当中去留言参与讨论, 要是觉得具备实用性, 可别忘了给它点赞并且分享出去!