讯飞新推ASR 2.0,9月24日输入法上线,企业可接入API
语音识别大模型迎来重要技术升级。Spark-ASR-2.0,标志着其在语音交互与智能硬件落地方面迈出了关键一步。服务。眼镜、讯飞智能办公本、讯飞听见等一系列核心软硬件产品业务中深度落地,持续拓展声学大模型在多元场景中的应用边界。
在9月23日这一天, 科大讯飞正式发布了Spark-ASR-2.0这款语音识别大模型, 意味着其技术水平又达到了一个新的高度。这一次的情况不是进行一些微不足道的修补和小范围的调整, 而是直接把从输入法端到智能硬件端的全链路环节都顺畅地连接起来了。
发布节点与背景
在9月23日这一天, 科大讯飞的官方账号对外做出了正式宣布, 告知大家Spark-ASR-2.0这个已经开发完毕的软件系统, 现在已经正式上线并且可以正常使用了。
关于这款产品, 需要特别提到的是作为讯飞声学大模型家族之中新一代的非常重要的核心组成部分, 它在好几个方面都进行了非常全面和系统的升级改造, 这主要就包括了识别准确率的提升、对长视频长语音的处理能力变强、以及对方言能够支持得更多等方面, 这么做的目的是为了能够更好地去瞄准那个被称为在2026年实现语音交互技术大规模普及的行业性重要窗口时期。
回顾过去的这两年时间, 语音识别领域的这个大型模型赛道, 其内部的竞争局势已经变得到了极为激烈的程度, 也就是我们常说的白热化状态, 各个相关的厂商都在争先恐后地发布自己新一代的智能产品。
讯飞公司此时选择在这个特定的时点, 正式推出属于它的第二版本的内容, 这不仅仅是技术层面持续迭代过程中所体现出来的一种非常自然的常规节奏安排, 同时也是为了在接下来的下半年里, 那些智能硬件设备将迎来密集发布的高潮季节之前, 提前做好必要的核心能力储备与准备工作。
核心能力提升
Spark-ASR-2.0在声学模型这个层面完成了重构。这样一来,对嘈杂环境下的语音识别鲁棒性有明显改善。特别是在会议记录、车载场景这些噪声复杂的环境里。误识率跟1.0版本相比下降了不少。模型对付低声量、多人轮替这些长尾case也更从容了。
除了在基础的识别精度方面有了提升之外, 这个模型还在语义理解这回事儿上面进行了加强, 这样的话, 它能够更加准确地把那些读音一样但是字形不一样的词给区分开来, 从而有效地减少了像“记录”和“路径”这种容易让人产生歧义的情况发生, 这对于办公本以及输入法这种非常依赖语义理解的使用场景来说, 提供了非常大的助力。
上线与开放节奏
按照官方所公布的那个时间表来弄的话, Spark-ASR-2.0这款产品在从9月24日这个日子开始的时候, 要在讯飞输入法里头采取逐步灰度上线这样一个方式去搞, 用户是不需要再多做其他什么额外操作的, 就可以直接去体验新一版本的识别效果了, 与此同时呢, 在讯飞开放平台那个地方也是把API接口给开放出来了, 是面向那些开发者和企业客户去的, 这些接口是可以即时就使用的。
这种次日就开放的办法, 这个情况说明模型已经通过内部的全量压测和合规审核, 也就是说明工程这边准备得已经是足够充分了。对于企业客户来说的话, API即时的就能用, 这也就意味着可以马上开始启动接入测试的环节, 就不需要等待特别久的时间了。
开发者与企业服务
企业能够通过讯飞开放平台, 按照需求来调用Spark-ASR-2.0的API, 这些接口包括支持流式识别, 包括支持批量转写, 包括支持自定义词表, 并且是按照调用量来进行计费的, 对于中小开发者来说, 这降低了接入门槛, 使得他们不需要去自建声学模型的团队。
讯飞同时提供多语言、多行业垂类预训练能力, 金融、医疗、教育等领域客户可以基于2.0做领域微调, 这样可以缩短从通用识别到行业专属识别的落地方周。
硬件产品线落地
官方已经确认, Spark-ASR-2.0将会陆续植入到讯飞AI眼镜、讯飞智能办公本以及讯飞听见这三款核心产品之中。其中, 讯飞AI眼镜主要是侧重于实时翻译功能和会议速记功能。讯飞智能办公本则主要是侧重于长文档的转写功能。而讯飞听见方面, 主要是侧重于播客和访谈场景下的多说话人分离功能。
对于硬件制造商而言, 底层识别模型的升级, 意味着终端侧的推理效率和云端端的识别质量实现了同步提高。用户在使用时感受到的最直观的改进, 表现为出错率降低和等待时间短。这些情况对硬件产品的好名声有直接的推动作用。
行业影响与后续
声学大模型从实验室场景走向多硬件和多场景的落地部署, 说明了语音识别技术正在进入模型即基础设施的阶段。下游应用开发者可以更专注交互设计和业务逻辑, 不必再为底层识别效果反复调参。。
接下来, 咱们需要重点关注的事情是2.0版本在车载、工业巡检以及远程医疗这些非消费电子应用场景的拓展速度。还有一个重点, 就是讯飞公司会不会开放更多的端侧部署选项, 以便让那些算力受到限制的设备也能够跑得动新一代的模型程序。
你认为在接下来的一段时间里, 语音识别这一种类的大规模语言模型最需要集中力量去解决的应用场景究竟是什么呢? 你可以在下方的留言区域写下你的看法, 如果你觉得这个内容确实有一定的价值, 那就请帮忙点赞, 并且转发给你周围同样在做技术开发工作的朋友看一看。