阿里发布语音识别大模型,专业词汇听得更准,医疗准确率突破95%
更好地听懂专业词汇。主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。现已通过阿里云百炼平台开放调用,提供三个版本:
语音识别新突破,专业词汇不再难懂
7月31日, 阿里巴巴正式推出了Qwen-Audio-3.0-ASR-Flash语音识别大模型, 这款产品最核心的变化, 在于让AI能够更精准地听懂医疗、编程、股票等门类的专业术语, 以往语音识别碰到生僻词、行业黑话常常有误, 此次阿里专门针对这些问题进行了系统层面的优化, 解决了用户最为头疼的痛点。
三个维度全面升级,识别更精准
在新模型里, 于上下文一致性方向有显著改进, 此能使AI依据前后语境领会语义这般来避免因单个词汇孤立识别致使的错误, 在行业词识别方向同样有明显提升, 这凭借内置专业词库从而让模型对特定领域的术语更为敏感, 在热词定制化方向还有突出进展, 该功能准许用户自行增添公司名称、产品型号等专属词汇以满足个性化需求。
海量行业词库支撑,医疗场景表现亮眼

持续挖掘医疗、IT编程、股票、社会名人等领域专业词汇的研究团队, 建成了覆盖多行业的高质量词库。在最新的行业词汇内部评测里, 识别多种行业专业词的新模型的识别率有明显提升,尤其是医疗场景的听中率突破了最高比例95.36%。意指出医生口述的病历、药品名称、作为手术术语的AI, 都能更相当准确地转化成文字, 大幅减少人工修正时间。
多场景验证,错字率全球第一
Qwen – Audio – ASR – Flash系列于会议纪要整理场景获实际应用验证, 于实时字幕场景获实际应用验证, 于教育录播场景获实际应用验证, 还于智能客服等场景获实际应用验证。在AI评测平台上, 该系列凭1.7%的错字率获得全球第一的成绩。此数据表明, 针对嘈杂环境下的会议录音内容, 哪怕是专业领域的讲座之中的内容而言情况也是一样, 新模型均可维持极高的识别准确度, 能为用户省下大量校对时间。
三个版本开放调用,按需选择
Qwen – Audio – 3.0 – ASR如今已借助阿里云百炼平台实现开放调用, 能提供三个版本供用户去挑选。基础版适配日常语音转文字的那些需求, 标准版增添了更多行业词库的支持, 专业版是针对对识别精度有更高要求的场景。用户能够依据自身业务规模以及预算, 灵活地去选择最为合适的版本, 用不着一次性投入大量成本。
实际体验地址和接入方式
Qwen-Audio-3.0-ASR-Flash的体验地址此刻已然公开, 开发者能够借助阿里云百炼平台径直调用API接口, 接入流程简便, 在几分钟内便能够完成测试, 对于存在语音识别需求的企业用户, 建议先试用免费额度, 对模型于自身业务场景之下的表现予以评估, 而后再确定是否购买付费套餐。
致使你认为语音识别里最令你感到头疼的场景到底是什么, 究竟是于开会之际出现的方言口音状况, 还是专业术语接连不断涌出的讲座形式, 欢迎于评论区域之内分享你个人所经历的事情情况, 为这篇文章点赞并且进行转发操作, 从而让更多有需要的人们能够看到这件新工具。