AI资讯

Meta新模型Muse Voice Transcribe,实时语音转文字,每分钟0.18美元

智能摘要

Transcribe,这是其首个实时音频感知模型。注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。小时的音频,也支持句内或句间的自然语言切换。

实时音频感知模型来了

9月1日, 被称为Meta的公司发布了崭新的Muse Voice模型, 这可是该公司所推出的首个具备实时音频感知能力能将声音直译为文字的模型, 而这种功能针对于那些有着快速处理语音信息需求的场景而言实在是极具用处。

开发者能够借由Meta Model API运用这个模型的能力, 定价之时, 每1000分钟音频仅需3美元, 依当前汇率予以计算, 大概等同于20.2元人民币, 此价格着实较为低廉, 对许多中小企业以及个人开发者而言都颇具吸引力。

边说边转写降低延迟

该模型最为显著的特性乃是流式处理技术, 当用户进行言语表达之际, 系统会同步输出文字内容, 并非要等到整段录音全部表述完毕, 经由这般方式便可极大程度地压缩等待时长, 进而提升使用感受。

将音频划分成小段予以持续结果输出, 这般的处理方式便是流式处理, 相较于传统的整段处理而言, 其延迟显著更低, 此技术尤为适配于实时听写、会议记录以及通话字幕等场景。

多说话者分离能力强

Muse Voice具备这样一种能力, 能从中分离出不同主体, 这主体是发言者, 存在于包含20多名说话者的录音里。这便意味着, 在大型会议场景中, 或者多人对话局面里, 系统能够精准区分每个人所表达的内容。

它能够自动识别话语是否终结, 进而把音频输入的界限予以明确, 对于展开自动生成字幕之举或者着手整理会议纪要之事极有帮助, 开发商能够直接将此功能加以运用, 并不需要另行开发相关的模块。

自适应延迟更智能

为了在兼顾实时响应的同时, 还能兼顾识别准确度, Meta引入了自适应延迟机制。系统并非会对所有词语都采用那种固定的速度以及准确度取舍策略。

对于每一个特定的词, 系统会判定需要额外接纳多少音频信息, 之后才输出识别结果。简易的语音能够迅速提交结果, 复杂的语音则会调用更多前后文信息。这种动态决断机制使模型变得更为灵活。

支持70多种语言

处于模型训练范畴内的, 涵盖了70余种不同语言, 于发布之际, 已然有25种语言达成了验证这一情况,这一情形为全球化应用奠定了妥善的基础, 不管是英语、中文抑或是其他语言, 均可由此谋求较为理想的支持。

Meta新模型Muse Voice Transcribe,实时语音转文字,每分钟0.18美元

去掉多语言支持之外, 这个模型还能兼容时长多于一小时的音频文件。在用户讲话进程当中能够自然地于句内乱或句间变换语言。针对特别场景, 开发者还能够凭借语言、关键词以及上下文偏置去提高识别成效。

Meta新模型Muse Voice Transcribe,实时语音转文字,每分钟0.18美元

排行榜第一的实力

Meta新模型Muse Voice Transcribe,实时语音转文字,每分钟0.18美元

到2026年9月1日那个时间点为止, Muse Voice于流式语音转文本的排行榜单里面, 处于第1名的位次。这样的成绩表明它的技术实力获得了行业的认可。

仅从定价方面而言, 每一小段时间仅仅只需零点一八美元, 换算之后大约等同于一点二元人民币。跟市场之上其他同一类别的产生物资相比一下看呢, 这样一个价格实实在在是特别的贴近民众。心里想着随着更多的进行开发的人加入进来去使用它, 这个经由塑造而成的样式会持续的进行优化以及升级。

Meta新模型Muse Voice Transcribe,实时语音转文字,每分钟0.18美元

你认为, 这个能够实施时间言语转换为文字记录的模型, 会给你的工作带去什么样的变化呢? 欢迎于评论区域分享你的思考。

相关文章