AI资讯

OpenAI推出GPT转录模型,低延迟实时转录API上线

智能摘要

的线索投递!方式调用。调用费用方面官方表示相比公司此前模型,上述两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录,包括短语、数字、专业术语以及带有响亮背景噪音的语音。可以优化已完成音频文件和批量工作负载的异步转录。

OpenAI才刚刚发布了两款全新的语音转录模型, 其中一款被称作GPT-Live-, 另一款叫做GPT- , 这两款模型不但能够更好地理解上下文, 还支持多种口音以及语言, 在嘈杂环境之下的转录准确率也得到了大幅提升, 对于那些存在语音转文字服务需求的开发者以及企业而言, 这理所当然是个好消息。

两款模型各有侧重

GPT-Live, 主要针对低延迟的实时转录情形, 像直播字幕、实时会议记录之类的应用就属于此范畴。而GPT-呢, 更适宜于处理已完成音频文件以及需进行批量工作负载的异步转录, 像是录音文件转写、语音笔记整理等这些情况。用户能够依据自身实际需求去挑选不同的模型。

定价更加亲民

人工智能研究公司OpenAI在一份广而告之的声明当中公开宣布了调用所需的费用, 同之前所使用的模型相比较而言已然出现了显著的调整变化。具体的价格状况尽管没有在原始文本里面详细地罗列出来, 然而官方着重表明这是旨在降低开发者运用的门槛之举。就中小企业以及个人开发者这两个群体来论, 更低的成本情形意味着能够更为广泛地去运用语音转录这项技术。

准确率显著提升

处于Aware ASR基准测试里, GPT – 的语义准确率, 从没有上下文之际的41.6%, 提升到了存有上下文之时的45.2%。于Voice的22种语言测试当中, GPT – 的转录错误率, 仅仅是19.27%, 远远低于先前模型的40.37%。在真实世界音频录制基准的九种语言那儿, 它达成了8.98%的转录错误率, 而先前模型是15.21%。

支持多种复杂场景

官方宣称, 这两款模型对于各类口音以及不同语言的现实世界音频具备更优处理能力, 涵盖短语、数字、专业词汇跟带有高声背景噪声的语音。这表明在诸如嘈杂的咖啡馆、工厂车间或者户外采访等情形下, 转录成效同样能够维持在较高水准。

API调用更加便捷

两款模型均支持利用 API 的方式来进行调用, 开发者能够较为轻易地将其集成到自身的应用当中。不管是去开发语音助手, 还是制作自动字幕生成工具, 又或是构建语音分析系统, 都能够迅速实现上手操作。OpenAI 还备有详尽的 API 文档以及示例代码, 以此来降低开发难度。

实际应用前景广阔

媒体从业者而言, 能够快速地把采访录音给转成文字稿。企业方面, 可以自动生成会议记录。教育领域当中, 能够制作课程字幕。医疗行业, 能转录医生跟患者间的对话记录。这些应用场景都会通过更低的成本以及更高的准确率而获得益处。

这款新模型对塑造你生活里的哪类场景最具可能性, 你是怎么认为的呢? 请前往评论区那儿分享你的观点见解, 赶快点赞并转发, 以便让更多人知晓这个利好消息!

相关文章