AI资讯

智元AI模型登顶全球第一,超越千问Gemini,音视频理解更强

智能摘要

是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。此外,公开音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息,难以直接训练端到端具身交互模型。

音画同步理解能力有多强

智元WITA – Omni于具身全模态理解榜单之上, 凭85.21分实现登顶之事, 超越了千问、豆包、英伟达等一众对手。该榜单所进行测试的内容, 乃是模型能不能在同一时间看懂画面以及听懂声音, 并且还要去理解它们相互之间的时序关系。举例来说, 当有一个人正在说话的时候, 背景伴随着汽车喇叭声出现, 模型需要明白喇叭声与说话的动作究竟是同时发生的, 还是先后发生的。而这样的一种能力, 鉴于真实环境里声音和画面始终是混杂在一起的缘故, 对于机器人来讲是极其关键重要的。

WITA – Omni于八项指标里取得六项第一, 这表明其在音视频联合理解方面的确存有独特之处。测试素材源自实际开放环境, 并非实验室中那种摆拍而成的简易场景。这意味着该模型所面对的是嘈杂且混乱的日常画面与声音情况下, 它依旧能够精确认定声画对应关系, 而这对于人形机器人步入家庭以及工厂方面具有突出的重要性。

不是简单把聊天模型装进机器人

不少机器人仅是将大语言模型装入其中, 致使其能够进行说话聊天。然而, WITA – Omni的行径全然不一样, 它把物理动作以及面部表情提升至与语音同等关键的位置。这表明机器人不但能够领会你所说的内容, 而且能够运用恰当的动作以及表情对你予以回应, 并非只是单调地输出文字。

智元运用了一个原生端到端的模型, 以此来统一驱动感知、决策以及表达, 这个架构称作VLM-VLA-Actor, 它是从视觉语言模型扩展至具身输出的, 简言之, 模型在看完画面、听完声音之后, 便直接决定要做怎样的动作、使用何种表情、说出什么话, 整个过程连贯顺畅, 不需要在中间拼凑多个模块。

千万小时级数据训练打基础

WITA – Omni的训练运用了总计千万小时级的开源以及自有多模态数据, 这些数据涵盖大量文本素材, 还有图像素材, 以及视频素材, 其目的在于把模型从单纯的视觉理解予以升级, 升级为能听会看的, 并且能进行音画联合推理的全模态模型, 数据量如此之大, 确保了模型见过各种各样稀奇古怪的场景。

训练进程里, 模型掌握了将文字所述、视觉呈现画面以及声音传达的信息对应起来的能力。举例而言, 当目睹一个人手持杯子, 听闻倒水声响时, 模型便能够推导出这个人正在倒水饮用。这样一种跨越模态的对应关联, 乃是机器人认知世界所依托的根基。数据的源头存有公开的诸般资源, 同时也涵盖智元自身积攒的真实情境数据。

真实交互场景数据补齐短板

往往公开的音视频数据, 是欠缺真实交互里关键信息的, 诸如对话轮次切换、响应时机、动作以及表情细节等。这些数据多数是录好的视频, 并不存在真人之间的实时互动。要是直接运用这些数据去训练机器人, 它们会变得极为呆板, 不清楚何时该说话, 也不晓得何时该做动作。

特意构建了大规模高质量全模态数据集的智元, 是以人作为中心的, 是面向真实交互场景的, 那数据集完整且保留了声音、画面、语言、动作还有表情之间天然的时序关系 , 像一个人说话之际会眨眼睛、点头, 这些细节都被记录下来了, 从而让机器人学会更自然的互动方式。

物理动作和表情成为一级输出

常规机器人将动作视作执行指令所产生的结果, 表情乃是额外增添的修饰。WITA – Omni把动作以及表情提升至与语音同处于并列的一级输出位置。就情形而言机器的结果表述对其外延伸与表现情况就构成了主动用动作和表情去进行意图表达, 并非是被动地做出相应回应意思。举例来说机器在听到夸赞之时会呈现微笑点头的相应行为, 在听到批评之际会出现类似通过呈现低头进行思考的某种表意举动。

一种设计致使机器人看上去更具人情味, 于家庭场景之中, 老人以及孩子更易于接纳一个具备表情、拥有动作的机器人, 在工厂场景里面, 机器人借由动作示意后续操作, 相较于单纯语音提示更为直观, 智元借助这种设计, 使得机器人从工具转变为能够实现互动的伙伴。

人机交互能力高度贴合真实需求

人形机器人在真实物理空间的人机交互, 直接受助于 WITA – Omni 的核心能力服务。机器人需同步处理视觉画面、环境音频与语言指令, 且要判定事件先后顺序以及跨模态语义。像于厨房里, 机器人得听懂你说“帮我拿盐”, 与此同时看见盐处于柜子内, 并且还要躲开地上的水渍而后走过去。

具备这样的能力, 使得机器人不再被限定于固定程序, 而是能够适应处于动态变化之中的环境。智元的技术路线着重突出从数据到模型的完整闭环, 以此保证机器人学到的能力能够实现落地运用, 并被投入使用。在未来, 这种类型的机器人可被应用于家庭服务、医疗陪护、工业发展等多种不同领域当中。

难道你不认为, 当机器人掌握了看懂表情以及听懂语气的能力之后, 它是否会比真人更加洞悉你的内心想法呢? 欢迎于评论区内交流你的认识, 通过点赞以及加以分享的方式, 使更多的人可以瞧见这篇文章。

相关文章