AI资讯

机器人公司上市和融资,通用AI模型1分钟学会新动作

智能摘要

过了某个预训练阈值之后,适配一个新任务的成本变得可以忽略不计。做一个新的语言任务(比如翻译一种没见过的格式),需要专门采集数据、训练一个新模型,周期以月计。这个结论对宇树这类躯体厂商有直接的产业含义:一旦大脑层面的通用模型成熟,躯体的价值将取决于它能多快接入这颗大脑,而不仅仅是硬件参数和出货规模。

一场发布会震动整个机器人行业

在北京时间2026年8月21日的凌晨时分, 硅谷的机器人公司即为AI, 发布了新一代的基础模型名为GEN – 1.5 , 这个模型所具备的核心能力, 使得整个行业都为之产生了震动, 具体表现为, 给它展示一段时长处于3秒至12秒范围内的动作演示, 既不需要进行训练, 也不需要开展微调, 机器人在当场的情况下就能执行任务, 并且在10个操作任务中平均成功率达到了59% ,因此众多顶尖的研究者, 将这一时刻与2020年GPT – 3的发布作类比, 认为具身智能终于迎来了属于自己的GPT – 3时刻。

这个数字究竟蕴含着怎样的意义? 在传统的做法情形之下,教导机器人去学习全新的任务, 那可是需要经历数万步的梯度下降过程, 而其中的每一步, 其实都是针对模型内部参数所进行的一次精细微调, 这样的一个过程, 通通都是一般而言需要耗费大量的数据以及大量的算力才能达成的。以前, 当教导机器人去拧瓶盖之时, 那是需要工程师耗费数月的时间来进行编程操作, 又或者是去投喂数万条的训练数据, 然后反复地进行参数调整。然而现如今, 这样的一件事情, 已然转变成为了仅仅是给机器人去观看几秒钟的视频而已, 时间成本, 一下子就从数月大幅度地压缩到了不过数秒而已。

即兴发挥才是真正的突破点

GEN – 1.5, 让研究者震动的能力, 并非是模仿, 而是在于即兴发挥, 这才是关键所在。测试之时, 有一个细节, 令团队印象极为深刻: 机器人, 被演示了「扫」以及「铲起来倒」这两种动作, 然而, 训练数据当中, 并没有教授过这套动作组合。AI运用最近邻语言搜索, 在约189万段预训练场景里进行检索, 并未找到类似的簸箕用法, 可是,机器人却依然完成了这个任务。

另外有一个案例, 更能够表明问题所在。用于训练的数据, 仅仅是展示了运用一只手去旋转罐盖的情况, 然而模型在某些尝试期间, 自行切换到了双手操作的方式, 并且采用了全然不一样的抓取以及旋转的策略。这也就印证了模型并非简单地去复制演示动作, 而是在领会任务实质之后, 调用它自己在预训练阶段当中所积累的物理方面的经验, 以此来解决相关问题。

微调越少反而能力越强

一条线索因一个反直觉的发现而变得更加清晰, 即微调的梯度步骤越少, 即兴发挥能力越强。AI给出解释, 轻度微调使模型更靠近预训练积累的广泛行为库, 保留了更多可调用的「物理经验」。由他们自己表述为: 这已经近乎于「提醒模型一些它差不多已经知晓的事情」。

显示于AI公布的验证集曲线, 模型的「下一步动作预测误差」呈持续下降态势, 至今尚未见收敛迹象。这表明模型的学习能力尚未抵达上限, 伴随更多数据的添入, 性能或许还会持续提高。于部分测试里, 一个人运用自身双手于机器人摄像头前演示动作, 机器人随后借助机械手复现了任务, 整个过程无需任何专业设备。

所有这些能力都不是刻意设计的

人工智能表述称, 这些能力并非是经由刻意设计而产生的结果: 不存在针对于促进上下文学习作架构改过的刻意规划 , 不存在所谓元学习循环上进行专门构建的举措 , 不存在能够鼓励即兴去发挥的辅助训练目标。其他的研究团队在之前曾经也展示过与之类似的上下文学习的能力 , 仅仅是但只停留在少数的任务类型方面。GEN – 1.5所拥有的新颖之处在于其覆盖面。

有着这样一个模型, 它做了一件当时在所有人之中都无人能够达成的事, 那便是, 它并不需要进行重新训练, 仅仅只需在对话框当中给予几个例子, 它便能够完成全新的语言任务。比如说, 给出一组「红→苹果, 黄→香蕉」的例子, 接着再去询问「绿→」, 它便能够给出正确的答案。在大语言模型还未曾出现的时候, 若要让AI去做一个全新的语言任务, 那就需要专门采集数据, 还要训练出一个崭新的模型, 并且整个周期是以月作为计算单位的。然而自从GPT – 3出现之后, 这件事情已然转变成为「在输入框里写上几个例子」这般的情况, 其时间成本从原本的数月大幅压缩到了仅仅数秒。

行业竞争的下一个焦点是数据

当前GEN – 1.5所处位置, 和2020年的GPT – 3相类似, 其能力较为粗糙, 不过方向清晰明确, 任务相对简单, 然而趋势清晰可辨。在越过某个预训练阈值之后, 适配一个新任务所需的成本, 变得几乎可以忽略不计。倘若具身智能的学习曲线确凿没有收敛的迹象, 那么下一轮竞争的核心资源, 就转变成为是谁能够拥有足够多的物理交互数据, 将其用来供应给这台引擎。

这跟2021年大语言模型步入数据争夺战的剧本一模一样, AI于官方博客里写道, 这使得两件事发生变化, 其一为机器人从数月才能变得有用变为数秒, 其二是谁能使用机器人, 从专家转变为任何人, GEN-1.5发布的时间节点, 处于整个具身智能行业最为密集的一周, 世界机器人大会首次设立21个场景赛项, 要求人形机器人在工厂、酒店、家庭服务等真实环境下完成长程任务。

硬件厂商迎来新的生存法则

具身智能的“上市大年”为2026年, 有超20家公司清晰明确了上市计划, 然而驱动上市潮的很大一部分是资金压力。宇树创始人王兴兴在WRC上公开宣称, 限制人形机器人发展的主要瓶颈当属具身智能大模型, “预计未来快则两到三年, 慢则五到十年, 有望达成机器人的GPT时刻”。

对于宇树这类躯体厂商而言, 这个结论有着直接的产业方面的含义, 一旦大脑层面的通用模型达到成熟状态, 躯体的价值就会取决于它接入这颗大脑的速度有多快, 而并非仅仅在于硬件参数以及出货规模。AI研究团队表示, 自从着手研究机器人基础模型以来, 广泛的one-shot上下文学习一直都是最为清晰明确的目标。在研究生阶段的时候, 他们与Andy Zeng讨论过一种能力, 这种能力是「Ctrl-C-Ctrl-V」式的, 也就是说看到一个动作, 机器人就能够进行复制, 然而, 想要实现它是极其困难的, 原因在于「你想粘贴的那个世界, 和你复制的那个世界永远不一样」。

具身智能研究者Jim Fan表明, 训练数据当中自然有的那种对称重复动作模式, 像比如说组装家具之际反复拧螺丝那般, 第二颗螺丝便是第一颗的「上下文学习样本」。数据里人类失误以的恢复动作, 东西掉了之后捡起来再继续, 这种「失败 – 恢复 – 继续」的完整弧线使得模型在测试的时候自然展示出纠错能力。他还着重指出, AI所采用的UMI数据采集方式, 也就是人直接戴着机器人夹爪进行操作, 这种方式保留了人类的「物理直觉」, 而在传统遥操作里, 经过VR设备的中转后, 会使这种直觉大量地流失。

身为具身AI的研究者, 此刻于该领域而言, 着实是一个相当特别的时刻。GEN – 1.5所展现出的能力, 当下仅被限定于简易的短程操作, 像拧瓶盖、拉拉链这类, 与真实场景里的长程复杂任务相比, 依旧存在着巨大的差距, 不过方向已然明晰: 具身智能正顺着大语言模型所走过的路径, 从专用朝着通用迈进, 从规则迈向涌现。

汝认为机器人切实走入家庭, 尚需几年时间呢? 欢迎于评论区之中分享汝之看法, 点赞此内容以及进行转发使得更多之人目睹这场变革。

相关文章