机器人训练新突破,百万小时人类视频让AI学会物理行动
独特之处在于,预训练阶段一条机器人动作数据都没喂。因为这等于宣告:训练机器人最稀缺的资源,不是GPU、不是算法,而是高质量的人类行为视频数据。DYNA-2最核心的发现不只是「人类视频能训机器人」。而机器要学会同样的事,只能靠一小时一小时地看、一帧一帧地学。
机器人训练数据新突破
于2026年8月20日, 光轮智能于WRC 2026之上宣告开源10万小时全模态人类行为数据, 此乃当前全球范围内规模最为庞大的第一人称视角开源数据集, 引发了行业的高度关注。
Lukas, 这位业界的大V博主, 针对此举展开了详尽的剖析阐释, 表明这着实是在训练灵巧操作进程里极为难得一见的素材, 意味着具身智能范畴的数据壁垒在首次之时便已被极大幅度地冲破了。
人类视频决定机器人能力
训练机器人时, 最为稀缺的资源, 并非GPU, 也不是算法, 而是高质量的人类行为视频数据, 光轮智能所开源的10万小时数据集, 恰好落在了那个拐点上。
幂律曲线清晰地呈现出来了, 然而, 跑到关键拐点所需要的那一批数据, 长期被锁在各个公司的硬盘之中, 此次进行开源, 就如同是把最为昂贵的资产放置到了所有人的眼前。
数据标注是最大工程
到这个量级的同类数据集, 通常情况下是只放置原始视频的, 因为标注成本极高, 然而光轮智能却投入了大量的工程量, 最终完成了三层标注。
抖动, 加上遮挡, 再叠加在一起, 这成为位姿估计的噩梦, 团队在标注流水线上投入了大量工程方面的工作, 保证数据能够被使用且可以再次利用。
多视角填补行业空白
以第一人称视角的全球性数据, 大多集中于厨房以及家庭场景之中, 那些并不关联的独立场景数量, 远远达不到所需程度, 而最为缺少的部分是来源于真实工作范围内所体现出来的数据场景。
实施腕部视角数据采集的体成本高昂, 公开的相关数据几乎很难获得, 光轮智能此次开展开源行动所推出的数据集正好填补了这一空白领域, 其中腕部视角数据采集体成本高, 公开数据近乎难以见到。
统一标准解决数据孤岛
存在着多种不同的设备, 其所采集获取的数据, 被放置在了一起, 然而模型根本就无法承受、接纳这些数据, 光轮智能身为全球人类数据委员会的成员, 致力于推动统一标准的建立。
斯坦福等处于领先地位的机构,正在联手构建人类数据的标准, 要使得数据成为能让机器人进行持续学习的百科宝典, 而不是自成一己之私相互孤立的数据岛屿。
仿真与评测支撑产业化
用来解决机器人学所学内容的是人类数据, 用于解决如何进行大规模重复训练的是仿真平台。哪能衡量和提升效果的则是评测系统。
一次真机评测的成本, 超过了整整五十万, 并且还带有安全方面的风险, 而将其搬到仿真环境中后, 成本得到了大幅度的降低, 在多种场景之下, 能够让多个本体实现规模化运行。
关于具身智能, 存在着能不能量产、能不能干活、能不能稳定这三个问题, 而一套闭环体系, 为此提供了可行的路径, 从10万小时到100亿小时的那种跃升, 正在进行展开。
这套开源数据, 你认为它会怎样去改变机器人行业的竞争格局;于评论区留言, 欢迎你来分享你的看法, 要是觉得有帮助, 那就请点赞并给予转发!