机器人夹虾难题:视觉模型如何把握两帧间关键瞬间?
至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间?DINOv2主要为单帧视觉表征设计,并没有专门保证连续视频中的时间一致性。
从逐帧预测到连续变化
传统的视频预测模型, 仅仅问一个问题, 即下一帧是什么, 这般 discrete 的思维方式, 将时间切割成固定的片段, 模型仅仅能够学习相邻采样点之间的跳转, 当查询时刻落在两个训练帧之间的时候, 模型并没有一条显式的连续轨迹可供读取。
被PT – Flow改变的这个思路, 不再是对离散帧进行预测, 而是去学习世界于每个时刻朝着何种方向、以怎样的速度发生变化, 只要掌握了一条连续的那条变化轨迹, 便能够在任意时刻读取状态, 当需要更高帧率的时候, 只需从轨迹上加增采样点。
单token压缩动态信息
视频里的静态背景信息冗余程度非常高, 要是让速度网络一块儿去拟合静态背景以及少量运动区域, 那么动态信号将会被大量零变化或者噪声特征给淹没掉, 所以PT – Flow并不会直接在像素空间当中构建速度场, 而是先于潜空间里去提取真正负责描述变化的潜变量。
以初始状态作为条件, 借助动态编码器与解码器, 从参考状态那里获取静态场景信息。动态潜变量仅仅概括当前状态相较于初始状态所产生的那些变化, 这样的解耦带来了激进压缩。原始DINO特征大小是16×16×768, 然而动态潜变量只用了一个1×1×768的单token。
一阶导数约束防止坍缩
紧凑的潜空间并不就意味着模型能够学到稳定的、具备连续性的动力学情况。潜空间方面的世界模型长久长期面对表征出现坍缩此一那个情形或者状况: 哪怕要是当编码器把不一样的画面映射到相近大约似的向量的时候, 预测器就能够获得较低降低减少从而减低损失, 然而可是但这些向量却已经不再包含足够充足的状态方面内容信息了。
PT – Flow的关键设计在于, 并非仅仅比较预测状态跟目标状态是否一致, 而是直接对潜状态的一阶时间导数展开监督, 训练数据虽说仅提供离散帧, 然而能够借助相邻特征对变化速度作出估算, 凭借雅可比向量积, 模型不用显式构造庞大雅可比矩阵, 便能将视觉特征空间里的变化速度投影至动态潜空间。
连续积分实现任意采样
今后预测不会再依靠反复调用固定步长的下一帧模型, 这是在完成训练之后出现的情况。模型借助RK4等现有的ODE求解器顺着速度场进行积分, 达成真正意义上的连续时间推演。论文把训练序列下采样为原始帧率的三分之一, 即便如此依然能够查询训练数据未给出的中间时刻, 并且生成连贯状态, 标点符号。
带来灵活时间处理能力的是这种连续积分方式, 更高的有效秩意味着潜空间保留了更多彼此独立的变化维度, 单token并不等于信息贫乏, 潜轨迹可视化显示, 生成的轨迹比原始DINO特征以及离散下一步预测基线更加平滑, 并且仍保留原特征空间的主要几何结构。
补帧与反向生成的统一
这里的补帧, 不是那种简单的像素插值, 而是要从学习得来的潜空间动力学轨迹里, 去解码对应时刻的状态标点。把积分方向给反转过来, 让时间步变为负的, 同一个速度场就能生成在物理方面合理的反向序列标点。这表明模型学习到的潜空间流, 能够在相反的方向上开展稳定的数值积分标点。
这种统一性把PT – Flow的重要价值给揭示出来了。任意时间进行采样, 缺帧能够恢复, 反向还可以生成, 这些本来都不是相互独立的功能, 而是变成了同一条潜空间速度场的不一样的使用途径。它并非在高维像素或者完整视觉特征上面反复去做预测, 而是把跟运动有关系的信息聚合到一个动态token里面去求解。
机器人需要理解变化而非像素
机器人真正所要理解的, 并非是这样的情况, 即静态世界是由哪些像素所构成的, 而是另外一种情形, 当它朝着一个物体靠近、与之接触并且使其移动时, 世界究竟是怎样发生着变化的。另外, 这种变化接下来又会将它引领至何处。PT – Flow把主要的计算运用在了世界如何发生变化这一方面, 而并非是在每一个时间点都再次去生成一遍完整的世界。
这种转变的意义, 在于预测未来的方式, 当世界模型开始直接学习变化率后, 预测未来才能够从逐帧模仿迈向连续的动态推演, 论文实验表明, LPIPS指标得到明显改善, 端到端预测效率也显著提升, 紧凑潜空间与轻量速度场, 不仅减少了表示规模, 还改变了世界模型的学习对象。
你觉得, 这般接连不断的动力学建模形式, 能不能助力机器人更出色地领会以及预估真实的物理世界呢? 欢迎于评论区域分享你的见解, 要是感觉有所收获, 那就请点赞并且分享给更多的同行。