Scalabot发布HERON-Spatial Intelligence:为机器人构建可交互、可训练的世界

来源: Scalabot
   
9月22日,Scalabot发布HERON-Spatial Intelligence,聚焦3D仿真资产生成与4D场景记忆。前者通过URDream从单图生成可仿真、可交互的可动3D资产;后者将多视角、时序观察整合为紧凑空间表征。二者让机器人理解“物”与“场”,并与World Model、CRA协同,推动具身智能在真实世界落地。


机器人真正进入真实世界,不仅需要感知和执行,还需要理解自己所处的空间。

理解环境不仅意味着看见一个物体,还意味着知道物体由什么构成、哪些部件可以运动,也需要把不同时间、不同视角看到的画面联系起来,形成对空间的结构化理解。对于机器人而言,空间不是静止的背景,而是它感知、交互、学习与行动发生的基础。

这正是Spatial Intelligence(空间智能)需要解决的问题。

9月22日,Scalabot正式发布HERON-Spatial Intelligence,重点探索3D仿真资产生成与4D场景记忆两项空间智能能力。前者让现实世界中的物体成为机器人可以理解、操作和验证的数字对象,后者则让机器人将分散的视觉观察组织成连续的空间表征,二者共同构成机器人理解物理世界的基础能力。


3D仿真资产生成负责构建世界中的“物”,4D场景记忆负责组织机器人看到的“场”。HERON-Spatial Intelligence让机器人不仅能够看到空间,更能够建立对空间的结构化理解。

为了与社区共同推动空间智能的发展,相关代码将近期开源,更多细节请参考Scalabot研究博客。


从一张图片,
到一个可以被机器人使用的3D仿真资产


对于机器人来说,一个真正有价值的3D模型,不只是“看起来像”,还需要具备结构、运动关系和物理属性,能够进入仿真环境,用于机器人的训练与交互。

基于这一目标,HERON-Spatial Intelligence提出了URDream方法——一个从单张图像生成可用于仿真的可动3D资产的智能体框架。它的核心,是将真实世界中的物体转化为机器人能够理解、操作和验证的可动3D资产。


自适应建模:针对不同物体,选择合适的生成方式

现实世界中的物体结构各不相同,因此URDream会根据不同部件的特点,自适应选择生成式、参数化或混合建模方法,在保证视觉还原的同时,更好地恢复物体的结构和可交互属性。


验证修复闭环:让资产不仅“像”,还真正“能用”

生成只是开始。URDream还会进一步检查关节、质量、质心、惯量和碰撞等物理属性,并通过静态、运动学和动力学测试发现问题,再根据诊断结果进行修复,形成生成-验证-诊断-修复的闭环。


经验自进化:让建模经验持续沉淀并复用

在不断生成和验证的过程中,URDream将沉淀已经验证有效的决策、修复方式和任务经验,并在新的任务中进行检索和复用,同时根据实际效果动态调整经验权重。由此,3D资产生成不再是一次性的模型生产,而成为一个能够持续积累经验的过程。

URDream方法流程

从一帧画面,
到机器人可以持续利用的4D场景记忆


机器人在真实世界中行动时,看到的不是一张孤立的图片。随着时间推移,它会从不同位置、不同视角持续获得新的观察。

而真正的挑战,是如何将这些分散的信息组织起来,形成对同一环境稳定、可持续利用、包含历史时序信息的空间表征。

但如果简单保存所有历史画面和视觉特征,计算与存储成本也会随之增长。

因此,HERON-Spatial Intelligence探索构建紧凑的4D场景记忆,将视频和多视角观察中的信息持续整合到共享的场景记忆中,并进一步预测点云、相机位姿和深度等空间信息,让机器人能够在不断获得新观察的同时,持续更新对空间的理解。

这意味着,机器人不需要每看到一帧新画面,就重新认识一次环境,而是可以让新的观察不断补充和修正已有的空间记忆。

这样,机器人对环境的理解就不再局限于当下所看到的局部信息,而能够建立一份随着观察持续更新的空间表征。


从“物”到“场”,
构建机器人可理解和交互的数字世界


如果说3D仿真资产解决的是“物”的问题,那么4D场景记忆解决的就是“场”的问题。

机器人不仅需要知道一个物体是什么、由什么组成、如何运动,也需要知道它处在怎样的空间中,以及这个空间如何随着时间发生变化。

3D仿真资产让真实世界中的物体具备结构、物理属性和交互能力,4D场景记忆则将机器人从不同时间、不同视角获得的观察组织起来,形成持续更新的空间表征。

二者结合,就不再只是单独构建一个物体或记录一段画面,而是开始构建一个机器人可以理解、验证并与之交互的数字世界。

通过将4D场景重建得到的空间几何与3D仿真资产进一步结合,可以为机器人提供更加丰富的仿真环境,让真实世界中的物体和场景进入机器人的仿真学习过程。

从这个意义上看,3D让世界中的“物”变得可交互,4D让机器人看到的“场”变得可理解。两者共同构成HERON-Spatial Intelligence面向真实世界建立空间表征的部分。


HERON技术架构:
Spatial Intelligence、World Model
与CRA如何协同


HERON技术架构

此前,Scalabot已陆续发布HERON-World ModelHERON-CRA,分别探索机器人对未来世界的预测能力,以及基于上下文和反馈持续学习、自主行动的能力。

此次发布HERON-Spatial Intelligence,进一步补充机器人理解空间世界的能力,也让HERON围绕空间理解、未来推演与自主行动形成更加完整的技术架构。


Spatial Intelligence负责建立对空间世界的表征:通过3D仿真资产和4D场景记忆,让机器人更好地理解所处的物理环境。World Model负责预演未来:根据当前观察和候选动作,预测可能出现的未来状态。CRA负责行动与学习:结合环境上下文与反馈持续修正行动策略。

三者在底层Data Infrastructure的支撑下相互配合:硬件平台、数据采集、仿真与多源数据持续提供训练和推演所需的数据,而机器人在真实世界中的观察、动作与反馈,又会重新进入数据闭环,不断推动模型迭代。


结语

对于机器人而言,理解真实世界,不只是看见其中的物体和环境,更是能够建立对空间的持续表征,并将这些理解用于预测和行动。

从3D仿真资产生成,到4D场景记忆,再到World Model与CRA,Scalabot正在逐步构建一套面向真实世界的具身智能技术体系:


让世界中的“物”能够被构建,让机器人看到的“场”能够被理解,让未来能够被预演,也让行动能够在真实反馈中持续学习。

当数字世界与真实世界开始形成连接,智能也就不再只存在于模型之中的能力,而能够进入现实、理解现实,并作用于现实。

这正是Scalabot持续构建HERON技术架构的意义。


让智能,在真实世界生长。
 

责任编辑: 云散

相关资讯
写评论