“中国版Index”觅蜂派来了:打开真实世界的数据闸门,补上具身智能最稀缺的数据
9月23日,觅蜂科技发布全球首个全品类高质量物理AI数据众包平台“觅蜂派”。用户领任务后佩戴MEgo设备,在真实场景完成操作即可获报酬,成为“机器人训练师”。平台覆盖22大类场景、5000多个任务,数据经治理分级后用于具身模型训练,内测注册用户达2万人。
人人皆可为师。
9月23日,觅蜂科技正式发布全球首个全品类高质量物理 AI 数据众包服务平台“觅蜂派”。

下载该应用后,用户可领取数据采集任务,佩戴 MEgo 设备在零售、仓储、制造、家庭等真实场景中完成指定操作,并按照有效时长获得相应报酬。
采集的数据经觅蜂治理、分级后,将用于具身模型训练,并进一步服务机器人在千行百业的真实部署。
觅蜂派亦被业界视为“中国版 Index”。今年8月,Figure 发布 Index,通过向全球用户付费采集真实任务视频,来构建多样化训练数据集。
同样是把众包模式引入具身数采,二者不同之处在于,觅蜂派面向的是更广泛的行业需求——服务不同模型厂商、机器人企业和数据采购方,根据客户需求组织数据生产,并将处理后的数据作为服务对外交付。
这也意味着,觅蜂派需要处理更复杂的数据需求:服务对象越多,需要覆盖的行业、任务和长尾场景越广;众包规模越大,对采集标准、数据治理和稳定交付的要求也越高。
觅蜂派真正值得关注、拆解的,也正是“全品类”和“高质量”两个关键词。
让日常经验成为机器人“教材”
如果把具身智能过去三年的发展压缩成一条曲线,可以看到一个越来越清晰的趋势:行业从“开发态”逐步迈入“部署态”,机器人从实验室走向真实场景。
要实现这一转变,数据无疑是绕不开的瓶颈。
但具身模型的“先天条件”,远不及拥有海量文字语料的大语言模型。抓起杯子、拧开瓶盖、折好衣服,这些每天重复无数次的动作,至今仍没有形成可以直接用于训练的大规模数据。
具身模型首先要解决的,是如何把现实世界中的交互行为持续转化为数据。
行业此前较为通行的解法是真机遥操——人通过手柄、VR 设备或其他控制系统操纵机器人,把一个个任务“示范”给模型。这类数据与机器人本体高度对齐,训练价值较高,至今仍然具有重要作用,但短板也很明显:采集速度受到机器人数量、操作人员和场地约束,硬件、人力与运营成本也会随着数据规模同步增加。
今年以来,具身智能行业开始探索更多样的数据来源,当下逐渐成为共识的数据分工是:无本体采集拓展规模与场景,真机遥操提供贴近本体的数据,真实部署帮助模型持续修正。
至于无本体数据要做到多大规模,业界普遍认为,如果要实现具身 AGI,需要的数据至少要从百万小时扩展为亿级小时。
一百万到一亿,显然难以通过已有模式线性复制,需要一种“降维打击”的方式。
觅蜂派、Index 所采用的众包模式,则是一种有效放大数据产能的杠杆。
Figure 公布的 Helix 2.5 实验已经证明了众包数据的价值:在30套陌生住宅中,不采数据、不额外训练,Index 的预训练让零样本成功率从9%提升至56%。
觅蜂派沿循相同方向,希望让更广泛的人群加入具身数据的生产与采集。
对用户而言,担任“机器人训练师”的门槛并不高:不需要理解机器人算法,也不需要掌握编程,只需要按照任务要求佩戴 MEgo 设备,在熟悉的工作和生活环境中完成操作。
对于仓储、物流、零售、制造等行业的劳动者而言,其中不少采集任务与原本熟悉的工作场景高度重合,使既有经验能够进一步产生数据价值。
在为期一个月的内测期间,觅蜂派注册用户数达2万人,累计产生1.3万份采集任务提交。首批参与者来自不同年龄和职业,他们开始把日常劳动与专业技能转化为机器人训练数据。
例如,42岁的网约车运营人员李国英第一次戴上觅蜂 MEgo 数采设备,记录浇花、擦玻璃、整理桌面和文件的过程。大约15分钟后,她将数据上传至觅蜂派 App,通过审核后获得任务收益。此后,她开始利用下班后的时间,在做家务时完成采集。“把生活兼顾了,还能有一份额外收入,是双倍开心的事情。”她说。
机器人训练师记录的也不只有日常劳动,还包括一些具有传承价值的传统技艺。仁昌顺苏式糕点制作技艺传承人陆小星说:“把这些数据记录下来,上传给机器人学习,打开了我对传承的新思路。”通过采集,揉制、包馅、压模等动作及其力度、节奏得以被记录,为非遗技艺留下新的数字载体。
觅蜂希望,当越来越多真实经验进入模型,机器人能够逐步承担更多重复、危险的工作;一些原本依赖人与人之间长期传授的技艺,也有了新的火种。
“全品类”底气从何而来?
觅蜂派与 Index 都以众包方式扩大数据供给,但在数据如何被使用、最终服务于谁的问题上,两者并不相同。
Index 围绕 Figure 自身的模型训练需求建立数据闭环,觅蜂派则面向不同模型厂商、机器人企业和数据采购方,根据客户训练需求组织数据生产,并将处理后的数据作为产品与服务对外交付。
从服务单一模型体系转向服务多个客户,增加的不只是需求数量,还有场景、任务、数据模态和质量标准的复杂度。
觅蜂派因此需要同时回答两个更现实的问题:数据能够覆盖多广的场景,又能否稳定交付。
其“业界首个全品类高质量物理 AI 数据众包服务平台”的定位,也正是围绕这两个问题展开。
何为“全品类”?一端是中国庞大的产业场景基础,一端是觅蜂牵头推进场景联盟、持续拓展数据入口的生态能力。
中国拥有全球规模最大的制造业体系、密集的物流仓储网络、丰富的零售和服务业态,意味着大量机器人未来可能执行的任务,已经有人在真实环境中反复完成。中国的产业链优势,也以一种更直接的方式转化为物理 AI 数据优势。
发布会现场,觅蜂宣布发起“场景数据联盟”,联合场景方、采集网络、机器人及模型企业,推动场景需求、数据采集、模型训练和落地验证形成闭环。
联盟首批成员覆盖零售商超、酒店文旅、餐饮服务、养护院、智慧生活、医疗健康、地产制造和城市物业等领域,包括东呈酒店、中旅集团、华驿酒店、陈香贵、普善养护院、上海德济医院、正荣集团、龙旗科技、海天瑞声、张江集团等50余家企业和机构。
据觅蜂披露,觅蜂派覆盖22大类场景、5000多个任务和50000多个真实环境,具体场景包括物流、仓储、住宿服务、教育、养老照护、餐饮、零售、公共服务、办公、汽车服务、医疗、建筑施工、交通出行、农业生产、文旅等。
这些场景既包括取放、整理、搬运等通用操作,也包含装配、检修、照护等专业任务,可为机器人训练动态环境理解、精细动作控制、连续流程执行、风险判断和安全交互等能力提供数据。
从这个角度看,“全品类”并不只是任务列表足够长,更重要的是平台能够持续进入不同产业环境,根据模型需求动态组织数据生产。
用户规模决定数据可以做多大,产业链和场景网络则决定数据可以做多深。
“高质量”标准何以体现?
众包模式能够快速扩大产能,也天然会带来质量控制问题。
当前一些第一视角数据采集会要求参与者放慢动作、保持手部持续可见,并按照相对固定的流程执行,因为这类数据更容易被现有算法解析。
但这种方式也存在一大争议:当人开始迁就算法,真实世界中原本存在的快速运动、遮挡、自然纠错和非标准操作会随之减少,模型最终看到的行为分布也可能被人为收窄。
容易处理,并不天然等于训练价值更高。
觅蜂对“高质量”的定义,一方面是关注真实行为能否被高质量设备准确记录。
使用觅蜂派采集数据,用户将搭载觅蜂自研的 MEgo 无本体采集设备。该设备采用行业首创的多视角、多模态,300°全景加腕部特写,记录整体环境与手部操作;空间上,三维触觉配合毫米级轨迹重建,时间上,全通道硬件级同步、亚毫秒级对齐,尽可能减少视觉、触觉和姿态之间的偏差。
同时,觅蜂构建了 MEgo Engine 数据处理基础设施,覆盖数据处理、感知、标注和质量评估等环节,并通过高精度位姿重建与动作映射,将真实世界中的手部、身体、头部、机器人末端及环境信息转化为统一的空间数据。
当前,2 万套 MEgo 产品已陆续进入家庭、办公、零售、生产、餐饮等真实场景,累计采集有效数据达到百万小时。
另一方面,则是考验数据能否真正转化为模型能力。
为让海量真实数据能够被高效利用,觅蜂还形成 ManiEval 多维度数据质检与分级体系。ManiEval 从数据类型、任务类型、传感器质量、语义质量、动作质量等多个维度对数据进行评估,并提出“不过滤,只分级”:不同质量、不同特征的数据,匹配不同的模型训练需求,让每一条真实数据都能够找到适合自己的应用场景。
据了解,觅蜂百万小时级无本体数据已开始服务腾讯 Robotics X 实验室、蚂蚁灵波等头部客户,根据不同模型训练需求提供相应的数据产品与服务。
真正判断数据质量的,始终是下游模型是否愿意复购,以及使用之后有多少价值。
这也解释了为什么觅蜂要在此时推出“觅蜂派”。
过去,觅蜂已经完成采集硬件、百万小时数据、MEgo Engine 和头部客户验证。觅蜂派进一步补上的,是社会化的数据生产网络与更广泛的场景入口。
随着具身智能的数据需求从百万小时迈向千万乃至亿级小时,能够持续连接真实场景、响应不同模型需求并保持稳定质量的基础设施,其稀缺性会进一步上升。
觅蜂要做的,正是构建这样一张持续生长的物理 AI 数据网络。
9月23日,觅蜂科技正式发布全球首个全品类高质量物理 AI 数据众包服务平台“觅蜂派”。
下载该应用后,用户可领取数据采集任务,佩戴 MEgo 设备在零售、仓储、制造、家庭等真实场景中完成指定操作,并按照有效时长获得相应报酬。
采集的数据经觅蜂治理、分级后,将用于具身模型训练,并进一步服务机器人在千行百业的真实部署。
觅蜂派亦被业界视为“中国版 Index”。今年8月,Figure 发布 Index,通过向全球用户付费采集真实任务视频,来构建多样化训练数据集。
同样是把众包模式引入具身数采,二者不同之处在于,觅蜂派面向的是更广泛的行业需求——服务不同模型厂商、机器人企业和数据采购方,根据客户需求组织数据生产,并将处理后的数据作为服务对外交付。
这也意味着,觅蜂派需要处理更复杂的数据需求:服务对象越多,需要覆盖的行业、任务和长尾场景越广;众包规模越大,对采集标准、数据治理和稳定交付的要求也越高。
觅蜂派真正值得关注、拆解的,也正是“全品类”和“高质量”两个关键词。
让日常经验成为机器人“教材”
如果把具身智能过去三年的发展压缩成一条曲线,可以看到一个越来越清晰的趋势:行业从“开发态”逐步迈入“部署态”,机器人从实验室走向真实场景。
要实现这一转变,数据无疑是绕不开的瓶颈。
但具身模型的“先天条件”,远不及拥有海量文字语料的大语言模型。抓起杯子、拧开瓶盖、折好衣服,这些每天重复无数次的动作,至今仍没有形成可以直接用于训练的大规模数据。
具身模型首先要解决的,是如何把现实世界中的交互行为持续转化为数据。
行业此前较为通行的解法是真机遥操——人通过手柄、VR 设备或其他控制系统操纵机器人,把一个个任务“示范”给模型。这类数据与机器人本体高度对齐,训练价值较高,至今仍然具有重要作用,但短板也很明显:采集速度受到机器人数量、操作人员和场地约束,硬件、人力与运营成本也会随着数据规模同步增加。
今年以来,具身智能行业开始探索更多样的数据来源,当下逐渐成为共识的数据分工是:无本体采集拓展规模与场景,真机遥操提供贴近本体的数据,真实部署帮助模型持续修正。
至于无本体数据要做到多大规模,业界普遍认为,如果要实现具身 AGI,需要的数据至少要从百万小时扩展为亿级小时。
一百万到一亿,显然难以通过已有模式线性复制,需要一种“降维打击”的方式。
觅蜂派、Index 所采用的众包模式,则是一种有效放大数据产能的杠杆。
Figure 公布的 Helix 2.5 实验已经证明了众包数据的价值:在30套陌生住宅中,不采数据、不额外训练,Index 的预训练让零样本成功率从9%提升至56%。
觅蜂派沿循相同方向,希望让更广泛的人群加入具身数据的生产与采集。
对用户而言,担任“机器人训练师”的门槛并不高:不需要理解机器人算法,也不需要掌握编程,只需要按照任务要求佩戴 MEgo 设备,在熟悉的工作和生活环境中完成操作。
对于仓储、物流、零售、制造等行业的劳动者而言,其中不少采集任务与原本熟悉的工作场景高度重合,使既有经验能够进一步产生数据价值。
在为期一个月的内测期间,觅蜂派注册用户数达2万人,累计产生1.3万份采集任务提交。首批参与者来自不同年龄和职业,他们开始把日常劳动与专业技能转化为机器人训练数据。
例如,42岁的网约车运营人员李国英第一次戴上觅蜂 MEgo 数采设备,记录浇花、擦玻璃、整理桌面和文件的过程。大约15分钟后,她将数据上传至觅蜂派 App,通过审核后获得任务收益。此后,她开始利用下班后的时间,在做家务时完成采集。“把生活兼顾了,还能有一份额外收入,是双倍开心的事情。”她说。
机器人训练师记录的也不只有日常劳动,还包括一些具有传承价值的传统技艺。仁昌顺苏式糕点制作技艺传承人陆小星说:“把这些数据记录下来,上传给机器人学习,打开了我对传承的新思路。”通过采集,揉制、包馅、压模等动作及其力度、节奏得以被记录,为非遗技艺留下新的数字载体。
觅蜂希望,当越来越多真实经验进入模型,机器人能够逐步承担更多重复、危险的工作;一些原本依赖人与人之间长期传授的技艺,也有了新的火种。
“全品类”底气从何而来?
觅蜂派与 Index 都以众包方式扩大数据供给,但在数据如何被使用、最终服务于谁的问题上,两者并不相同。
Index 围绕 Figure 自身的模型训练需求建立数据闭环,觅蜂派则面向不同模型厂商、机器人企业和数据采购方,根据客户训练需求组织数据生产,并将处理后的数据作为产品与服务对外交付。
从服务单一模型体系转向服务多个客户,增加的不只是需求数量,还有场景、任务、数据模态和质量标准的复杂度。
觅蜂派因此需要同时回答两个更现实的问题:数据能够覆盖多广的场景,又能否稳定交付。
其“业界首个全品类高质量物理 AI 数据众包服务平台”的定位,也正是围绕这两个问题展开。
何为“全品类”?一端是中国庞大的产业场景基础,一端是觅蜂牵头推进场景联盟、持续拓展数据入口的生态能力。
中国拥有全球规模最大的制造业体系、密集的物流仓储网络、丰富的零售和服务业态,意味着大量机器人未来可能执行的任务,已经有人在真实环境中反复完成。中国的产业链优势,也以一种更直接的方式转化为物理 AI 数据优势。
发布会现场,觅蜂宣布发起“场景数据联盟”,联合场景方、采集网络、机器人及模型企业,推动场景需求、数据采集、模型训练和落地验证形成闭环。
联盟首批成员覆盖零售商超、酒店文旅、餐饮服务、养护院、智慧生活、医疗健康、地产制造和城市物业等领域,包括东呈酒店、中旅集团、华驿酒店、陈香贵、普善养护院、上海德济医院、正荣集团、龙旗科技、海天瑞声、张江集团等50余家企业和机构。
据觅蜂披露,觅蜂派覆盖22大类场景、5000多个任务和50000多个真实环境,具体场景包括物流、仓储、住宿服务、教育、养老照护、餐饮、零售、公共服务、办公、汽车服务、医疗、建筑施工、交通出行、农业生产、文旅等。
这些场景既包括取放、整理、搬运等通用操作,也包含装配、检修、照护等专业任务,可为机器人训练动态环境理解、精细动作控制、连续流程执行、风险判断和安全交互等能力提供数据。
从这个角度看,“全品类”并不只是任务列表足够长,更重要的是平台能够持续进入不同产业环境,根据模型需求动态组织数据生产。
用户规模决定数据可以做多大,产业链和场景网络则决定数据可以做多深。
“高质量”标准何以体现?
众包模式能够快速扩大产能,也天然会带来质量控制问题。
当前一些第一视角数据采集会要求参与者放慢动作、保持手部持续可见,并按照相对固定的流程执行,因为这类数据更容易被现有算法解析。
但这种方式也存在一大争议:当人开始迁就算法,真实世界中原本存在的快速运动、遮挡、自然纠错和非标准操作会随之减少,模型最终看到的行为分布也可能被人为收窄。
容易处理,并不天然等于训练价值更高。
觅蜂对“高质量”的定义,一方面是关注真实行为能否被高质量设备准确记录。
使用觅蜂派采集数据,用户将搭载觅蜂自研的 MEgo 无本体采集设备。该设备采用行业首创的多视角、多模态,300°全景加腕部特写,记录整体环境与手部操作;空间上,三维触觉配合毫米级轨迹重建,时间上,全通道硬件级同步、亚毫秒级对齐,尽可能减少视觉、触觉和姿态之间的偏差。
同时,觅蜂构建了 MEgo Engine 数据处理基础设施,覆盖数据处理、感知、标注和质量评估等环节,并通过高精度位姿重建与动作映射,将真实世界中的手部、身体、头部、机器人末端及环境信息转化为统一的空间数据。
当前,2 万套 MEgo 产品已陆续进入家庭、办公、零售、生产、餐饮等真实场景,累计采集有效数据达到百万小时。
另一方面,则是考验数据能否真正转化为模型能力。
为让海量真实数据能够被高效利用,觅蜂还形成 ManiEval 多维度数据质检与分级体系。ManiEval 从数据类型、任务类型、传感器质量、语义质量、动作质量等多个维度对数据进行评估,并提出“不过滤,只分级”:不同质量、不同特征的数据,匹配不同的模型训练需求,让每一条真实数据都能够找到适合自己的应用场景。
据了解,觅蜂百万小时级无本体数据已开始服务腾讯 Robotics X 实验室、蚂蚁灵波等头部客户,根据不同模型训练需求提供相应的数据产品与服务。
真正判断数据质量的,始终是下游模型是否愿意复购,以及使用之后有多少价值。
这也解释了为什么觅蜂要在此时推出“觅蜂派”。
过去,觅蜂已经完成采集硬件、百万小时数据、MEgo Engine 和头部客户验证。觅蜂派进一步补上的,是社会化的数据生产网络与更广泛的场景入口。
随着具身智能的数据需求从百万小时迈向千万乃至亿级小时,能够持续连接真实场景、响应不同模型需求并保持稳定质量的基础设施,其稀缺性会进一步上升。
觅蜂要做的,正是构建这样一张持续生长的物理 AI 数据网络。
责任编辑: 云散
