智元开源AGIBOT WORLD 2026第三期:强化学习数据集,让机器人从经验中学习

   
智元发布 AGIBOT WORLD 2026 第三期开源数据集,包含上万条示教、部署、人工纠正轨迹,配套细粒度标注,面向真机强化学习研究,已在 Hugging Face 开放获取。
导言
AGIBOT WORLD 2026 是首个覆盖具身智能全域研究的开源数据集,基于丰富真实场景,围绕五大具身领域研究主题构建,每个主题均设有专属采集方法与精细化的标注体系,以精准支持不同细分领域研究者的需求。继模仿学习多样交互两期数据集之后,本期进一步面向强化学习,开放机器人从专家示教、真实部署到人工纠正过程中产生的多类真实交互经验数据。
 
正文
过去几年,大规模专家示教数据推动机器人模仿学习快速发展,帮助机器人学习“面对一个任务应该怎么做”。 但进入真实环境后,机器人产生的数据并不都是标准答案:有成功,也有失败;有偏差,也有恢复;有自主执行,也有人类接管。 这些真实交互记录了模型的能力边界、失败状态、有效行为和纠正过程,是专家示教无法完全提供的经验数据(Experience Data)。 因此,机器人不仅要学习别人如何成功完成任务,也要学会利用自己与真实世界交互产生的经验。
为此,智元正式发布 AGIBOT WORLD 2026 第三期开源强化学习数据集。该数据集覆盖了从示教到部署的各个阶段:专家示教提供任务的标准示范;人类在环纠正轨迹记录了模型执行犯错时人类的接管与纠正;部署推理轨迹(Rollout)则有模型真实部署执行产生的成功与失败。在此基础上,数据集进一步标注了进度、错误、成功与干扰等关键信息。研究者可以据此训练不同维度的奖励模型(Reward Model),将轨迹级的成败结果细化为过程反馈,为真机强化学习的研究提供可复用的数据基础。
本期数据集首批开源数据覆盖11430条轨迹,包含1024条成功Rollout轨迹、1369条失败Rollout轨迹,并提供丰富的细粒度标注。我们希望以此降低真机强化学习中积累执行反馈的成本,让不同团队在同一批真实轨迹上复现实验、比较方法,并把分散在各场景中的经验沉淀为公共资产。
 
AGIBOT WORLD 2026第三期:真机强化学习
项目主页:agibot-world.com
开源地址:huggingface.co/datasets/agibot-world/AgiBotWorld2026
 
从示教到部署,采集机器人的实战轨迹
本期首批数据集聚焦工业与家居等真实场景,设计网线插接、钥匙开门等14类交互任务,覆盖精细操作、复杂长程和强接触等不同任务类型。
数据采集贯穿从示教、部署到纠正的三个阶段:
  • 专家示教轨迹,由人类操作员完成任务,记录任务在真实环境中的标准执行轨迹。
  • 部署推理轨迹,模型进入真实场景执行任务,成功和失败结果均被记录。成功rollout展示策略已经具备的能力,失败Rollout则暴露模型在不同任务阶段的能力边界。
  • 人类在环纠正轨迹,模型首先自主推理并执行任务,人类操作员在策略出现偏差时进行接管纠正。数据同时保留接管前的模型行为、接管时机、接管后的纠正动作。
这三类轨迹共同构成一条完整的数据链路:专家示教告诉模型任务应该怎样完成,人类在环纠正轨迹记录了模型如何被纠正,Rollout轨迹检验模型独立执行时究竟做得怎么样。

以上三张图,排版左右滑动


 
从过程到结果,标注真实执行中的关键反馈
强化学习需要的不是“机器人做了什么”的笼统记录,而是“这一步做得怎么样”“任务推进到哪一步”的精细反馈。
本期数据集围绕真实执行过程,对成功、错误、接管、干扰等关键状态进行细粒度标注;在此基础上,用户可进一步结合标注信息,识别风险与错误恢复过程。成功帧提供明确的任务达成信号,错误、干扰和风险区间帮助模型识别异常与危险状态,接管区间记录人工介入时机,错误恢复区间则提供从错误到恢复的真实过程。

丰富标注


以首批开放的近万条轨迹为基础,本期数据集共包含98159个子任务区间标注,每个子任务均带有完成状态标注;同时标注了26493段干扰片段、5795段错误状态,以及10684段人工接管。
这些细粒度标注可以进一步转化为强化学习所需的反馈信号,用于训练奖励模型、价值模型,支持任务进度预测、成功检测、错误识别、风险预警、接管提示以及错误恢复等研究。

数据在强化学习的应用


让机器人从每一次成功与失败中进步
对具身智能而言,真正的技能从来不是复刻标准化动作,而是在动态真实环境中感知反馈、自主纠错、持续优化。
模仿学习让模型从专家示教中学习任务,而强化学习则提供了另一条优化路径:利用真实执行反馈,判断哪些行为推动了任务、哪些状态存在风险,并将这些判断转化为可供训练的奖励信号。高质量的真机轨迹与过程标注,是开展这类研究的重要基础。
AGIBOT WORLD 2026 第三期真机强化学习数据集,完整留存每一次物理接触、每一处执行偏差、每一轮人工修正,让真机强化学习拥有高质量、可复用、闭环式训练底座,让机器人不仅要从成功示范中学会“怎么做”,还要从错误、风险和人工纠正中学会“如何做得更好”。加速行业从 “实验室演示” 走向规模化产业部署,迈进具身智能生产力新时代!
 
(全文完)

 

责任编辑: 流过

相关资讯
写评论