资料来源:AGIBOT(智元机器人)2026 年 6 月 3 日新闻稿、Hugging Face 上的数据集页面,以及 The Robot Report 与 RobotToday 的报道。
机器人拿起一个装着水的纸杯,握得比该用的力气稍微大了一点——纸杯被捏瘪,水洒了一桌子。在大多数产品演示里,这种镜头会被剪掉、重拍一遍。而这里恰恰相反:这次失败被特意保留下来,放进了数据集。这正是它的核心思路。
6 月 3 日,AGIBOT(智元机器人)开源发布了 AGIBOT WORLD 2026 Theme 2:Rich Interaction——一个完全基于机器人与物理世界 100% 真实交互而构建的数据集。这是该项目五个计划阶段中的第二个:第一个关于模仿学习,另外三个目前仍处于锁定状态。
一个在认识世界的机器人
宣传片以一连串问题的形式展开,每一个片段都是机器人用自己的身体去回答的一道物理题。”如果我拉一下会怎样?”——它拉动绳子的两端。”液体是怎么流动的?”——它把饮料倒进杯子。”轻轻一碰会改变什么?”——一个易碎的玻璃杯被轻轻一触就翻倒了。可变形的、易碎的、颗粒状的、液态的、需要双手协作的——这些正是普通机器人最容易栽跟头的全套场景。
与传统数据集的关键区别,新闻稿里说得很直白:AGIBOT 记录的不只是成功的动作,还有那些不完美却极具信息量的物理事件——抓取落空、碰撞、物体跌落、不稳定的接触、液体洒出。目标是还原真实世界物理交互的”完整分布”,而不是一份被精心打磨过的成功样本。这些数据是被刻意采集的:操作员通过遥操作,特意引导机器人去接触各种”高难度”物体,同时 G2 平台同步记录视频、触觉信号、激光雷达、惯性测量单元(IMU)以及每一个关节的状态。
为什么失败比成功更有价值?
整个具身智能行业花了很多年在”干净”的演示上做学习:机器人利落地拿起杯子、平稳地搬动箱子。问题在于,真实世界恰恰是由这些演示里被剔除掉的东西组成的——打滑、笨拙的失手、不稳定的接触。一个只见过成功的模型,根本不知道失败长什么样、是什么手感,也就无从预判和规避。
一次失败的抓取,承载的物理信息比一次成功的更多:你能看到杯子在多大力下被捏瘪、材料如何变形、液体翻倒时如何流动。AGIBOT 收集的正是这”另一面”——一张关于”东西是怎么坏的”的地图。
但真正的故事,藏在”免费”二字里
宣传片以一句口号收尾:“Democratize premium robot data”——让高价值的机器人数据变得人人可得。而这,而非那些洒出的水,才是这家公司真正的一招。
AGIBOT 既不卖这份数据集,也不把它藏进自家模型里。它选择免费送出去——这是对行业里另外两种策略的正面一击。美国的 1X 用它的 World Model Lab 在自家视频和仿真之上构建一个封闭的世界模型。NVIDIA 通过 Cosmos 把模型发出去,但你得在它自家昂贵的 GPU 上才能运行。而 AGIBOT 直接把真实数据本身公开——连失败一起放出来。
这也和它自己的来历相呼应:AGIBOT World 早已被称作机器人领域的”ImageNet 时刻”——而 ImageNet 当年正是一个免费开放的数据集,撬动了整个图像识别领域。它同时也是对我前不久写过的 MotionDisco 的一个耐人寻味的对照:那里的”第三条路”是干脆不采集数据,让机器人自己去发现动作。而这里走的是极端的第一条路:把一切都收集起来、连失败也不放过,然后交给全世界。
它也顺手拆掉了我在关于 AGIBOT 与姚卯青的那篇文章里拆解过的那个老套说法:中国机器人总被用”便宜”来解释。一个开放的失败数据集,关乎的不是价格,而是一种技术与战略上的宣示。
质疑在哪里?
“让数据人人可得”听起来很高尚,但免费送出一个数据集,并不只是慷慨。它是在定标准:如果全世界都用你的数据训练模型、在你的 G2 平台和 GenieSim 仿真器上做验证,你就成了整个生态围着转的那个中心点。ImageNet 当年也是免费的——而这恰恰是它成为人人依赖的基础设施的原因。免费,往往是占据一个位置的方式,而不是放弃它。
第二点:遥操作不等于自主。数据集里的失败是操作员刻意制造出来的,而不是一个自主行动的机器人自己产生的。这是宝贵的数据,但并不意味着 AGIBOT 的机器人已经能自己应对这些情况。
第三点:开放数据集不等于开放模型。数据公开了,但用这些数据训练出来的 AGIBOT 商业系统,依旧是闭源的。它们开放的是原材料,而不是成品。
这意味着什么
当西方玩家还在争论谁的数据更优质、更干净,并把它们锁在各自的技术栈里时,中国第一个公开了关于机器人”如何失败“的数据——而且免费送出。也许,正是这张”失败地图”,最终会比任何一份光鲜的成功数据集更有价值。而对那个把它送出去的人来说,这同时也是更划算的一注。