按出货量计算的全球最大人形机器人厂商智元(AGIBOT),发布了一段视频,正式推出 AGILE(AGIBOT Generative Intelligent Locomotion Engine)——一款将”感知”与”运动”融合进同一套系统的全新生成式基础模型。
在这段演示中,智元 X2 全程自主完成了一系列动作(1 倍速,无慢放、无剪辑)。这些动作,放在上一代人形机器人身上,要么根本做不到,要么得靠多个独立的控制模块拼起来完成:
- 躲避飞来的物体——比如被扔向自己的球。
- 上下楼梯,识别不同高度的台阶(画面里清楚地标着 15、20、25 厘米)。
- 读取脚下表面的几何形状,根据地面起伏调整步态,而不是一脚踩空。
- 搬运重物的同时保持平衡。
为什么这件事值得关注
现代机器人技术里最难的,不是”移动”本身,而是 “看到 → 理解 → 调整动作” 这一整个闭环。过去很长一段时间,人形机器人里的视觉和运动控制其实是两套独立系统:一套处理画面,一套把画面转换成指令,还有一套负责平衡和步态。每一个接口,都是潜在的故障点。
AGILE 想做的,是把这些系统合并为 同一个基础模型——就像大语言模型在一个统一的空间里”理解”文字一样。这正是业界所说的”具身智能”(embodied AI)。这种”统一的大脑”思路,Agility Robotics 此前在 一篇关于”家用人形机器人到底何时能实现”的纲领性文章 中也提到过,被列为真正自主必须具备的条件之一。
智元这段演示,并没有回答”在镜头之外,这套系统到底有多稳定”的问题——这个问题目前还没有任何一家公司回答得了。但作为技术发展的方向,它是一种回应——回应近期业内对那些”看起来很自动,其实是把戏”的演示的批评:真正的自主,应该是被”内置”进系统,而不是用几个控制器临时拼出来的。