机器人终于会“睁着眼走路”了:踩球、跳绳、抢箱子,全靠一双眼睛

机器人站上滚动的瑜伽球,稳稳往前挪。
旁边两个机器人抡起长绳,它找准时机,一跃而入,又跳出来。
搬箱子的时候,一个搬起,另一个伸手就打掉,然后自己乖乖捡起来,叠好。
这不是杂技团开场,是智元机器人最新发布的测试短片《杂技BOT》。
9月9日,智元放出AGILE2.0感控一体模型。名字很拗口,意思很直白:让机器人“边看、边想、边动”。
机器人会看,但一直“看不会动”
机器人早就装了摄像头,看得见世界。难的从来不是“看见”,是“所见即所动”。
人不一样。人眼抓着画面,大脑顺手预判,身体跟着就动,一气呵成。
机器人是拆开的:相机先拍一张,AI再算一会儿目标在哪,最后电机才动。你说它慢吗?电机是毫秒级的。
可坏就坏在“时间差”。
视觉信号还没传到位,电机已经动了。信号滞后,身体乱动,结果就是抖、晃、摔。越是在极限平衡、高速交互、精细操作的时候,越容易掉链子。
这就是困扰人形机器人多年的老毛病——“所见非所动”。
这次的狠招:把中间环节全砍了
过去做机器人,是一层一层的流水线:感知一个模块,规划一个模块,控制一个模块。每层转译一次,就多一分延迟。
AGILE1.0把感知和运动打通了,但还得顾头顾尾。
AGILE2.0更狠,直接端到端:眼睛看到的东西,不转手,直接变成全身动作指令。
环境观测、地形理解、全身控制、手上操作,全部揉进一个闭环里。没有中间商,也就没有延迟。
于是有了视频里那些看着夸张、其实特考验功夫的活:踩球走、跳长绳、双人抢箱子。研发团队说了,练杂技不是开马戏团,是让机器人去硬刚真实世界的“不确定性”。
为什么这很重要
因为现在的机器人,大多只会在“安排的明明白白”的环境里干活:地上没杂物,光线稳定,路线固定,一切按脚本走。一旦有人突然走过、有东西挡路、环境变了,它们就容易当场傻掉。
AGILE2.0想解决的,恰恰是这种“意料之外”。人机共存、多机配合、动态干扰,这些都不是演习,是真实工厂里天天发生的事。
智元说,这套东西能适配动态扰动、人机共存、多机协同的真实复杂场景,还降低了机器人在真实世界里的定制开发代价。
说白了,就是离“能干活”更近了一步。
泼一盆冷水
但别急着吹。
端到端模型,胃口很大,对数据、算力、安全冗余的要求一个比一个高。任何一次“眼脑手”不同步,任务就可能失败。
展示片里练的是杂技,真到了产线,一天8小时连轴转,还能不能这么稳,那是另一回事。
具身智能要真正“干活”,还得在真实产线里经受长期磨练。今天这一步,是漂亮的一步,但路还长。
机器人的“眼睛”和“身体”,终于开始试着同频了。
这个方向,值。