机器人终于会“睁着眼走路”了:踩球、跳绳、抢箱子,全靠一双眼睛

j
jxgzhc
53分钟前 3 分钟阅读

智元灵犀X2人形机器人 AGILE2.0感控一体模型

机器人站上滚动的瑜伽球,稳稳往前挪。

旁边两个机器人抡起长绳,它找准时机,一跃而入,又跳出来。

搬箱子的时候,一个搬起,另一个伸手就打掉,然后自己乖乖捡起来,叠好。

这不是杂技团开场,是智元机器人最新发布的测试短片《杂技BOT》。

9月9日,智元放出AGILE2.0感控一体模型。名字很拗口,意思很直白:让机器人“边看、边想、边动”。

机器人会看,但一直“看不会动”

机器人早就装了摄像头,看得见世界。难的从来不是“看见”,是“所见即所动”。

人不一样。人眼抓着画面,大脑顺手预判,身体跟着就动,一气呵成。

机器人是拆开的:相机先拍一张,AI再算一会儿目标在哪,最后电机才动。你说它慢吗?电机是毫秒级的。

可坏就坏在“时间差”。

视觉信号还没传到位,电机已经动了。信号滞后,身体乱动,结果就是抖、晃、摔。越是在极限平衡、高速交互、精细操作的时候,越容易掉链子。

这就是困扰人形机器人多年的老毛病——“所见非所动”。

这次的狠招:把中间环节全砍了

过去做机器人,是一层一层的流水线:感知一个模块,规划一个模块,控制一个模块。每层转译一次,就多一分延迟。

AGILE1.0把感知和运动打通了,但还得顾头顾尾。

AGILE2.0更狠,直接端到端:眼睛看到的东西,不转手,直接变成全身动作指令。

环境观测、地形理解、全身控制、手上操作,全部揉进一个闭环里。没有中间商,也就没有延迟。

于是有了视频里那些看着夸张、其实特考验功夫的活:踩球走、跳长绳、双人抢箱子。研发团队说了,练杂技不是开马戏团,是让机器人去硬刚真实世界的“不确定性”。

为什么这很重要

因为现在的机器人,大多只会在“安排的明明白白”的环境里干活:地上没杂物,光线稳定,路线固定,一切按脚本走。一旦有人突然走过、有东西挡路、环境变了,它们就容易当场傻掉。

AGILE2.0想解决的,恰恰是这种“意料之外”。人机共存、多机配合、动态干扰,这些都不是演习,是真实工厂里天天发生的事。

智元说,这套东西能适配动态扰动、人机共存、多机协同的真实复杂场景,还降低了机器人在真实世界里的定制开发代价。

说白了,就是离“能干活”更近了一步。

泼一盆冷水

但别急着吹。

端到端模型,胃口很大,对数据、算力、安全冗余的要求一个比一个高。任何一次“眼脑手”不同步,任务就可能失败。

展示片里练的是杂技,真到了产线,一天8小时连轴转,还能不能这么稳,那是另一回事。

具身智能要真正“干活”,还得在真实产线里经受长期磨练。今天这一步,是漂亮的一步,但路还长。

机器人的“眼睛”和“身体”,终于开始试着同频了。

这个方向,值。