上个月去南京郊区的自动化工厂找朋友,进门没走两步,脚边的矿泉水瓶没拿稳,滚到了路中间的移动小车前面。
我当时第一反应是伸手去捞——早年见过太多这种AGV小车,只认预设磁条,别说矿泉水瓶,就算放块砖头它也敢往上撞。
结果那台小车慢慢减了速,绕着瓶子画了个小弧,稳稳当当走了自己的路。连方向盘都没晃一下。
朋友在旁边笑,说这就是现在圈内炒得火热的具身智能,不是什么把ChatGPT装到轮子上的花活。
别被营销号骗了:不是大模型装个身体就是具身智能
说实话,我之前看了好多科普,一半都在说「具身智能就是给AI长个手脚」,听得我直皱眉。
原来的AI是什么样?是坐在云端的考官,给它什么题它答什么,所有训练数据都提前输好,它从来不用自己碰这个世界。你问它怎么开门,它能给你列十条步骤,头头是道。但你让它自己开一次,它连把手在哪都摸不对。
具身智能不一样。它的大脑不是飘着的,它长在身体上。
它要自己用眼睛看,用传感器摸,在物理世界里试错,把「知识」变成能行动的经验。门有重有轻,把手有高有低,有的要拉有的要推,这些从来不会写进完美的训练数据集里,得它自己走一遍才懂。

我之前看加州大学一个实验室的演示,训练机器人叠衣服,一开始机器人把衣服揉成一团都打不开,练了几百次,居然能把T恤叠得比我还整齐。这个过程不是工程师输入代码改出来的,是机器人自己一次次试出来的。
这才是具身智能的核心。不是身体,是「在真实环境里自己长出能力」。
为什么现在突然火了?攒了几十年的零件终于凑齐了
其实这个概念一点都不新,早在上个世纪就有人提了。为什么偏偏这两年火起来?
不是资本炒作,是真的攒够了台阶。
第一是传感器便宜了。以前一个能测深度的视觉传感器要几万块,现在消费级的几百块就能拿下,精度还够。机器人能看清周围的东西了,才谈得上调整动作。
第二是大模型把推理能力补上了。原来的机器人只能做固定动作,现在大模型能把人类的指令翻译成一步步的行动,还能处理突发的变量——你说「帮我把桌上的蓝色杯子拿过来」,哪怕杯子被笔记本挡住一半,它也能认出来,还能绕开笔记本拿到杯子,这个放在十年前想都不敢想。
第三是机械执行的精度上来了,关节的反应速度够快,不会你让它停它还往前冲三米。

不过话说回来,现在大部分落地的产品,都还只是初级阶段。工业场景走得最快,毕竟工业场景规则相对固定,变量少,能直接降本。我朋友说他们工厂现在用的这种具身AGV,比原来的固定路线小车,改一次路线的成本降了九成,还能随时调整,不用挖地贴磁条。
民用的就慢很多了。你想啊,家里是什么地方?今天孩子把玩具扔地上,明天你把椅子挪位置,碗有圆的有方的,酱油瓶放的位置每天都不一样,变量比工厂多一百倍。
我们离能做家务的机器人,还有多少路要走?

我前阵子刷到好几个发布会,说再过三年就能推出帮你做饭洗碗的家用机器人,看得我乐了。
演示视频里的确好看,机器人给主持人递咖啡,切水果,动作流畅得不行。转头就有内部的人说,所有东西的位置都是提前标定好的,你把咖啡杯挪十厘米,它就找不到了。
这就是现状。所有拿出来给你看的完美演示,背后都是无数次调试和摆位,真放到乱糟糟的普通人家里,大部分机器人都得懵。
我挺认同一个做机器人的朋友说的话:虚拟世界的AI,拼的是数据量;物理世界的具身智能,拼的是对不确定性的容忍度。阿尔法狗能赢围棋冠军,因为围棋的规则是死的,所有可能性都算得出来。可你要机器人帮你收桌子,桌子上有刚吃剩的半碗米饭,有掉了的葱花,有你手机放那,它不能把你手机扔垃圾桶里,也不能把剩饭蹭你沙发上,这里面的细节,哪是训练数据能覆盖完的?
那是不是说具身智能就是骗局?当然不是。
那天在工厂,我看到那台小车躲开水瓶的时候,突然想到我们自己刚学走路的时候,不也是一次次摔,一次次调整,才学会怎么避开石头,怎么跨过水坑吗?原来AI也得走一遍人类走过的路——从只会动脑想,到能动手做,从活在数据集里,到能走进真实的世界。
前几天下班路过科技园,看到几个年轻人围着一台四足机器人测试,它自己绕开了路边的树根,还稳稳跳过了一个十厘米高的小水沟,那群人在旁边鼓掌,喊得比看演唱会还大声。
其实想想挺感动的。这哪里是测试机器人,这是AI刚学走路啊。路才刚踩出第一个脚印,未来什么样,谁也说不准。但至少,它已经站起来了。
作者|科技
排版|科技
审核|乐乐