当机器人能摔疼自己:具身智能到底在玩什么新花样

上个月赶去南京看科技展,挤了半小时才蹭到具身智能展台跟前,本来以为又是提前录好演示走个过场,结果刚站定就出了小意外。

机器人要给前排观众递矿泉水,走到台边被一根散落的延长线绊了一下,车身晃了两晃,没停,没卡死,居然自己侧身调整重心绕了过去,稳稳把水放在了观众手里。

当时全场低低哦了一声。我站在第一排,莫名起了点鸡皮疙瘩。

别翻百科了,说句人话

你听多了大模型,都知道那是存在服务器里的大脑,你问它什么它都能答,但它从来没亲手摸过勺子,没踩过雨后的水坑,它对世界的所有认知都来自网上攒的文字和图片。

具身智能呢?简单说就是给AI长出自己的手脚和感官,真的站在这个物理世界里,自己摸爬滚打攒经验。

南京科技展具身智能机器人递水互动场景
南京科技展具身智能机器人递水互动场景

很多人对它最大的误解就是给大模型装个机械身体就是具身智能。真的不是。

十年前就有能上菜的餐厅机器人,那是提前编好路径,走哪停哪卡在哪,全都是定死的,你把个凳子放它路上,它就只会滴滴叫停在原地等死。

具身智能不一样。它能自己看,自己改,遇到没见过的障碍,它能自己试错找办法。就刚才绊电线的那一下,没人教过它遇到散落的延长线该怎么动作,它身上的传感器感受到重心偏移,自己调整了步伐,这才是它的核心。

说实话,这个变化真的戳人。原来AI都是我们整理好数据喂给它,它坐在那学。现在它能自己跑进真实世界,自己找问题,自己攒经验。

为什么偏偏是现在火了

其实这个概念提出来快半个世纪了,怎么就这两年突然挤到风口跟前了?说穿了就是三件事刚好凑齐了。

第一是大模型的通用理解能力上来了。原来AI看东西就是识别一堆像素,你说“把桌上那杯蓝色的水拿给我”,它得你给它标好坐标写好程序才敢动,现在大模型能把看到的颜色、摸到的硬度、听到的指令串起来,听懂人话里的模糊需求,不用每次都给精确指令。

第二是传感器做得够便宜够小了。原来好一点的力控传感器,一个就要十几万,也就实验室敢玩,现在消费级的做得又小又灵敏,能给机器人全身上下装一堆,碰到棉花能感受到软,碰到砖头能感受到硬,不会一拿就把杯子捏碎。

第三是仿真训练技术上来了。原来训练一个机器人走路,真摔个几百次,机械臂都摔烂了,成本高到吓人,现在百分之九十的训练都能在虚拟仿真环境里跑完,再把模型导到实体机器人上,省了太多钱和时间。

具身智能机器人虚拟仿真训练环境界面
具身智能机器人虚拟仿真训练环境界面

不过话说回来,也就是刚凑齐个起点,好多坎还跨不过去。

别被PPT吹晕了,坑还多着呢

别被PPT吹晕了,坑还多着呢
别被PPT吹晕了,坑还多着呢

前阵子翻了好多创业公司的融资稿,开口就是“两年内打进普通家庭”,闭口就是“颠覆家政行业”。挺扯的。

现在最大的坎,就是虚拟和真实之间那层看不见的鸿沟。说白了就是,你在仿真里训练一万次,走一万次平路,拿到真实世界,今天太阳大玻璃反光,明天地面刚拖完有点滑,机器人直接就懵在原地动不了。

它学不会人类那种天生的直觉。比如拿半杯满的水,人类不用想就知道用多大劲,走多快,机器人得算半天,劲大捏碎,劲小掉地上,错一次还得重新学。

还有算力和成本的问题。现在一台能做基础互动的具身智能原型机,成本少说几十万,你会花几十万买个帮你拿快递的机器人回家吗?就算你愿意,现在稍微复杂点的动作,推理要的算力普通家用电脑根本带不动,得连云端,网稍微卡一点,动作就慢半拍,你能忍?

最有意思的还是常识问题。网上有个挺火的测试,让机器人把桌子上的垃圾捡了,它直接连着垃圾带着桌子一起抱起来了。因为它只听懂了“捡垃圾”这个指令,根本不知道桌子是不能动的啊。这种细碎的常识,你说要怎么教给它?数不清的细节,根本列不完。

我之前跟那个展台的工程师聊天,他说他们团队熬了大半年,最骄傲的突破就是机器人能走不平的草地不摔跤。放在五年前,这想都不敢想。

你看,科技进步其实从来都不是发布会台上那句“实现了通用具身智能”的噱头,都是这么一件一件碎小事堆出来的。

我倒不觉得具身智能明天就能取代谁,颠覆什么,它只是把AI从屏幕里拉出来了,从你的手机电脑里,走到了你踩的这片水泥地上,以后说不定能帮你捡沙发底下的耳机,帮你关火,帮你拿高处的瓶子,这个方向是对的,就是得慢慢走。

哪天你逛展,碰到个机器人绊了一下,自己晃两下站稳了继续走,别惊讶。那就是具身智能,真的站在你面前了。

作者|科技

排版|科技

审核|满满

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:当机器人能摔疼自己:具身智能到底在玩什么新花样
文章链接:https://www.lfdjt.com/p/keji/a/8655.html