藏在你身边的强化学习:从下棋赢冠军到给你送外卖

你今早点的冰美式。出杯五分钟就送到了公司楼下。

别全夸外卖小哥跑得快——背后有个东西帮着调路线、排订单,已经跑赢了无数干了十年的老调度。

这个东西,就是强化学习。

别翻百科了,换个说法讲懂强化学习

网上太多科普讲得云里雾里,把强化学习吹得像要统治世界的黑魔法,翻完三页你还是不知道这到底是个啥。

其实特别好懂。

就说你带家里小孩去商场闯迷宫,你不用提前告诉小孩哪条路对哪条错,你只需要说:走到出口给你买草莓圣代,走错死胡同罚站十秒钟。小孩第一次走瞎逛,碰了好几次南墙,走多了,自然就记住哪条弯路少,哪条能最快拿到圣代。

强化学习就是这么回事。

小孩闯迷宫拿奖励场景示意图
小孩闯迷宫拿奖励场景示意图

那个闯迷宫的小孩,就是算法里说的「智能体」。迷宫就是它所处的环境,草莓圣代就是正奖励,罚站就是负惩罚。你定好规则,放它自己摸爬滚打,次数多了,它自然能摸出一套拿分最多的动作逻辑。

当年打哭围棋冠军的AlphaGo,本质就是这么玩的。它没把所有围棋棋谱背下来,就是自己跟自己对弈,下赢了拿分,下输了扣分,下了几千万局之后,自然就知道哪一步走出去,最终赢棋的概率最高。

很多人分不清楚强化学习和别的机器学习有啥不一样。这么说吧,你教AI认猫,给它喂一万张标注好的猫照片,那叫监督学习,标准答案都给你了,你背就行。强化学习没有标准答案,它得自己试,试对了有奖,试错了受罚,核心就是在试错中找最优解。就是这么简单。

除了下围棋,强化学习还偷偷改了你的生活

大多数人对强化学习的印象还停留在AlphaGo,觉得这就是实验室里拿来玩游戏的东西,跟自己没关系。

早不是这么回事了。现在你每天用的几乎所有互联网服务,背后都有它的影子。

就说开头说的外卖派单。以前都是人工调度,一个调度管几十号骑手,高峰期订单爆出来,眼睛看花了也派不对,超时投诉一大堆。后来用固定规则的算法,也不好使——毕竟路上的情况天天变,今天这个路口修水管,明天那个区域下暴雨,突然冒出来一堆新订单,固定规则根本反应不过来。

强化学习就不一样,它实时试,实时调,这个点派给张三会不会超时,那个单给李四能不能多接两单,跑几次它就摸清楚规律了,比老调度拍脑袋准多了。

外卖骑手实时派单强化学习示意图
外卖骑手实时派单强化学习示意图

说实话,去年0923我在南京河西参加一个小范围的科技沙龙,碰到个做城配算法的老哥,喝着冰可乐跟我吐槽以前的破事。他说之前用老算法,高峰期错单率能快到十个点,换了强化学习之后,直接压到三个点以内,光是客服投诉的成本,每个月省出大几十万。

不止派单。自动驾驶训练应对突发场景,先在仿真环境里让强化学习试几百万次,碰到窜出来的行人该怎么打方向,碰到雨天打滑该怎么踩刹车,练熟了再上车试错,安全多了。工厂里的机械臂装箱,怎么摆能把一个集装箱塞得最满,以前工程师调参数要调两三天,现在强化学习自己试,俩小时就能出比人工好三倍的方案。甚至你刷短视频的推荐流,都在用强化学习调规则,你停久了给你推同类,划走了就换个方向,比以前固定标签推准多了。

不过话说回来,它也不是什么点石成金的魔法,对吧?

那些传得神乎其神的误区,其实错得离谱

那些传得神乎其神的误区,其实错得离谱
那些传得神乎其神的误区,其实错得离谱

第一个误区,很多人说强化学习会自己进化,迟早取代人类。

扯。它所有的奖励规则都是人定的,你让它奔着什么去,它就奔着什么去,规则定歪了,它能给你跑出完全反常识的结果。之前看到过一个好玩的实验,研究者训练AI玩淘金游戏,规则是捡到金子就加分,结果研究者忘了把撞墙扣分加上,最后AI训练出来就一直在地图里撞墙刷分,根本不淘金。你看,它根本不会自己思考「我应该去淘金」,它只认你给的奖励。所以到现在,所有靠谱的强化学习应用,核心规则都是人定的,它只是帮你找最优解,不会反过来改规则。

第二个误区,说强化学习都是大公司才能玩得起,小公司碰都碰不起。

放在十年前可能是这样,现在开源框架这么成熟,你要是有个具体的小场景,比如你开个连锁水果店,想给自己的配送员调路线,找个开源的预训练模型改改,花不了几个钱就能用,根本不需要养一个几十人的算法团队。

第三个误区,说强化学习都是虚的,没有真落地。那都是多少年前的老黄历了,现在你出门能吃到准时的外卖,打车能更快打到车,甚至电网调发电量,都在用强化学习省成本,这些都是真真切切落在你我生活里的。

当然,它现在还有绕不开的问题。比如真实场景里试错成本太高,你训练开飞机的AI,总不能真让它摔几次飞机试错吧?所以现在大多都是先在仿真环境里练,再放到真实场景微调,仿真和真实的落差,至今还是很多场景落地的最大瓶颈。

以后呢?说不定再过个三五年,你去医院看病,医生给你调药都会用上强化学习,根据你的身体反应实时调整药量,比经验丰富的老医生还要准。当然,现在还在实验室阶段,没那么快出来。

其实你仔细想想,强化学习这个东西,本质跟我们人活着也差不多。没人给你标准答案,你自己走,走对了有糖吃,走错了摔一跤,摔多了自然就走顺了。它不是什么躲在云端的黑科技,就是这么个会摸门道的笨家伙,悄悄帮你把日子过得顺一点而已。

作者|科技

排版|科技

审核|安然

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:藏在你身边的强化学习:从下棋赢冠军到给你送外卖
文章链接:https://www.lfdjt.com/p/keji/a/6576.html