藏在你生活里的强化学习,比你想的更接地气

我昨天在老门东排队买鸭油酥饼,站在风口吹了十分钟,老板翻饼的手一刻没停,哪块翻,什么时候起锅,全凭感觉,闭着眼都不会错。没人教过他这套标准流程对吧?都是炸了十几年,炸糊了减时间,炸嫩了加时间,慢慢攒出来的手感。 这就是强化学习啊。 你没听错,不是只有实验室里的阿尔法狗才配叫强化学习,我们每个人每天都在用。

别被公式吓退,你打游戏的时候就在练

很多人一看到这五个字,第一反应就是翻出去找论文摘要,一堆花里胡哨的公式,看两行头就大了,直接默认这是大佬玩的东西,跟我没关系。 说实话,根本没那么复杂。 换个说法你就懂了:做错了扣分,做对了加分,多来几次就记住怎么拿高分了。就这么简单。 你打MOBA游戏,对线躲对面技能,第一次被打中死了,知道这个距离要往侧边闪,第二次再中再调,打个几十局,你闭着眼都能走出不被打中走位。这不就是实打实的强化学习过程? 核心从来不是公式,是「试错-反馈-调整」的循环。
MOBA游戏玩家对线躲技能操作示意图
MOBA游戏玩家对线躲技能操作示意图
学骑自行车摔了两次,你就知道往哪边拐平衡不会倒,对吧?南京老骑手骑电动车走新街口中山路,走三次就记住哪段非机动车道有坑,哪段红灯短能抢两步,这都是一次次试错出来的结果,本质跟AI练下棋没区别。 区别只是,我们的脑子天生自带这套算法,不用写代码而已。

AI的强化学习,和你骑车到底差在哪

差在试错的速度。 人试一次错,要花几秒钟,运气不好还要付代价,摔个跤蹭破点皮,撞个车修钱几百块。AI呢?一千块显卡跑起来,一秒钟就能试几十万次错,不眠不休连跑一个礼拜,相当于人类练几辈子的量。 当年DeepMind玩雅达利游戏,一开始就是乱按按键,什么都不懂,玩个几十万把,分数直接甩了人类顶尖玩家一大截,靠的就是这个堆试错的本事。
AI强化学习训练自动驾驶虚拟模拟场景图
AI强化学习训练自动驾驶虚拟模拟场景图
不过话说回来,现在很多自媒体吹强化学习无所不能,我就得泼点冷水。它有个绕不开的死穴,只要试错成本高,它就很难玩得转。 你让AI练自动驾驶,总不能真让它开着车在北京三环路撞个几百万次吧?别说赔不起,出人命谁担责?所以现在都是先在模拟软件里跑几百万次,摸出个大概规律,再拿到真实道路上慢慢调,就是为了把试错成本降下来。 还有很多人搞混,说强化学习就是深度学习,不对。几十年前强化学习的框架就有了,那时候深度学习还没火呢。只是最近十几年,深度学习能处理图像文字这种复杂的输入了,跟强化学习绑在一起,才一下子火出了圈。现在大家说的强化学习,基本都是深度强化学习,这话没错,但别把根搞混了。 你现在用的大语言模型,为啥说出来的话这么顺,比早几年的聊天机器人顺多了?很大一个原因就是用了RLHF——人类反馈的强化学习。说白了就是,AI生成一段话,人类给打个分,说这个说的好,那个说的不对,AI再照着高分的方向调,一遍一遍改,就越来越像人话了。你看,这么大的模型,核心逻辑还是那个做错扣分做对加分,没变过。

哪些地方,它真的能派上大用场

哪些地方,它真的能派上大用场
哪些地方,它真的能派上大用场
现在圈里很多人拿强化学习当概念炒,好像什么项目套上这个词就能涨估值,我是觉得没必要。好多场景,用规则用普通机器学习就能解决的好好的,犯不着上这个。 就像那个卖酥饼的老板,做了十几年,手比什么AI都准,你整个AI在那翻饼,反而多余。 但有些地方,它真的是能解决老办法解决不了的问题。 比如工厂里的机械臂抓取,原来要让机械臂拿不同形状的东西,工程师得给每个形状写一遍控制程序,改来改去要半个月。用强化学习呢?让机械臂自己在那试,抓掉了扣分,抓住了加分,试几个小时,它自己就会抓奇形怪状的东西了,省多少事。 还有你每天刷的短视频推荐,其实背后早就用上强化学习了。你点进去看停留十分钟,就是给推荐系统一个正奖励,你一划就走,就是负奖励,它不停根据你的反馈调下一次推什么,所以你才越刷越停不下来——说白了,它摸透你的喜好,就是试错试出来的。 我跟南大计算机系的朋友聊天,他说现在很多人往新药研发里堆强化学习,这个方向我倒是挺看好。原来研发一款新药,找合适的分子结构,科学家要试好几年,一次试验成本几百万上千万。现在可以先在模拟环境里,让强化学习去找可能有用的结构,找对了再做实体试验,能省不知道多少时间和钱。这种就是典型的,试错在虚拟环境里成本几乎为零,成了之后再落地,刚好踩中了强化学习的优势。 当然,现在还有很多问题没解决。比如怎么设计奖励函数,很多时候你想要的结果没法用一个数字说清楚,比如你让AI设计一个好看的海报,什么叫好看?一百个人有一百个说法,你没法给每一张海报打一个准确的分,AI就没法学。这还是现在绕不开的坎。 说白了,强化学习从来都不是什么从天而降的黑科技。它就是把我们人类几十万年来进化出来的学习方式,搬到了计算机里,把试错的速度放大了几万倍而已。 今天下班绕开路上那个新挖的坑的时候,你不妨想想,你刚才刚刚完成了一次属于你自己的强化学习更新。 挺好玩的。

作者|科技

排版|科技

审核|知知

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:藏在你生活里的强化学习,比你想的更接地气
文章链接:https://www.lfdjt.com/p/keji/a/5517.html