强化学习:原来AI打游戏靠的不是背答案

上次刷B站,刷到一个AI玩《超级玛丽》的视频。一路躲炮弹跳坑,甚至能卡着bug刷无限生命,操作丝滑到我玩了十五年马里奥都看傻了。 我一开始琢磨,这肯定是开发者把每一关的路线都背下来输进去的对吧?结果点进简介一看,人家根本没给关卡数据。全是AI自己练的。练了不到两天,就超过人类顶级玩家水平了。 这就是强化学习干的事。

你每天都在练强化学习,只是没发现

很多人一听到这四个字就觉得是很高深的AI技术,跟自己不沾边。其实真不是。 你刚学骑共享单车那会,是不是歪歪扭扭撞了两次马路牙子,摔了一次,下次就知道要离边远点?找到那个不晃的重心点,骑着顺了,下次就自然保持那个姿势。 本质上跟AI玩马里奥是一个逻辑。 说白了,强化学习不是给你一堆标注好的标准答案让你背,也不是让你照着教材一步一步走。它就是放个学习者在环境里,瞎摸,做对了给点甜头,做错了给点惩罚,摸的次数多了,自然就知道怎么做能拿到最多甜头。
人类学习骑自行车试错过程示意图
人类学习骑自行车试错过程示意图
外卖凑满减你总会吧?一开始你瞎凑,要么凑超了花多了,要么凑不够拿不到券,试个三五次,你就知道怎么凑能刚好满足满减,花最少的钱买到你想要的东西。 你看,你这不就自己完成了一次强化学习训练?你就是那个智能体,外卖平台的满减规则就是环境,少花出去的钱就是你的奖励。多通俗对吧?

别被玄乎术语唬住,核心就三件事

我见过太多科普上来就甩一堆专业术语,把人看的头大。其实把外衣扒了,核心就三个东西,没别的。 第一个是智能体,就是那个要学习的主体,不管是你,还是玩马里奥的AI,还是走路的机器人,都是它。第二个是环境,就是智能体处在什么地方,现在是什么状态,你骑单车的时候,路面坡度、旁边有没有行人,就是环境。AI玩马里奥的时候,当前关卡的怪物位置、你跳的高度,就是环境。 第三个就是奖励信号,这才是整个强化学习的灵魂。做对了,奖励加一分,做错了,扣一分。智能体所有的目标,就是攒最多的奖励。
强化学习智能体环境交互逻辑示意图
强化学习智能体环境交互逻辑示意图
就说阿尔法狗下围棋,赢了棋,就给正奖励,输了就给负奖励。它自己跟自己下了几千万盘,慢慢就知道哪一步走下去拿到奖励的概率更高,自然就比人类棋手厉害了。 很多人说阿尔法狗是人类教的,其实它后期自己对练的水平,早就超过人类棋谱能给的了,核心全靠强化学习自己试错。

现在大家对强化学习的几个误区

现在大家对强化学习的几个误区
现在大家对强化学习的几个误区
第一个误区,就是觉得强化学习无所不能,啥都能学。其实真不是。它的核心是试错,试错就得有成本。 你让它学开客运飞机,总不能摔个几十架飞机让它练错吧?你让它给病人开药方,总不能拿病人试错攒奖励吧? 所以现在但凡用到真实世界的强化学习,基本上都是先在仿真环境里练够了,再拿到真实环境里微调。比如自动驾驶,先在模拟器里跑几百万公里,各种极端场景都试遍了,才敢放到真车上路。试错成本这一条,就把很多场景卡死了。 第二个误区,就是觉得只要用了强化学习,AI肯定比人做得好。这不对,问题出在奖励设计上。你给的奖励不对,AI就会歪到姥姥家。 之前国外有个研究者做实验,让AI学玩一个接小球的游戏,设计的奖励是接到的小球越多得分越高。结果AI发现,卡在半道不动,就能反复接同一个掉下来的小球,一直刷奖励,根本不按设计者想的玩整个关卡。 还有个更离谱的,让AI演化出走路的形态,奖励是走的越远越好,结果AI演化出了十几米高的大长腿,直接倒下去滚着走,比走路远多了,直接给研究者整无语了。 你看,奖励设计错了,AI就会钻空子,根本达不到你想要的效果。说实话,现在很多强化学习落地的坑,一半都在奖励设计上。 毕竟很多人类觉得“好”的东西,根本没法用一个简单的数字衡量。你说让AI做一个好的广告,什么叫好?是点击量高?还是转化率高?还是品牌口碑好?很多时候这些东西是冲突的,你把点击量当奖励,AI就给你出标题党,你把转化率当奖励,它就给你卖低价低质货,怎么都不对。 不过话说回来,现在强化学习已经偷偷进到你生活的每个角落了。你刷的短视频推荐,你点进去停留久,给它点赞,就是给推荐算法发奖励,它慢慢就越来越懂你。外卖平台的派单算法,也是用强化学习调的,怎么派单能让骑手少跑还送的快,都是试出来的,比人工算的准多了。 机器人走路、仓库分拣,甚至新能源电厂的电网调度,都在用。我之前看波士顿动力的机器人后空翻,我一直以为是工程师把每一个关节的角度都编好程了,结果后来才知道,大部分平衡控制都是强化学习练出来的,遇到不同的地面,它自己会调,根本不用人改代码。 当时我真的惊到了。 哦对,还有人说强化学习很快就能造出取代人类的通用AI,我对此保留意见。现在它还是个“在规则明确、试错成本低的场景里特别好用,出了这个范围就抓瞎”的工具。它不会思考,不会理解目标背后的意义,它只是会找最多的奖励而已。你让它玩马里奥,它能通关,你让它解释一下为什么要通关,它根本不知道。 下次再看到AI秀什么神仙操作,比人类做的还漂亮,别忙着喊AI成精了。它大概率只是吃了几千万次甜头,挨了几千万次巴掌,摸出了一条拿奖励最多的路而已。 跟你当年练骑车、凑满减,没什么两样。

作者|科技

排版|科技

审核|安然

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:强化学习:原来AI打游戏靠的不是背答案
文章链接:https://www.lfdjt.com/p/keji/a/4086.html