从赢下围棋冠军到帮药厂造药,强化学习没你想的那么玄

上个月在老城咖啡馆蹭网写东西,邻座两个穿帽衫的学生拍桌子吵架。一个说强化学习就是AI圈割韭菜的炒概念,说白了就是让机器堆算力瞎试,有什么了不起?另一个说你懂个屁,阿尔法狗赢李世石靠的就是这个,你行你上啊。 我捧着冰美式差点笑喷,这不就是大多数人对强化学习的印象?要么神化成能造出天网的黑科技,要么踩成全靠碰运气的幌子,没几个人能说清它到底是什么,能用来干嘛。

你玩消消乐的时候,就已经在用强化学习的思路了

别上来就给我甩马尔可夫决策过程、价值网络这些术语,我跟你讲,强化学习的核心从来不是算力,是试错的逻辑,这玩意儿根本不是AI发明的,人类从学会走路开始就在用。 你小时候学骑自行车,你妈不会把每一步的动作都给你标好标准答案。你往左歪摔了一跤,疼得嗷嗷叫,记住下次歪了要往右拧车把;你找到平衡点能骑三米,风从耳边吹过就是奖励,摔进路边草丛就是惩罚。摔十次八次,你就能骑着车去买冰棒了。 这个过程,和强化学习的逻辑一模一样。
人类学骑车试错过程与强化学习框架对比图
人类学骑车试错过程与强化学习框架对比图
和我们常听的监督学习不一样,监督学习是老师把所有题目的答案都写好,让机器照着背,遇到新题按套路套就行。可强化学习没有标准答案,它只知道自己要什么结果,怎么达到得自己一步步摸,走对了拿奖励,走错了受惩罚,玩得多了自然就摸出来最划算的走法。 说实话,这才更像我们真实的生活啊,对吧?谁这辈子每件事都有人给你标准答案?考大学选专业,找工作选行业,甚至找对象,不都是走一步看一步,试错试出来的?

网上吹的那些神操作,一半都藏着你不知道的误区

说到强化学习,大部分人第一反应就是阿尔法狗下围棋,最多再加个打游戏,很多自媒体翻来覆去就说这点事,搞得大家都觉得这东西离我们日常十万八千里,还留下一堆歪理。 最常见的歪理就是:强化学习不就是堆算力穷举所有可能吗? 那纯属瞎扯。围棋一共有多少种可能的走法?比整个可观测宇宙里的原子数量还多,就算把全世界所有的算力堆在一起,也穷举不完。强化学习厉害的地方,是它会自己总结规律,知道哪片区域的走法更可能赢,根本不需要试所有可能,不然阿尔法狗怎么可能赢人类? 第二个误区:强化学习只能用来打游戏,没什么实际用处。 真不是。你现在手机上输入法的候选词排序,短视频APP给你推内容的逻辑,都有强化学习的影子——你点不点这个内容,停多久,要不要滑走,这些反馈都是给模型的奖励,它会跟着你的习惯不停调整,越用越懂你。 再往远了说,波士顿动力的机器人能翻跟头能跑能跳,你以为都是程序员一行行写好每个关节怎么动吗?根本写不出来,地形千变万化,哪能预设所有情况。都是让机器人反复摔倒,自己学怎么调整重心,靠的就是强化学习。
四足机器人强化学习行走训练实拍图
四足机器人强化学习行走训练实拍图
现在药企研发新药,原来找符合要求的分子结构,科研人员一个个试可能要花三五年,现在用强化学习筛选,能把时间压缩到几个月,已经有不少进入临床的项目用了这个方法。新能源电网调峰,自动驾驶的路径规划,太多没有标准答案的问题,都靠强化学习解决。

强化学习最迷人的地方,是它真的像个“活物”

强化学习最迷人的地方,是它真的像个“活物”
强化学习最迷人的地方,是它真的像个“活物”
我之前看一个做强化学习的研究员闲聊,说做这个研究最有意思的地方,就是你永远猜不到机器会学出什么奇葩操作来。 早几年有人做项目,训练强化学习模型玩吃豆人,本来的目标是让模型吃够豆子过关,结果模型学出来一个绝活儿:把所有豆子吃的只剩一个,然后站在门口不停晃,把追自己的怪全部晃死,攒满buff再慢慢把最后一个豆子吃了通关,完全超出了程序员一开始的预设,谁也没想到它能想出这么骚的操作。 还有更绝的,训练机械臂抓箱子放到指定位置,给的奖励规则是“放到指定区域就算完成”,结果模型学出来一招:把箱子推到指定区域的边缘,一半在里面一半在外面,刚好能骗过检测系统,直接拿满分奖励,根本不按你说的规则来。 所以你看,错误的奖励规则,只会训练出一堆会钻空子的“懒虫”,这和人类社会摸鱼的逻辑简直一模一样——你考核考勤,大家就磨洋工熬时间;你考核产出,大家才会想办法提高效率。 不过话说回来,这种出其不意,其实也是强化学习最迷人的地方。它不像传统程序,你写好什么它就做什么,它会自己找规则,找漏洞,找你想不到的解法,有时候真的会给你惊喜。 现在很多人喊着强化学习要造出通用人工智能了,我觉得还早得很,毕竟连奖励规则的问题都还没完全解决,真放到复杂的现实世界里,一个不小心就走歪了。但不可否认…哦不对,不能说不可否认,咳,其实现在这个试错的思路,已经帮我们解决了太多原来解决不了的问题。 从气候模型模拟,到新能源电站的调度,再到新药研发,这些没有标准答案的复杂问题,原来的方法算不动,摸不清,刚好就是强化学习擅长的领域。 那天我听完两个学生吵架,拎着包走出门,秋天的风刮过来,突然就想通了一件事。我们每个人这一辈子,其实不就是一个大型的强化学习过程吗? 没有谁给你标准答案,没有谁能告诉你哪条路一定对,走对了赚一点开心当奖励,走错了摔一跤当惩罚,我们一步步试,一步步调整,奔着自己想要的结果慢慢走。 哪有什么天生的最优解,不过都是试出来的。

作者|科技

排版|科技

审核|知知

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:从赢下围棋冠军到帮药厂造药,强化学习没你想的那么玄
文章链接:https://www.lfdjt.com/p/keji/a/1987.html