去年9月23号,我在南京珠江路地铁站出来拐进巷口的咖啡店躲雨,碰到了快五年没见的大学同学。他现在在互联网公司做机器学习相关的项目,那天聊了一下午,把我之前对机器学习的一堆糊涂账全理清了。
我之前一直觉得这是实验室里博士才玩得转的高科技,离普通人的生活远得很。那天才发现,原来它的逻辑,和咖啡店老板攒选品经验,没什么两样。
别翻百科了,用卖咖啡讲明白机器学习到底在干啥
咖啡店的张叔开了五年店,抽屉里藏着个皱巴巴的小本子,从开店第一天起,每天打烊都要记两笔:今天什么天气,多少客人,哪款咖啡卖了多少杯。
记了半年,他摸出不少规律:30度以上的晴天,冰美式的销量是阴雨天的三倍;周末结伴来的年轻人,点生椰拿铁的概率比工作日上班族高两倍;下雨天带电脑来坐一下午的人,多半会点热馥芮白。
有了这些规律,张叔进货再也不会乱压货,也不会卖着卖着就断货,每个月能多赚小几千。你看,这个攒数据、找规律、预测未来的过程,就是人脑版的机器学习。
机器干的事,和张叔一模一样。只不过张叔用脑子记,机器用硬盘存;张叔算一遍规律要半个月,机器算一遍只要几秒钟。本质都是:喂进去一堆过往的旧数据,挖出藏在里面没说出来的规律,再用这个规律去应对未来的新情况。
那些听着玄乎的名词,换个说法也很好懂。张叔记数据的时候已经知道每天卖了多少,相当于训练的时候就有了「标准答案」,机器照着答案找规律,就是大家常说的监督学习。要是张叔进了十款新咖啡,不知道哪款会火,机器帮他把点单的客人自动分成喜欢偏甜、喜欢偏苦、喜欢带奶的三群,不用张叔提前说要分几类,这就是无监督学习。
就这么简单。

绕不开的认知误区,我之前全中了
那天聊天,我同学说,现在网上对机器学习的误解,比大学概率论挂科的错选项还多。挑几个最常见的说说。
第一个误区,很多人一提起机器学习,就想到会聊天的机器人,会下棋的AI,觉得这就是能取代人的超级智能。说实话,真不是这么回事。现在所有你能接触到的机器学习,没有一个能脱离人类给的数据自己找问题。它能帮你从一万张老照片里找出你家狗的照片,但是它不知道你为啥要找这张照片,也不会突然跳出来告诉你「我觉得你应该把这张印出来当壁纸」。所有的能力都是喂出来的规律,长不出自己的思想。
第二个误区,觉得机器学习一定要几千张显卡、几TB数据才能玩,普通人根本碰不到。真不对。你现在打字的时候输入法跳出来的联想词,就是机器学习跑出来的结果。你手机相册自动给你按人脸分类,把风景、宠物、合影分开,也是机器学习在你手机本地跑的小模型。根本不需要什么超级计算机。

第三个误区,说做机器学习就是要搞大模型,搞通用人工智能,小打小闹不算数。其实不然,现在最赚钱、最能帮到普通人的,全是解决小问题的小模型。我同学去年帮一家本地蔬菜配送公司做了一个不到一百M的小模型,就是根据过去三年的订单,预测每个小区每天要多少青菜多少肉,帮配货员调整量,原来配错的损耗直接少了一半,一年下来帮人家省了几百万。这比很多吹得天花乱坠的大模型有用多了。
不过话说回来,现在网上到处都是大模型的新闻,搞得大家以为机器学习就只有大模型,其实冰山下面全是解决各种小问题的小模型,只是没人吹,没人关注罢了。
顺着趋势往下看,最有意思的变化是什么

那天聊到最后,他说接下来几年,机器学习会变得越来越「看不见」。
什么意思?原来你要用到机器学习,得特意打开专门的网站,输关键词问大模型。以后不一样,机器学习会嵌到你所有日常用的东西里,你用的时候根本感觉不到它存在。比如你家冰箱,会自己记你多久吃一次鸡蛋,提前提醒你该买了,还能自动帮你凑你喜欢品牌的促销,整个过程你根本不用跟它聊天,它自己就干了。
第二个变化,就是数据会越来越「不出门」。原来你要让机器学习帮你算点什么,得把你的数据上传到别人的服务器,现在很多小模型已经可以直接放在你自己的手机里跑,你的健康数据、聊天记录、消费习惯,根本不用传给别人,就能给你提供服务,这比把所有隐私都交出去安全太多了。你肯定不希望你每天吃什么药、每个月赚多少钱,都存在别人的服务器里对吧?这种本地跑的机器学习,以后肯定会越来越多。
很多人说机器学习会抢光所有人的工作,我那天聊完倒不这么慌。它抢的都是那种「按规律重复干」的活,比如整理发票、归类资料,但是那些需要攒人情、需要温度的活,它学不走。就像张叔的咖啡店,就算有模型帮他算准了进货量,客人来了还是要张叔递杯热乎的,聊两句最近的烦心事,人家才会愿意常来。这个和人打交道的规律,机器永远学不走。
雨停的时候我走出咖啡店,看着巷口人来人往,突然反应过来。机器学习从来都不是什么从天而降的新东西,人类从钻木取火开始就在攒经验找规律,只不过现在把这个重复算账找规律的活,分给机器干了而已。
不用捧得太高,也不用怕得要死。它就是个好用的工具,和我们当年用的算盘、计算器,没什么本质区别。
作者|科技
排版|科技
审核|满满