咖啡馆里聊大语言模型:它到底是“会思考”还是“会背稿”

昨天下午在南京洪武路边上的老咖啡馆躲雨,邻座一个穿校服的小孩凑过来问,说最近用大语言模型写作文,老师都没看出来,以后是不是不用费劲学写东西了?

我搅了杯冰美式,突然觉得这个问题挺有意思。太多人吹大语言模型吹得神乎其神,也太多人怕它怕得要失业,不如坐下来,慢慢扯。

你每天用的东西,核心逻辑其实特别简单

很多人一听到大语言模型,就觉得是什么外星人科技,一堆参数一堆术语堆上来,吓得不敢往下想。其实说白了,它这辈子就干一件事:根据你给的上文,猜最可能出现的下一个字。

就这么简单。

你输入“中秋节我准备回”,它会把所有见过的文字组合算一遍概率,算出来“家”的概率最高,就先出一个“家”。出完“家”,再根据前面所有的字,猜下一个最可能的是什么,要是你之前提了老家的猫,它大概率会出“陪”,然后是“猫”,一步步攒出一整段话。

大语言模型逐字预测输出过程示意图
大语言模型逐字预测输出过程示意图

说实话,我第一次搞懂这个逻辑的时候,后背愣了半分钟。真的。就这么朴素的逻辑,堆上足够多的数据和足够多的参数,就能说出像模像样的人话,还能写代码写文案解数学题?

很多人说,大语言模型就是把整个互联网都背下来了,所以什么都知道。这是错的。现在主流大模型的参数总量,其实比所有训练数据的总容量还小,根本不可能背得完。它真正攒下来的,是文字和知识背后的规律——什么样的话人会这么说,什么样的逻辑顺下来应该接什么结论。它不是背答案,它是顺着规律“编”出答案。

没错,就是编。只是编得太像真的了而已。

那些被炒烂的误区,我掰碎了说清楚

第一个误区:大语言模型无所不知,什么问题都能答。

只要你用得久一点,肯定碰到过它一本正经说瞎话的时候。我上个月让它查一位南京本地老作家的生卒年,它给我编了个出生日期,还说人家2018年就去世了,结果人家上个月还出来开新书分享会。这种情况在圈子里有个名字,叫大语言模型幻觉,说白了就是它猜字的时候,顺着逻辑猜出来一个看起来对的答案,根本不管是不是真的。

大语言模型幻觉输出错误案例对比图
大语言模型幻觉输出错误案例对比图

为什么会这样?回到核心逻辑,它本来就是猜下一个字,不是查答案啊。它没见过那个信息,就顺着上下文的语感猜一个,只要读起来顺,它就敢说。

第二个误区:大语言模型已经会思考了,很快就有自我意识了。

p>网上一堆博主拍着胸脯说AI已经产生意识了,要统治人类了。说真的,不是坏就是想涨粉割韭菜。现在所有的大语言模型,连“我”是什么都不知道,它输出“我认为”这三个字,只是因为你问了它问题,按照规律,回答开头就应该放这三个字,它根本不“认为”任何东西,它没有欲望,没有自我,没有喜怒哀乐,它就是个按概率出字的程序。

不过话说回来,它猜字猜得准到吓人,准到很多人误以为它真的会想。上次我让它帮我写一封给我奶奶的八十岁祝寿信,我只说了一句“我奶奶从小在南京乡下长大,喜欢腌萝卜干”,它写出来“记得小时候放了学,跑半里地回家,推开院门就能闻到缸里腌萝卜的咸香,奶奶总说腌萝卜就粥,是天下最好吃的菜”,我当时拿着手机,半天没说出话。

它根本没吃过我奶奶腌的萝卜啊,它只是见过太多太多人写这种亲情文字,摸透了这种文字的脉络,顺着就把我没说出来的情绪填上了。太像了,像到我差点以为是我自己写的。

不用怕也不用吹,它就是个好用的工具

不用怕也不用吹,它就是个好用的工具
不用怕也不用吹,它就是个好用的工具

现在走到哪都能听到说,大语言模型要取代这个取代那个,一堆人慌得不行。我倒觉得,慌的都是没搞懂它到底是什么的人。

它会取代只会套模板写通稿的文案,会取代只会复制粘贴改内容的运营,会取代只会写基础增删改查代码的新手,但它取代不了有自己想法的人。你想啊,一个有独家采访线索的记者,一个能摸透客户真实需求的设计师,一个能理顺复杂业务逻辑的程序员,大模型只是帮你省了整理素材写初稿的时间,真正的判断和创意,它拿不到啊。

我前阵子跟一个做模型训练的朋友吃饭,他说现在行业里最清醒的一批人,反而不吹大语言模型无所不能。大家都知道,现在它的能力边界就在这:它处理不了你独有的信息,做不了超出训练数据逻辑的原创判断,甚至连基本的算数都能错。它最好的定位,就是你的超级辅助打字员,帮你把脑子里零散的想法捋顺,帮你干那些你不想干的重复活,帮你试错,节省你的时间。

至于未来会怎么样?没人说得准。有人说接下来就能出通用人工智能,有人说现在这条路已经快摸到天花板了,烧的电越来越多,能力提升反而越来越慢。我反正是觉得,不管技术怎么变,日子都是人过的。

昨天那个小孩听完,哦了一声,说原来它就是个特别会接话的打字员啊,那我还是得自己练作文对吧?我笑着点头,雨停了,我起身出门,路边梧桐树的叶子落了一地,南京的秋天风一吹,舒服得很。管它什么大模型小模型,能帮人干活就是好工具,别被工具牵着走,就够了。

作者|科技

排版|科技

审核|安然

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:咖啡馆里聊大语言模型:它到底是“会思考”还是“会背稿”
文章链接:https://www.lfdjt.com/p/keji/a/8976.html