你天天用的AI聊天,大模型算法到底在算什么?

你早上摸出手机,对着AI对话框敲了一行字:“今天降温,帮我写份出行穿搭建议”。回车按下不到两秒,整整齐齐的三段话就出来了。你有没有停下来想过——屏幕那头那堆叫大模型算法的东西,这两秒里到底干了什么?

从你敲完回车的那一刻,第一步计算就开始了

很多人以为大模型是提前存了一堆答案,搜到匹配的就给你扔出来。不对。完全不是这么回事。 大模型每次给你出回复,都是从头算一遍,一个字一个字蹦出来的。
大模型逐词生成文字计算过程图
大模型逐词生成文字计算过程图
核心逻辑其实特别好懂,说穿了就是一句话:算下一个字的出现概率。 你输入“今天南京23度,适合出门”,大模型扫完你这行字,立刻开始算,哪个字接在这句话后面概率最高?是“玩”吗?还是“爬山”?还是“穿”?它把所有可能的字都过一遍,挑出概率最高的那个放上去,然后再拿着你输入的整句话加这个新放上去的字,再算下一个概率最高的字。循环往复,直到生成完整个回复。 别觉得这个逻辑太简单。你想想,同样说“我昨天去超市买了”,你前面聊的是周末减脂,接“生菜”的概率就远高于“炸鸡”;你前面聊的是追剧囤货,接“薯片”的概率立刻就上来了。大模型要做的,就是把这种我们人类顺嘴就能说出来的感觉,精准地用概率算出来。 我刚搞懂这个逻辑那天,盯着手机愣了五分钟。原来它真的不是背答案啊!太反直觉了。

被吹上天的技术黑话,拆穿了其实一点都不玄

一讲大模型算法,满屏都是Transformer、注意力机制、自监督学习,一堆名词堆上来,普通人直接劝退。说白了都是为了让这个“算概率”算得更准而已。 就说最常提的注意力机制,什么意思?就是你给大模型发了一句“帮我梳理一下大模型算法的入门要点”,它不会把每个字平等对待。它知道“大模型算法”、“入门要点”才是核心,“帮我”、“梳理一下”这种就是语气助词,不用花太多心思在上面。
大模型注意力机制权重分布示意图
大模型注意力机制权重分布示意图
就这么简单,哪有那么玄乎。 现在大家说大模型“大”,说参数多少亿,很多人也误解了。参数是什么?就是大模型从海量人类文字里学到的各种文字规律的“存储单元”。你要让它既要会写公众号,又要会调代码,还要能看懂医疗报告,那自然需要更多的参数来装下不同领域的规律。 说实话,现在圈子里有种不好的风气,一上来就拼参数堆大小,仿佛参数越大算法越牛。其实很多场景下,小参数的算法只要优化得好,比瞎堆出来的大模型好用得多,还便宜。我认识一个算法工程师朋友,之前做行业大模型,他们给客户做的模型参数只有别家的十分之一,跑起来速度快三倍,准确率还高五个点,客户乐得不行。 说白了,算法的好坏从来不是看大小,是看能不能解决问题。

普通人对大模型算法的几个误区,得掰扯清楚

普通人对大模型算法的几个误区,得掰扯清楚
普通人对大模型算法的几个误区,得掰扯清楚
第一个误区:大模型算法不会出错?错。 它本来就算概率,概率再高也有歪的时候。你让它算个三位数乘法,它都可能给你算错,不是它笨,是它的本职工作就是生成符合人类语言逻辑的句子,不是给你当计算器。很多人骂大模型瞎编,其实换个角度想,它本来就不是存了标准答案再给你,它是拼出来的句子,出错太正常了。 第二个误区:大模型算法已经有自我意识了?扯。 它到现在都不知道自己说的话是什么意思。它知道“苹果”这个词接在“吃”后面概率很高,但它从来没真的吃过苹果,也不知道苹果是红是圆甜不甜。所有输出都是拼概率,哪来的自我意识。那些喊着AI要毁灭人类的,要么是坏,要么是真没搞懂大模型到底是怎么跑的。 不过话说回来,也真的挺奇妙的对吧?就是这么简单的逐词算概率的逻辑,堆上足够多的数据和参数,居然能说出能把哲学家绕晕的话,能画出从没存在过的画,甚至能帮工程师改代码。这种量变堆出来的质变,是十几年前研究算法的人都不敢想的。 现在很多人想入门大模型,一上来就先啃一堆数学公式,把自己劝退了。其实你先搞懂核心逻辑:它就是一个一个字算概率,靠注意力抓重点,用大参数存规律,先把这个主干搞清楚,再去抠细节,真的会轻松很多。 大模型算法现在还远没到完美的程度。跑一次成本高,容易瞎编,对很多专业领域的规律抓得还不准,一堆坑等着填。但你不能不承认,它已经实实在在改变我们用手机用电脑的方式了。 以后会变成什么样,谁也说不准。但至少现在,你再跟AI聊天的时候,至少知道它那两秒钟里,到底干了件什么事对吧?

作者|科技

排版|科技

审核|知知

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:你天天用的AI聊天,大模型算法到底在算什么?
文章链接:https://www.lfdjt.com/p/keji/a/3197.html