咖啡馆里聊大模型算法:原来它不是你想的那样

上周六在南京洪武路的咖啡馆待了一下午,邻座两个计算机系的学生凑在笔记本前吵架。一个说大模型算法不就是堆钱堆参数,傻子都能做。另一个拍桌子,说你懂个屁,核心是算法调得好,参数再大没用。我喝着冰美式,差点笑喷。

说实话,这话我最近半年听不下十次了。不管是刚入行的学生,还是开公司的老板,说起大模型算法,要么吹得玄乎,要么贬得一文不值,很少有人能说句实在话。

你天天在用,根本没留意它的核心逻辑

你打开聊天框,输入“帮我写一份南京周末两日游的攻略”,两秒钟出来一篇排版整齐的文案。你有没有想过,它这两秒到底干了什么?

很多人以为,它是提前存了几十万份攻略,搜到你的问题,挑了一篇拼起来。不对。完全不对。

大模型算法的核心,说破了很简单,就是猜下一个字。从第一个字开始猜,猜完一个再猜下一个,一口气猜完你要的所有内容。那它怎么猜得这么准?靠练。几万亿字的文本,一篇一篇喂给它,喂一次它就调整一次自己的判断逻辑,喂得多了,它就摸清楚了,人类说“中山陵”后面接什么,说“鸭血粉丝汤”后面一般接什么,什么语境下用什么词,出错概率最低。
大模型自回归猜字算法步骤示意图
大模型自回归猜字算法步骤示意图
我之前看一个算法工程师直播,说他刚入行的时候调大模型,调了半个月,输出永远是“嗯嗯嗯”“哦哦哦”,差点把显卡砸了。后来才发现,是偏置项没调对,模型猜来猜去,就短词概率最高,当然输出一堆重复的。

你看,哪有什么神话,都是一点点磨出来的细节。

网上传的那些误区,大多是营销出来的

头一个误区就是“大模型算法就是拼参数拼算力”。

真不对。我认识一个做农业大模型的团队,总共参数规模远小于市面上的通用大模型,但是人家给农民识别病虫害,推荐施肥量,准确率比很多大模型高太多。为什么?人家训练数据全是各地农业站攒的真实田间数据,不是网上爬的乱七八糟的内容。参数只是容器,装什么东西,才决定它好不好用。
同参数大模型不同训练数据输出效果对比图
同参数大模型不同训练数据输出效果对比图
还有一个误区更坑,说大模型已经会思考了,将来要取代人类怎么样怎么样。我每次听到这话都想笑。它到今天,还是在猜下一个字,根本不知道自己说的是什么意思。你让它算多位数乘法,它经常给你算错,不是它不会,是它根本不懂“乘”是什么意思,只是靠概率拼出一串数字而已。

不过话说回来,这也不影响它好用啊。它不需要真的懂,只要能帮我们把活干了,不就行了?对吧。之前我写稿子,找资料找半天,现在让大模型把相关的资料整理个框架出来,我再改,省一半时间。它又不用当作者,我当作者就行了,要什么思考能力。

还有人说大模型算法是完全客观中立的,怎么可能。训练数据里有什么偏见,它全给你学进去。之前出过大模型筛简历,默认给男性候选人打更高分的事,就是因为过去十几年行业里招的男性工程师更多,模型从数据里学到了“工程师=男性”的关联,根本不是什么它天生歧视,是数据喂出来的毛病。

接下来的大模型算法,正在往轻了走

接下来的大模型算法,正在往轻了走
接下来的大模型算法,正在往轻了走
前两年一提起大模型,全是喊着要做更大参数,现在不一样了,圈里很多人都在往小做,往垂直领域扎。

为什么?大模型跑一次的成本太高了,大参数模型回答一个问题,电费就好几毛,要是一万个人同时用,一天下来电费就几十万,谁长期扛得住?而且通用大模型能干的活,很多行业根本用不上,你给一个开牙科诊所的医生,要大模型会写诗歌干嘛?人家要的是能帮我整理病例,帮我判断牙片的异常点,就够了。用一个小参数,专门训牙科的数据,成本降十分之九,效果还好十倍。这不香吗?

真的。骗你干嘛。

我上个月跟一个做算法的老大哥吃饭,他说他现在已经不碰大参数的项目了,天天蹲在服装厂跟老板聊布料,攒了大半年的服装版型数据,训了一个小模型,能帮设计师自动出基础裁剪图,人家工厂现在已经在用了,每个月帮设计师省出快十天的时间。

这就是实实在在的价值,比吹一万次概念靠谱多了。

很多人说大模型算法是改变世界的技术,没错,但改变世界不是靠堆一堆参数放在服务器里落灰,是要一点点落到具体的事里,帮做衣服的省点时间,帮种庄稼的多收点粮食,帮写东西的少加点班,这不就是最大的意义吗?

作者|科技

排版|科技

审核|安然

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:咖啡馆里聊大模型算法:原来它不是你想的那样
文章链接:https://www.lfdjt.com/p/keji/a/7206.html