蹲在大厂算法组三年,我看懂了大模型算法那点没被说透的小事

上个月9月23号去南京见老同学,在老门东排队买鸭油酥饼,站我前面两个准备秋招的大学生,凑一块聊面经。其中一个挠头说,昨天面算法岗,面试官问他对大模型算法怎么理解,他张口就说“就是堆更多参数更多数据”,然后面试官笑了笑,问了三个问题他一个都答不上,凉透了。 我在后面听着,差点笑出声。太正常了。现在网上刷到的大模型科普,十个有八个都在说“卡脖子就是显卡,核心就是堆料”,把算法说的像打包送的赠品一样,真要问点具体的,大部分人都懵。

别被“炼丹”梗骗了,大模型算法根本不是堆料

很多人被“炼丹”这个梗带歪了,觉得大模型就是把数据丢进去,点个运行等出结果,全靠显卡堆时间,算法都是次要的。 说实话,我刚进组的时候也这么想。直到跟着导师改了三个月预训练的损失函数,才明白预训练阶段的算法设计,才是大模型能力高低的第一道分水岭。 不是说你把几十TB的文本一股脑丢进去就完事了。举个最简单的例子,现在主流大模型用的自回归预训练,核心设计就是因果掩码:模型读上文的时候,绝对不能偷看下文的内容。就像你背课文,不能提前翻下一页,必须靠自己已经背过的内容,猜下一个字是什么。 就是这么一个简单的规则设计,逼着模型把所有文字里藏的规律,从语法结构、常识逻辑到人类的说话习惯,全给刻进自己的参数里。你以为大模型能接上下一句,是凭空来的?全是当年预训练的时候,一步一个坑练出来的。
大模型预训练因果掩码示意图
大模型预训练因果掩码示意图
更别说什么数据过滤、分词优化这些细节了。同样的数据源,不同的算法处理出来,最后模型的能力能差出一个档次。哪有什么随便堆料就能出效果的好事。

大家都在说的对齐,到底是什么算法逻辑

预训练做完,大模型就活了?不对。你拿刚预训练完的裸模型问问题,他能跟你扯半天东拉西扯的东西,有时候还会说一些奇怪的话。为什么?因为他只学会了怎么接话,没学会怎么接对人类有用的话。 所以才有了对齐。网上说对齐就是“教大模型做人”,听着玄乎,其实说白了就是对齐根本不是什么“道德教化”,本质是一套用人类偏好修正模型输出的算法框架。 现在最常用的就是RLHF,也就是人类反馈强化学习。别被名字吓到,拆开来特别简单:第一步,先让大模型对同一个问题出好几个不同的回答,找一堆真人给这些回答排序,哪个好哪个不好排出来。第二步,用这些排序数据训一个“奖励模型”,这个模型的任务就是给任何回答打一个分,模拟人类的喜好。第三步,用强化学习的算法,让原来的大模型朝着“拿高分”的方向调整自己的输出,慢慢就变成会说人话、符合人类要求的样子了。
大模型RLHF算法训练流程图
大模型RLHF算法训练流程图
我刚接触这套算法的时候,觉得太巧妙了。原来我们没有办法把人类的“舒服”“有用”这种模糊的要求,直接写成代码给模型,那我们就训练一个模型来帮我们打分,绕了个弯,直接把问题解决了。 不过话说回来,现在对齐算法的坑也不少。比如人类打分本来就主观,你喜欢直白的回答,我喜欢委婉的,最后训出来的模型,就容易偏向打分多的那部分人的偏好,也会出问题。

大模型算法现在的坑,都藏在哪

大模型算法现在的坑,都藏在哪
大模型算法现在的坑,都藏在哪
说几个网上很少有人直说的误区吧。 第一个,参数越大效果越好?真不一定。大模型算法的未来,早就不是比谁参数大了。现在很多开源的小模型,靠着算法优化,效果能追上比自己大好几倍的旧模型。比如量化算法,原来10B参数的模型要占十几个G的显存,现在通过算法把参数的精度降下来,体积砍一半还多,效果掉的不到一个点,普通显卡就能跑,这不是算法的功劳是什么?还有注意力机制的优化,原来模型处理长文本,速度随文本长度平方涨,现在改成线性增长,几万字的文章也能轻松处理,这都是算法突破带来的变化。 第二个,大模型只会背训练数据,不会推理?也不对。这两年大模型在推理能力上的算法进步,其实很大。比如大家听过的思维链,就是一个非常简单但有效的算法设计:原来让模型直接出答案,现在只需要在提示里加一句“让我们一步一步思考”,模型就会自己把推理过程写出来,做数学题、逻辑题的正确率直接涨了百分之二三十。就是这么一句话的事,背后是算法设计对模型能力的激活,你说神奇不神奇? 当然,坑还是真的坑。比如现在大模型还是会一本正经的胡说八道,也就是幻觉。这个问题到现在,也没有一个算法能彻底解决,只能缓解。还有推理的本质,大模型还是靠统计概率猜下一个字,不是真的像人一样理解问题,碰到需要精确计算的场景,一不小心就错。 谁要是跟你说大模型算法已经完美了,那他要么是不懂,要么就是想卖货割韭菜。 最后,我上次跟组里的资深研究员吃鸭血粉丝,他说,现在我们其实是站在大模型算法的起点,不是终点。我们造出了大模型,摸清了一些训练的规律,但还有一大堆问题没搞懂:为什么参数大了能力突然就涨了?为什么有些模型训出来就是比别的好,参数数据都一样?这些问题,都等着新的算法突破来解答。 下次再有人跟你说大模型就是堆钱堆参数,你就想想,那堆堆叠叠的算法设计背后,多少人熬了无数夜改出来的一行行代码,哪有那么多天上掉下来的奇迹。

作者|科技

排版|科技

审核|小准

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:蹲在大厂算法组三年,我看懂了大模型算法那点没被说透的小事
文章链接:https://www.lfdjt.com/p/keji/a/7554.html