预训练不是技术问题,是算账问题

万亿参数竞赛的突然刹车

2026年开年的中国大模型产业峰会上,我绕着展台走了三圈,没找到一块印着“十万亿参数”“全栈自研预训练”的巨型展板。 搁去年,这可是各家抢C位的标准配置。 今年,全没了。 上个月和某头部云厂商负责大模型业务的朋友吃饭,他吐了一晚上槽。去年他们推定制化预训练服务,报一个十万亿参数基座的价格是三千万,当时还有七八个客户排队谈。今年直接把价格砍到八百万,连一个询价的都没有。 说白了,钱烧完了。声音也没了。 很多人不知道,预训练的烧钱速度有多夸张。训练一个GPT-4级别的十万亿参数基座模型,总耗电量超过5亿度,相当于一个30万人口的江淮中小型城市一整年的居民生活用电量。光是电费就快两个亿,还不算GPU采购、人力、数据清洗的成本。
2026中国大模型产业峰会主论坛实拍
2026中国大模型产业峰会主论坛实拍
说实话,前两年大模型热,谁都想自己训一个基座,抢个卡位。创业公司拿了A轮融资,一半钱砸进去预训练,出来测效果,和人家开源的预训练基座比,PPL只低了两个点,跑分差不到5%,钱没了,公司也快没了。 喊了三年的参数竞赛,突然就踩了刹车。

分工重构的商业账本

预训练到底是什么?很多人说得玄乎,其实说白了,就是给大模型提前攒家底。 我更愿意用生物进化的逻辑来类比:预训练本质上就是大模型的进化预适应——就像寒武纪生命大爆发之前的十亿年里,单细胞生物早就完成了基础基因工具的预演化,攒够了支持多细胞复杂结构的所有基础能力,只等着寒武纪的环境变化触发分化。预训练给大模型攒的就是通用认知能力,后面的微调只是根据不同场景触发分化而已。 过去行业的误区是什么?所有人都想自己从头攒家底,都想自己做全套预训练,仿佛不做就是技术不行。 但本土玩家早就跑出了新的玩法。 智谱AI去年就把预训练拆成了两层:底层通用预训练,由智谱做,做好了卖给下游客户;下游只需要做自己垂直领域的增量预训练和微调。同样是70B参数的通用基座预训练,头部云厂商的整包定制报价是1200万元,而智谱拆分出来的预训练基座授权,只需要不到280万,模型效果差距不到7%。差了四倍的价格,换谁都会用脚投票。
大模型预训练GPU集群算力调度监控界面
大模型预训练GPU集群算力调度监控界面
不过话说回来,能把预训练做成标准化生意,不是谁都能做的。字节跳动为什么能把自己的预训练成本压得比同行低三成以上?你以为是技术有多牛?其实是人家本身有庞大的闲置算力错峰,还有全球最大的图文短视频语料库,数据清洗成本比创业公司低了不止一个量级。百度更不用提,早在2019年文心一言还没出来的时候,就已经攒了好几代预训练模型的家底,现在卖基座相当于把原来的沉没成本二次变现。 原来这场博弈,从一开始就不是技术参数的比拼,是成本账本的比拼。你账算不对,砸再多钱堆出来的参数,也没人买你的账。

剥掉光环之后的普通人机会

预训练的分工拆分,最大的受益者不是头部大厂,是产业链中下游的普通从业者。 放在三年前,你一个做垂直领域AI应用的小团队,想做一个自己的行业大模型,第一件事就是凑钱搞预训练,没有几千万根本启动不了。绝大多数传统行业的团队,手里有行业数据,懂行业需求,就是拿不出这么多钱砸预训练,只能看着蛋糕吃不到。 现在呢?几十万块钱就能拿到一个预训练好的70B通用基座,只需要把自己的行业数据灌进去做增量训练,一两个月就能上线产品。 我上个月见了一个五个人的小团队,原来做律所的知识管理,今年拿了预训练好的基座,只用了三个月就做出来了专门给离婚官司用的法律助手,现在已经铺了十几家律所试用,客单价一年两万,活得很舒服。换两年前,他们根本不可能凑得出几百万预训练的钱。 当然也有争议。很多人说,大家都不做底层预训练了,都用头部的基座,会不会未来被卡脖子? 我反倒觉得,这才是正常的产业分工。就像现在发电都是电网公司做,你开个工厂不需要自己建火电厂吧?大家都做自己擅长的事,效率才会更高。真正该淘汰的,是那些靠烧钱堆预训练参数讲故事,从来不算账的泡沫玩家,本来就该被洗掉。 现在越来越多的开发者,已经不用再花半年时间调预训练参数了,只需要把精力放在解决行业实际问题上。这才是大模型真正落地的开始啊。 不出三年,预训练就会从大模型厂商抢破头的核心护城河,变成无人争抢的公共基础设施。 对不对?
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:预训练不是技术问题,是算账问题
文章链接:https://www.lfdjt.com/info_23_16839.html