事实表不是存储问题,是分配问题

大厂裁撤数据中台,刀先砍在冗余事实表上

2026年开春,国内互联网圈数据部门的寒气,比北京的倒春寒还刺骨头。三家头部大厂先后传出裁撤中台团队的消息,走的人里,十个有七个是天天跟数仓打交道的开发。

别扯什么业务方向调整,本质就是降本。降本从哪砍?第一刀绝对轮不到业务,轮得到那些看不见的后台成本。

我上个月跟某淘系出来的数仓老炮喝酒,他一口闷了半杯白酒,拍着桌子说,你们知道现在大厂数仓里,堆了多少没用的事实表吗?百分之七十的存储,全给了从来没人查的冗余表。

他给我甩了一个内部数据,他们公司2025年数仓降本,光清理冗余事实表就省了两个多亿。这个数字是什么概念?相当于给公司全部1800个一线数据开发,每人发11万年终奖还剩1200万。

互联网企业数仓事实表重构进度看板
互联网企业数仓事实表重构进度看板

最早搞数仓的时候,所有人都在吹维度建模的优雅,事实表维度表分的清清楚楚,星型模型雪花模型,说出去头都抬得比别人高。结果呢?业务两周一个版本,今天要加这个字段,明天要加那个统计,嫌join表麻烦,干脆直接把所有需要的字段全塞进事实表里。

久而久之,一张事实表能塞一两百个字段,同一条数据在十张不同的事实表里重复存。你去问最早建表的人,为什么这么搞?人家说当时业务急着要数,先凑出来能用再说,后面哪有空改?

堆的时候爽。

清的时候想死。

很多公司数仓建了五六年,连现有一千多张事实表里,到底哪些是真的天天在用,哪些是死人坟头的草,没人说得清。IT部门按存储容量算成本,一年大几个亿砸进去,一半都养了这些没人理的僵尸表。

两种路线的博弈,本质是资源分配权的争夺

放在十年前,国内互联网公司抢增速,没人会在意这点存储成本。多买两台服务器的钱,还不够产品经理一个月工资,犯不着跟业务过不去。

所以你看,中国本土互联网公司的事实表路线,从一开始就跟欧美走了不一样的方向。阿里早年学微软IBM那套分层建模,事实表拆的极细,规范做的足足的,结果业务跑起来,每次取数要join五六个表,慢到让人骂娘,后来也慢慢开始放宽。字节从一开始就快,抖音电商起来的时候,为了赶业务迭代,直接搞大宽事实表,所有能用的字段全堆进去,业务拿过来就能用,不用等数仓排期。

数仓维度事实表星型模型结构示意图
数仓维度事实表星型模型结构示意图

这就像两军对战。传统分层建模拆细事实表,是线列步兵方阵,讲究阵型整齐,分工清晰,每一个部分都按规则来,打起来稳,但推进慢。大宽事实表是闪击战,把所有资源全堆在前线,不管后勤,推进速度快到离谱,赢了就拿成果,输了就是一屁股烂账拖死自己。字节早年的核心交易宽事实表,同一份原始交易数据重复存了17次,查询速度比细拆的事实表快了12%,但存储和计算成本翻了整整6倍。

说实话,增速快的时候,这点成本根本不算事。业务快速跑起来,赚的钱远 cover 得住多余的服务器开销。但现在增速下来了,要降本了,问题就全暴露了。谁占有存储资源,谁占有计算资源,本质就是分配权的问题。

前几年很多中小公司学大厂搞数据中台,上来就建几百张事实表,招一堆开发天天维护,结果业务没起来,一年光数据存储计算就花几百万,比整个业务部门的人力成本还高,最后直接把整个数据部门砍了。这不就是被多余的事实表拖死的?

很多人说事实表是技术问题,我不这么看。你要规范,要省存储,很简单,定好规则不让乱加字段不就行了?为什么做不到?还不是业务部门要抢资源,你不给我加,我就找老板说你耽误我业务进度,最后数仓团队只能妥协,往事实表里堆了一个又一个没用的字段。

说白了,就是资源分配跟着业务优先级走,没人管长期的成本。

普通数据人找饭吃,先过事实表这道关

普通数据人找饭吃,先过事实表这道关
普通数据人找饭吃,先过事实表这道关

我最近帮几个朋友招数据开发,面试的时候第一个问题从来不是你会不会写SQL,懂不懂维度建模,我就问一句话:你在上一家公司,怎么管事实表?有没有做过瘦身优化?

十个面试者里,有八个说不清楚。要么就是说都是按规范来,从来没清理过,要么就是说业务不让改,改了出问题谁负责。

你看,时代变了。原来找工作,会背维度建模的几个原则,会画星型模型,就能拿高薪。现在,不会给事实表做降本瘦身,连面试都过不了。

不过话说回来,这也不能全怪年轻人。原来整个行业都在抢增量,没人教过你怎么清理事实表,所有的教程全在教你怎么建表,怎么加字段,没人教你怎么删表,怎么缩容。

现在整个产业链的逻辑变了。从做加法到做减法,从抢增量到盘存量,事实表就是最直接的切面。你能帮公司省一百万存储成本,比你建十张新表给业务带来的价值还大,因为省下来的就是纯利润。

我认识一个年轻的数据开发,去年在一家美妆新消费公司,光清理冗余事实表,一年帮公司省了300多万的云服务成本,年底直接拿了相当于六个月工资的奖金,比很多做业务的拿的还多。这就是趋势,对吧?

原来很多人说数仓开发卷不动,是技术太卷,其实不对,是你卷错了方向。大家都在卷怎么建复杂的模型,怎么搭漂亮的中台,没人愿意去干清理事实表这种脏活累活,但现在,脏活累活才是真需求,才是真钱。

当所有人都在往事实表里堆东西的时候,谁能想到,未来三到五年,会有一大批数据开发,靠给公司挖事实表的金子,拿高薪?

反正我问过好几个大厂的数据总监,明年的第一KPI,就是把现有事实表的存储成本砍三分之一。

你准备好了吗?

作者|大讲堂

排版|大讲堂

审核|柚子

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:事实表不是存储问题,是分配问题
文章链接:https://www.lfdjt.com/info_23_23792.html