星型模型:数据仓库时代的旧设计,为何成了AI大模型的新基建?

最近跑了七八家做企业AI落地的团队,聊下来最让我意外的一个发现,就是十几年前已经被说“研究透了”的星型模型,现在成了圈里私下聊得最多的新方案。 谁能想到?八九十年代就成型的建模方法,居然在2024年又翻红了。

被误解三十年:星型模型的核心逻辑从来不是“形状”

很多人提起星型模型,第一反应就是数据仓库里的一种建模方法,不就是一个表在中心,周围一堆表连出去,长得像星星对吧? 说实话,大部分人只记住了形状,没搞懂它设计的底层逻辑。 星型模型的核心,是把数据分成两类:事实表维度表。中心的事实表存的是可度量的业务数据,比如订单额、销量、访问次数,每条记录带各个维度的主键。外围的维度表存的是描述性信息,比如时间、区域、产品类目、用户属性。
数据仓库星型模型结构示意图
数据仓库星型模型结构示意图
当年跟星型模型一起出道的,还有雪花模型。雪花模型追求第三范式,把维度再拆分,消除数据冗余,看起来非常整洁优雅,教科书上都把它当标准答案讲。 可实际落地呢?大部分企业做BI分析,十有八九选星型模型。为什么?星型模型是反范式设计,允许少量冗余换查询效率,你要查一个数据,最多连一次表,不用层层join,速度快好几倍。 雪花模型呢?为了省点存储,每次查询要连四五个表,遇到大数据量直接卡成PPT,谁用谁骂。

星型模型二次翻红:正好撞上了大模型RAG的核心痛点

这波AI热潮里,企业落地最成熟的路线就是RAG,也就是检索增强生成。说白了就是把企业自己的数据喂给大模型,让大模型能基于私有数据回答问题。 可做过企业级RAG的都知道,最头疼的从来不是大模型生成,是检索。 用户问一句“去年第三季度,华东区售价超过100元的美妆产品,用户好评率排前10的是哪些”,普通的纯向量检索,只能抓“美妆产品”“好评率”这些语义,抓不住“去年第三季度”“华东区”“售价超过100元”这些精确的维度条件,搜出来的结果不对,大模型生成再漂亮也是错的。 那怎么办? 现在业内跑得通的方案,说白了就是把星型模型那套搬过来了。事实表存业务主键和核心事实数据,每个维度单独做维度表,向量embedding存在维度表里,检索的时候先按用户给的维度条件做过滤,把不符合条件的数据直接筛掉,再在剩下的小数据集里做向量相似度检索。
企业级RAG星型模型架构图
企业级RAG星型模型架构图
这么一改,速度直接提了3-10倍,准确率还涨了十几个点。哦对了,企业原来存业务数据,大部分早就按星型模型建好数据仓库了,直接把维度映射过来就行,不用重新梳理数据,迁移成本直接砍了一半。 现在头部的向量数据库厂商,私下给大客户做落地方案,十有六七会用这套结构。国内几家做企业大模型服务的厂商,去年下半年出的最佳实践里,都隐晦提了这种分层建模思路,说白了就是换了个说法的星型模型。 整个产业链都在悄悄受益:原来做传统BI数据仓库的工程师,现在成了AI落地的抢手货,毕竟星型模型那套数据梳理的经验,是年轻AI工程师没接触过的。

热潮下的暗坑:星型模型不是万能解药

热潮下的暗坑:星型模型不是万能解药
热潮下的暗坑:星型模型不是万能解药
现在圈里已经有人开始吹“星型模型是大模型应用的终局建模”了,我反倒觉得要泼一盆冷水。 星型模型能解决当前的痛点,但它本身的瓶颈也非常明显,根本不是什么银弹。 第一个问题,维度扩展太难。你业务变了,要加一个新的维度,就得改中心事实表的结构,对于千亿级别的大库来说,改结构的成本高到吓人,很多实时业务根本等不起。 第二个问题,高基数维度拉胯。什么叫高基数?就是一个维度下面有几百万上千万不同的值,比如用户ID、商品ID这种,星型模型过滤的时候,扫描成本还是下不来,遇到高并发查询照样卡。 第三个坑,数据治理难度被低估了。星型模型允许冗余,很多企业上来就乱加维度,搞到最后同一个维度,不同表里面的值对不上,数据一致性崩了,大模型生成出来的结果前后矛盾,错得离谱,最后锅还得AI来背。 说实话,我见过至少三个项目,学了个星型模型的外壳,没把控住数据质量,最后效果还不如原来的扁平建模,白白扔了几百万的研发费。

未来三年:星型模型会成为行业标配吗

未来三年:星型模型会成为行业标配吗
未来三年:星型模型会成为行业标配吗
站在2024年这个节点看,未来三年,星型模型成为企业级大模型应用的标准建模范式,几乎是板上钉钉的事。 原因很简单,企业级AI落地的核心矛盾,从来不是搞一个多么先进的新架构,而是怎么把已经沉淀了十几年的数据资产用起来。大部分中大型企业的核心业务数据,早就按星型模型整理好了,适配成本几乎为零,这种优势是任何凭空造出来的新建模方法都比不了的。 不过话说回来,星型模型也会演化。针对实时高并发场景,会出现更多星型+雪花的混合架构,把高频常用维度放星型,低频长尾维度放雪花,既保速度又省存储。针对高基数维度的优化,也会有更多缓存、索引层面的改造,都是在星型的基础上补短板,不会推翻整个架构。 很多人喜欢在科技圈追新,什么新概念出来就把老东西踩得一文不值,可星型模型这次翻红给了我们一个提醒:经过十几年工业界检验的设计,从来不会真的过时,只是在等一个新的应用场景,重新发光而已。

作者|大讲堂

排版|大讲堂

审核|白杨

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:星型模型:数据仓库时代的旧设计,为何成了AI大模型的新基建?
文章链接:https://www.lfdjt.com/info_23_20563.html