别背百科定义,我给你画一张能摸得着的网
随便打开百科,都会给你甩一句“知识图谱是结构化的语义知识库,用于描述物理世界中的概念及其相互关系”。说的都是啥啊?说实话,我第一次看到这句话,盯了三分钟,啥也没懂。说白了,知识图谱就是把人类认知世界的方式,复刻给机器。我们认识世界从来不是记一个个孤立的名词,我们记的是关系。我是一个人,我住在南京,我爱吃盐水鸭,盐水鸭属于金陵菜,金陵菜是苏菜的分支,苏菜的口味特点是清淡鲜甜——在知识图谱里,每一个单独的信息点叫实体,把这些点串起来的连线就是关系。一张网铺开,所有东西的位置都清清楚楚。

早先的搜索引擎是什么逻辑?你搜“盐水鸭和桂花鸭的区别”,它就满互联网找同时出现这两个关键词的网页,按热度排序堆给你。你得自己翻个三五页,才能理清楚两者到底是什么关系。现在呢?知识图谱直接把两个实体的关系梳理清楚,直接放在搜索结果最顶上,告诉你桂花鸭是盐水鸭的一个细分品类,核心差异是腌渍时加入了桂花提香,你不用点进去翻半天。是不是爽多了?我最早实打实感受到知识图谱的用处,是好几年前写毕业论文找文献的时候。搜一个冷门方向的学者名字,知识图谱直接把他发过的所有论文、带过的学生、合作过的研究机构全列出来,连相关方向的其他研究者都给你串出来,比我一个个数据库翻找快了不知道多少。
很多人搞混的两个误区,今天掰扯清楚
第一个误区,很多人觉得知识图谱就是大数据,换个包装而已。不对啊。大数据是一麻袋混在一起的碎玻璃,什么尺寸什么花纹都有,堆在那里就是一堆,谁也分不清谁。知识图谱是把这些碎玻璃捡出来,按花纹、颜色、出处一块一块拼好,最后拼出一整块能照见东西的镜子。它的核心从来不是“多”,是“连”。对吧?
第二个误区,就是觉得知识图谱是大厂玩的黑科技,和普通人没关系。真不是。我前两年去南京老门东逛,碰到一个做非遗推广的小伙子,他给本地的民间剪纸做了个小型知识图谱,把每一种剪纸纹样对应的寓意、传承人手稿、适用的节日场景全连在一起。游客扫一下展架的码,点个“三多九如”纹样,就能看到这个纹样从清代传承到现在的脉络,还能看到同一个传承人做的其他纹样,比放个干巴巴的“该纹样寓意吉祥”的介绍牌,有意思太多了。

不过话说回来,大厂的知识图谱动不动几亿个实体,这个小剪纸知识图谱拢共也就几百个,规模差很多,但核心逻辑一模一样。就是把零散信息的关系理清楚,让人能顺着线找到自己要的东西。我还在网上见过一个书友,给自己的几千本藏书架了个私人知识图谱,哪本是哪个作者写的,作者还出过什么书,哪本和哪本同属一个系列,甚至哪本是哪个朋友送的,都连好线。找书的时候搜一下作者名字,同作者所有藏书全跳出来,比按内容分类摆书架还好用。你看,知识图谱哪有那么玄乎,你愿意花点时间,用网上的免费工具就能搭个自己的小的玩。
那些藏在推荐流里,你没察觉的小问题

我最近刷短视频推荐,就发现一个挺闹心的事儿。前阵子我家猫得了一次感冒,我搜了两条猫感冒护理的内容,好家伙,接下来整整半个月,打开推荐页一半都是宠物生病、宠物医院广告,我本来天天看的美食探店内容全给挤没了。为什么会这样?知识图谱给我打了一个“关注宠物医疗”的实体标签,就把所有沾边的内容都往我这推。它只认得实体之间已经连好的线,根本不知道我只是这两天临时需要,不是想开宠物医院。
还有更离谱的,之前我搜南京一位民国时期的老作家,知识图谱直接把另一个同姓名作者的作品全安他头上,错得一塌糊涂,你说扯不扯?现在绝大多数知识图谱的连线,都是机器爬取网上的内容自动生成的,爬的时候看错了,连错了线,就错在那里,很少有人会专门去改。更扎心的是,冷门的内容根本连不上线。你去搜那种偏门的老手艺,比如老南京做绒花的不同技法流派,整个知识图谱里没几个实体,更别说把流派、传承人、作品之间的线连起来了。这些内容就像掉在网外面的碎珠子,根本没人能顺着网找到它们。
现在圈子里都在说,知识图谱是实现通用人工智能的基础,这话没错。它确实帮机器把人类已经攒了几千年的知识理清楚了,让机器能像人一样“看懂”东西之间的关系。但也别吹得太神。它到现在为止,都只能整理我们已经知道的关系,没法自己跳出这张网,想出新的连接。它知道盐水鸭加桂花是桂花鸭,但是它想不到把桂花和巴斯克蛋糕搭在一起做新品,这种事儿还是得人来干。说白了,它就是个帮人整理信息的工具,帮你省掉翻找梳理的时间,不是什么能颠覆一切的黑科技。
你今天出门搜馆子,或者刷推荐页的时候,不妨多停两秒。想想现在有多少个实体,多少根线,正在把你想看的内容,送到你面前。挺有意思的。
作者|科技
排版|科技
审核|阿辰