无监督学习不是算法问题,是数据主权问题

烧掉七成营收的标注账单

2026年2月,圈内流出一份某头部大模型厂商的内部预算邮件。看了一眼,倒吸一口凉气。他们去年生成式AI业务的全年营收,百分之七十一花在了数据标注上

太贵了。

我跟算法圈朋友算过一笔账:标注100万条符合大模型要求的高质量对话语料,成本差不多2700万人民币。2700万是什么概念?相当于国内一个二线旅游城市全年的文旅推广预算。就这么砸进去,换回来的模型准确率,还比预期低了八个点。

全行业卷完算力卷参数,参数涨上去了才发现,标注才是那个吞金无底洞。原来那套有监督学习的玩法,早就卷不动了。

2026年国内大模型厂商标注成本占比统计图
2026年国内大模型厂商标注成本占比统计图

说实话,OpenAI去年放出GPT-4训练细节,说百分之六十以上的训练数据用无监督生成标注的时候,圈内很多人还没当回事,觉得就是大厂炫技。今年转头一看,国内大大小小的厂商,都偷偷往无监督这边转。

这不叫主动迭代,这叫被逼的。有监督那套逻辑,本质就是人喂机器吃饭,人给每一条数据贴标签,机器跟着学。现在数据量比十年前涨了一百万倍,人的速度跟不上,钱包更跟不上,对吧?

本土玩家提前下的暗棋

很多人觉得无监督学习是新出来的技术,其实不是。这概念几十年前就有,只是之前数据不够多,算力不够便宜,玩不转。现在条件齐了,就成了重新分蛋糕的工具。

很多人不知道,字节跳动早年能打赢内容分发的战争,靠的就是无监督学习这步暗棋。2015年今日头条刚做内容分类的时候,新浪搜狐这些门户都养着几百个编辑人工给内容打标签,分类准确率全看编辑经验。那时候字节总共没十个全职编辑做内容分类,就靠无监督学习做文本聚类,让内容自己找同类。硬生生把分类成本降到了同行的不到十分之一,跑的还比人工快三倍。

现在大模型时代,这个逻辑放大了一百倍。有个扎心的行业数据:标注1T高质量对话数据的成本,比训练一整个70B参数模型的算力成本还要高1.2倍。也就是说,你花一千万买算力训完模型,还要再花两千多万找人标数据,这生意对绝大多数玩家来说,根本没法做。

无监督学习文本内容聚类效果对比图
无监督学习文本内容聚类效果对比图

这本质就是商业模式的博弈。原来做有监督学习,话语权完全掌握在手里攥着标注工厂、囤积了标注数据的头部大厂手里,小厂拿不出几个亿买标注,连行业门槛都碰不到。无监督不一样,你只要有大量的原始行业数据,不需要人工标注,就能训出能用的模型。这不光是降本,这是抢回数据主权。

这个逻辑很像生物进化里的自然选择。原来的有监督学习就是人工选种,你想要什么性状,人就给你一颗颗挑出来,慢,成本高,还很容易挑错,把好的种子漏了。无监督学习就是把一整袋种子扔到适宜的环境里,让它们自己发芽生长,自己迭代出适应环境的性状,人只要最后把长的好的挑出来就行,效率不知道高了多少倍。

现在国内除了字节,智源的悟道3.0、毫末智行的自动驾驶训练,都已经把无监督学习的占比提到了七成以上。说实话,这个方向国内玩家走的比海外还激进,毕竟我们的标注成本压力一点不比国外小,倒逼创新嘛。不过话说回来,我也见了不少炒概念的,把半监督改个名字就叫无监督,割投资人的钱,骗得了一时骗不了长期。

产业链上每个人的新选择题

产业链上每个人的新选择题
产业链上每个人的新选择题

很多人一听到无监督学习,第一反应就是数据标注师要失业了对吧?其实不全是这么回事。

无监督不是完全不需要人参与,只是不需要给每一条原始数据都打标签了。原来一万条数据要标九千九百条,现在只要标一百条做最终验证就够了,低端纯标注的需求确实少了一大半,但是会催生新的需求:给无监督训练出来的模型做验证、做逻辑纠错,这种活对能力要求更高,收入反而比原来的重复标注高不少。说白了,就是淘汰混日子的,留下愿意升级的。

对刚入行的算法年轻人来说也是一样。原来你进公司,每天的活就是调有监督参数、写标注规则,干三年都摸不到核心训练逻辑,现在不一样了,懂无监督的预训练、懂怎么用原始数据做聚类,已经成了进一线业务团队的硬门槛,你不跟着学,就只能被越来越卷的市场挤出去。

对垂直领域的中小玩家来说,这更是一张低成本的入场船票。去年杭州有家做纺织设计的公司,找团队做行业大模型,走有监督路线,供应商报价一千八百万,光是标注就占了一千二百万。后来他们转用无监督训练,把行业积累了十年的上百万份原始面料设计稿扔进去训练,总共花了不到两百万,做出来的模型给设计师用,满意度居然比原来预期的还高十个点。

很多人抬杠说无监督准确率不如有监督,说实话,绝大多数垂直场景根本不差那一两个点的准确率。你做面料推荐、做内容分发、做工业备件检索,准确率差两个点根本不影响用户用脚投票,反而成本降了十倍,你能先把产品推出去占领市场,赢的概率就大太多了。

我抛一个很尖锐的问题留给大家想:接下来三年,掌握了原始数据却拿不出标注预算的中小玩家,会不会靠无监督学习,把那些烧钱堆标注出来的头部玩家,从垂直市场里赶出去?

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:无监督学习不是算法问题,是数据主权问题
文章链接:https://www.lfdjt.com/info_23_16825.html