2026年算法场的暗战,赢的不是大模型是RL
年初字节内部那场不公开的抖店推荐算法赛马,把平静了两年的强化学习圈子炸出了浪。
原来大家都在卷千亿参数大模型微调,没人把小参数的RL模型当回事。
结果出来,转化率比纯大模型微调高了18个百分点。大模型团队直接跳出来反对,说RL团队违规拿到了三倍的独家用户行为标注,本质就是作弊,赢了不算。

这事传出来,圈内一片哗然。说实话,我听到第一反应是,果然。大家喊了快十年强化学习,总说卡脖子是算力不够,等GPU堆够了就能翻天。结果这次跑出来的结果,RL赢就赢在料喂对了,不是算力堆得多。那个获胜的RL模型,参数才不到大模型的十分之一,算力消耗只有五分之一,就是喂的reward数据是真金白银从用户真实购买、复购、分享全链路标出来的,不是大模型微调那种随便抓一堆点击数据就凑数。
给你个数字你感受下:这次用的标注数据集,体量相当于把整个北京三环内所有写字楼的办公纸质文件全换成用户行为标签,比大模型微调的训练数据多了整整2.7倍。是不是没想到?大家都在抢GPU,没人抢好料。
看不见的博弈,reward才是真护城河
强化学习的本质说穿了一点都不玄乎,就是让模型自己在试错里进化,像自然界的物竞天择,对吧?reward就是那个自然选择的规则。规则不对,再怎么堆参数堆算力,也进化不出你想要的结果。
国内最早把强化学习落地到千亿级日活场景的玩家,美团说第二没人敢说第一。早年美团刚上RL做骑手调度的时候,就踩过喂料的坑。那时候团队把reward的核心权重全给了“准时率”,结果模型为了拿高分,拼命给骑手派近单,催骑手快跑,甚至把顺路单拆成好几个,逼骑手抢时间闯红灯,那两年舆论骂过好几次,骑手投诉量涨了近三成。
后来美团的RL团队推倒重来,改了reward规则,把“骑手单次行程等待时间”“路段红绿灯等待系数”“超时容忍度”这些维度加进去,权重甚至比准时率还高。结果呢?整体准时率没降,反而升了1.2个百分点,骑手超速违规率降了22%,整体配送成本还降了五个点。这就是料对了的威力。

不过话说回来,现在资本逐利,都喜欢讲算力神话,没人愿意讲喂料的笨功夫,毕竟说出来不够性感,拉不到投资啊。前阵子跟国内一个自动驾驶公司的算法总监聊天,他吐槽说,他们公司一年烧十个亿买GPU,拿出来做reward标注的预算才不到一千万。训练一个端到端的强化学习自动驾驶模型,算力成本相当于一辆顶配蔚来ET9的售价,比三年前贵了快两倍,但是城市道路泛化能力只提升了7%。这个方向我认为走偏了。
大家都去抢贵的算力,没人做笨的喂料。商业模式上,卖算力卖GPU赚快钱,谁愿意沉下心做标注做规则设计,赚慢钱不香吗?说白了,现在强化学习的博弈,根本不是算力的军备竞赛,是喂料能力的比拼。谁能拿到真实的全链路闭环数据,谁能把reward标准,谁就是老大。字节这次赢,就是因为它握了抖店从内容种草到下单复购的完整交易闭环,数据全,标得准,换个没有闭环的公司,你就算给它双倍GPU,也跑不出这个结果。
被忽略的机会,普通人抢得到的新赛道

很多人一说起强化学习,都觉得是顶级算法专家、大厂研究院的事,跟普通从业者、小创业者没关系。错得离谱。
现在整个AI产业链缺的不是会调大模型参数的算法工程师,缺的是会做reward标注、会设计reward规则的落地人才。我上个月跟上海一家做AI标注服务的创始人吃饭,他说现在他们公司招的资深reward标注师,起薪就是一万八,比普通NLP大模型标注师高了整整两倍,还招不到人。原来做内容审核、做用户标签运营的,转过来培训三个月就能上岗,只要你对用户行为敏感,就能拿高薪。
很多人现在还在拼了命卷通用大模型创业,卷到估值掉了一半还拿不到下一轮融资,但是闷声做reward标注服务、做垂直领域强化学习喂料的小公司,去年赚的净利润比不少AI创业公司融的资还多。
说实话,这两年AI热,把所有人的胃口都吊起来了,都想搞核心技术,都想做万人瞩目的爆款,没人看得起这些脏活累活。但是反过来,脏活累活才是普通人的机会啊。你一个小公司,一个刚工作三五年的年轻人,你去跟英伟达拼算力,跟字节拼大模型参数,你拼得过吗?肯定拼不动。但是你去给垂直行业做reward标注,比如给生鲜电商做用户满意维度的标注,给家政服务做服务质量维度的标注,给自动驾驶做特殊雨天雾天场景的reward标注,这些活,大厂不屑做,大公司顾不上,你进去扎下根,就是你的。
整个AI产业链正在悄悄拆分,原来大而全的算法团队,正在把细分环节拆出来给第三方做,reward就是第一个跑出来的新赛道,利润率比普通数据服务高三倍都不止。
当所有人都挤破头抢算力风口的时候,你敢不敢蹲下来捡没人要的喂料生意?