2026端侧竞赛挖出的十年冷饭
2026年开春,国内手机圈的端侧大模型发布会开了一场又一场。台上大佬吹完参数,台下媒体一测功耗,全都哑火。
谁都知道端侧AI是下一个必争的战场,可谁都绕不开端侧大模型的功耗死结。带不动,跑不起,满负载跑十分钟,手机背板烫得能煎鸡蛋。

有人在业内论坛扔了个帖子,直接炸锅:干嘛非要死磕Transformer?把优化好的循环神经网络拿出来不好用吗?
楼吵了上千层。年轻人说这是十年前的过时技术,拿出来炒冷饭,丢不丢人?老一辈做算法的冷笑,贴出了实测数据:同参数规模下,Transformer端侧推理峰值功耗是循环神经网络的4.2倍,推理延迟差了整整3倍。
真的没人记得它了。
说实话,我刚看到这个争论的时候也愣了,毕竟这五六年,AI圈谁提RNN啊,开口就是Transformer,闭口就是千亿参数大模型,提循环神经网络都嫌你跟不上潮流。可你掰着指头算,现在所有能落地的消费级AI应用,十有八九都是处理时序数据——语音是一串按时间来的,文字是按顺序来的,生理信号、运动轨迹、工业传感器数据全都是时序的。Transformer靠全局注意力堆出来精度,代价就是把所有计算都堆在一起,放到云端没问题,放到一块几块钱的端侧芯片上,就是跑不动。
争议的本质哪是技术新旧?是大家被大模型的浪潮冲昏了头,忘了技术本来就是要适配场景的。
闷声赚大钱的隐形本土玩家
我去年底跟深圳一个做工业语音控制的创始人喝茶,他叫洛辰智能,你大概率没听过,名字都没怎么在融资新闻上出现过。
他给我算过一笔账,他们给煤矿井下设备做离线语音控制模块,要求无网络、低功耗、防爆炸,批量出货的模块,单块成本只有1.2元人民币,比同准确率的Transformer方案低60%,靠的就是优化后的GRU——循环神经网络的一个变体。

你猜他们一年做多少营收?两个多亿。纯利润超过20%。不融资,不烧钱,客户都是国有矿企和工业设备厂商,订单排到半年后。
不过话说回来,为什么这么好的生意,没人抢?
底层逻辑其实很简单:循环神经网络天生就是为时序数据生的,它每一步只保留上一步的隐藏状态,不需要计算整个序列的注意力权重,计算量天生就小,参数利用率比Transformer高太多。但是它有个老毛病,长序列容易丢信息,可放到端侧小模型场景,根本不需要处理几千个token的长序列,十几个几十个token足够用,老毛病直接变成了不存在的问题。
这就像生物进化里的寒武纪大灭绝,体格庞大、食量惊人的恐龙垄断了资源,可一旦环境变化,氧气含量下降,庞大的恐龙扛不住灭绝,反而是体型小巧、能耗极低的早期哺乳动物,占据了空出来的生态位。循环神经网络这次回流,本质上就是AI产业的一次进化补位。
现在的资本就爱听大模型的故事,你说我做千亿参数,分分钟融几个亿,你说我做优化RNN,人家理都不理你,说你这是小生意,没想象力。可洛辰那个创始人跟我说,他见过太多拿了好几亿融资做端侧大模型的团队,烧了两年钱,最后还是偷偷把核心的语音模块换成了优化好的RNN,不然功耗降不下来,成本下不去,根本没法出货。
你说可笑不可笑?所有人挤破头抢的热门方向,最后还要靠“过气技术”擦屁股。
普通从业者看不见的赛道缝隙

我最近跟几家人力资源公司聊天,拿到一个很有意思的数据:今年上半年,国内工业AI领域招懂循环神经网络优化的算法工程师,起薪比普通大模型微调工程师高21%,岗位缺口是简历量的三倍。
说白了,所有人都去卷大模型了,都去学微调,学 prompt 工程了,没人愿意沉下心研究老架构的工程优化了。可市场就是这么有意思,越没人的地方,缝隙越大,钱越好赚。
你想想,现在多少场景需要端侧低功耗AI?智能手表要实时监测心电信号,蓝牙耳机要离线语音唤醒,工业传感器要实时预测故障,自动驾驶要实时预测周围车辆的轨迹,哪一个离得开时序处理?哪一个能接受十几瓦的功耗?这些场景根本不需要7B以上的大参数,几百K几M的RNN足够用,精度差不了两个百分点,成本降一半,功耗差好几倍,厂商用脚投票都会选RNN。
我见过很多刚入行的算法工程师,开口就是SOTA,闭口就是最新论文,觉得做老技术就是掉价。可你仔细想想,哪有什么永远过气的技术,只有不匹配场景的技术。Transformer当年出来干掉RNN,是因为它处理长序列大模型精度更高,赢在了场景。现在RNN回到端侧,是因为它低功耗小计算的优势,又赢在了新的场景。
这几年AI圈太疯了,所有人都往大模型一条道上挤,挤得头破血流,估值泡沫吹得比天还大,可最后落地的时候才发现,原来最卡脖子的不是大模型的精度,是小设备的功耗和成本,而解决这个问题的钥匙,早在十几年前就被造出来了, just被大家扔到了垃圾堆里。
当参数竞赛的天花板越来越近,泡沫一点点挤破,你敢不敢选一条所有人都觉得过气的路?