没人注意的闸门
所有人都盯着显卡,盯着算力,盯着台积电的3nm。可没人去问,那个在每一层Transformer里被重复调用几百万次的Softmax,到底是谁在赚钱?这个函数看起来像是AI世界里的自来水——你拧开龙头就有,可它根本不是免费的。
为什么是现在?因为大模型卷到Token级别了。两年前还在拼参数数量,现在拼的是“每Token成本”。而Softmax在长序列推理中的内存访问量,已经超过矩阵乘法,成为事实上的天花板。再不改变游戏规则,谁家的数据中心都扛不住。
说实话,我第一次看到这个结论是有点意外的。当时我在翻一份英伟达的工程博客,他们把GPT-4的推理开销拆开,Softmax的占比居然高达17%,还是在用了Tensor Core的情况下。要是换成CPU推理,这个数字能飙到34%以上。这不是边缘问题,这是核心矛盾。

所以你看,英伟达在Hopper架构里专门加了Transformer引擎,干的就是把Softmax和LayerNorm这类“小动作”揉进FMA指令里。AMD的CDNA3同样在搞。不过话说回来,这还不是最狠的。
巨头们在抢什么
最狠的是算法和硬件的合谋。去年FlashAttention v2出来的时候,我盯着那张对比图愣了半天——同样的显存,吞吐量翻了几倍。秘诀不是别的,就是重排了Softmax的计算顺序,把内存访问量降了一个量级。这玩意儿不需要台积电的先进工艺,纯粹是脑袋里的创新。
你可能会问:Softmax不是已经写进PyTorch了吗?怎么还有这么多花样?是啊,写进去的是标准库,可你要的是“能多接几个并发请求”的优化库。就是这毫厘之差,让供应商有了卡脖子的机会。
现在赛道上有三拨人:英伟达靠CUDA生态硬压,TPU靠JAX锁客,Cerebras那帮人干脆把Softmax做到晶圆级芯片里,用物理电路消灭内存搬运。谁赢?我押英伟达,但不是说它技术最好,而是它够“脏”——能把优化好的算子库提前塞给开发者,让你用脚投票都没得选。

未来12到18个月,我赌一定会出现并购。不是巨头吃初创,就是云厂商收购算子库团队。为什么?因为自研芯片的谷歌和亚马逊发现,光有算力不够,软件栈里的“软肋”才是卡脖子地方。而Softmax这种算子,恰好是软硬结合最紧的一环。
算一笔账:Softmax怎么生钱

商业上,Softmax的边际成本曲线很性感。你做一个模型,训练时算一次Softmax,推理时每生成一个Token都要算一次。所以推理次数越大,Softmax的总开销就越像一种“从量税”。谁能把单次Softmax的功耗降下来,谁就能在云服务定价上打价格战。
我算过一笔账:一个日活千万的聊天机器人,假设每天推理100亿次,Softmax如果从标准版换成Fused版,一年能省下大概800万美元的电费和运维成本。这不是小钱。更妙的是,这种优化还让单条请求的延迟变低,用户体验好了,用户就更愿意用长文本,新的需求就这么被造出来了。
再往大了说,Softmax直接决定了模型能否“上手机”。手机上跑大模型,内存带宽是寸土寸金,FlashAttention这种重排思路,让4K上下文里的Softmax内存占用从O(N^2)降到O(N)。没有这个,你手里的手机只能跑几百字的聊天,而不是三万字的会议纪要。
所以别只盯着芯片工艺。Softmax这层“软件硬币”的正面,是算法优化带来的无风险套利;背面,是硬件厂商把函数变成IP授权,每片芯片抽成的商业模式。说白了,这函数就是AI供应链里的“无形商品”,谁抢到了定义权,谁就掌握了整个行业的利润率。
你要是做投资,去查查那些做算子编译器的小公司;你要是做创业,去啃边缘端的大模型推理优化,把Softmax和Attention嚼碎了,比做一百个应用有价值。我的建议很直接:未来半年,把目光从GPU的FLOPS上挪开,盯住那些看似不起眼的算子——那里才是真正藏金子的地方。