SIMT:算力围城下的最大变量,谁在闷声发大财?

算力这东西,过去十年是英伟达的独角戏,CUDA 一统江湖。但现在,风向变了。SIMT(单指令多线程)不再只是 GPU 内部的执行模型,而是成了巨头们抢滩 AI 算力的新赌注。为什么是现在?因为摩尔定律的尸骸还在冒烟,但没人敢再押注晶体管缩放了。你需要的是效率,是更狠的并行度,是 SIMT 这种“让一万个线程同时跑”的暴力美学。

别跟我扯架构,告诉我谁在卡位

英伟达当然是老大哥,Hopper 和 Blackwell 把 SIMT 玩成了印钞机。但你没看到的是,AMD 的 CDNA 3 正在咬着牙往数据中心里塞更多 CU(计算单元)。这不是技术问题,是生存问题——AI 训练成本高到只有疯子和巨头才玩得起,而 SIMT 的能效比直接决定你账面上的钱能烧多久。

真正的黑马,是那些你不太在意的玩家。

比如,Cerebras 的晶圆级引擎,直接把 SIMT 扩展到了整个晶圆。听起来很疯狂对吧?但人家用 44GB 的片上 SRAM 把内存带宽瓶颈砸碎了。还有 Tenstorrent,这个由 Jim Keller 掌舵的公司,把 SIMT 和 RISC-V 揉在一起,走的是开放生态的路子。别笑,这可能是未来十八个月里最狠的一刀。

SIMT GPU 与 CPU 线程调度对比图
SIMT GPU 与 CPU 线程调度对比图

再说说国内。华为昇腾虽然在生态上是瘸腿的,但昇腾 910B 的 SIMT 效率已经能让英伟达在中国的销售团队失眠。燧原科技这东西,我在一次闭门会上听到他们的推理卡在推荐系统里把 TCO 干到了英伟达的六成。说句实话,这已经不是追赶的问题了——是在重新定义“够用”的边界。

洗牌前夜:大鱼吃小鱼,还是怪物吃大象?

未来 12 到 18 个月,你会看到至少三起大额并购。谁会被吃?那些只有一张芯片图纸、却没有任何软件栈的初创公司,死得会很惨。

我跟你讲个残酷的事实:SIMT 的护城河不在指令集,而在编译器和开发者生态。英伟达为什么能笑到最后?因为 CuDNN 和 TensorRT 已经把硬件的潜能榨干了。你要挑战它,就得先啃下这块最难啃的骨头。

所以,你看好那些一边做硬件一边偷偷搞编译器团队的玩家。比如,SambaNova 收购了开源编译器团队,就是为了打通从 PyTorch 到他们自定义 ISA 的快速通道。这种看似赔本的买卖,其实是在布局下一个十年的入场券。

至于并购方向,我可以大胆预测:传统 CPU 巨头(Intel、AMD)会继续买小芯片团队,而不是自己研发。因为他们嘴上都骂 SIMT 是邪路,身体却很诚实——毕竟 AI 服务器市场的毛利率摆在那里,谁的股东不眼红?

SIMT 并行计算与企业 AI 服务器部署成本曲线图
SIMT 并行计算与企业 AI 服务器部署成本曲线图

商业闭环?先把边际成本降到地板上去

很多人对 SIMT 的盈利逻辑有误解。他们以为卖芯片是生意,其实真正的生意是卖“算力服务”。

你看 CoreWeave 干的事:买一堆 H100,然后按小时租给初创公司。这背后,靠的是 SIMT 带来的极致资源利用率——当你的线程调度效率比别人高 20%,你的每小时定价就能比 AWS 便宜 15%,然后还能有 30% 的毛利。这就是商业模式的降维打击。

再往深了说,SIMT 的边际成本下降来自于两件事:

  1. 超线程复用:当一批任务不需要全部 SIMT 线程时,空闲的线程可以接着跑其他独立任务。这活儿 NVIDIA MPS(多进程服务)在做,但大多数玩家还没意识到这有多重要。
  2. 内存墙打破:HBM 价格在跌,却没人告诉你,新一代 SIMT 的片上缓存能吞掉一半的显存访问。省下的钱,就是利润。

所以,我的判断是:未来能跑通商业闭环的 SIMT 公司,必须同时握住三个抓手——硬件算力密度、软件编译效率、以及按量计费的云化能力。缺一个,你就是给英伟达当垫脚石的命。

别废话了,行动指南

别废话了,行动指南
别废话了,行动指南

你想赚这笔钱?要么重仓那些有自有编译器的小公司,要么直接去抢数据中心里跑推理的标的。别碰那些只谈论文不谈营收的“科幻芯片”——明天他们就会死在流片的路上。对于企业用户,我建议你从 GPU 转向更偏 SIMT 的异构平台,先拿一批对延迟不敏感的离线任务做验证。如果效能提升超过 30%,那就果断扩大测试范围。

实话实说,这赛道越来越拥挤了,但正因为拥挤,那些能解决实际问题的产品才会被迅速剥离出来。你要做的,就是别被抱着老架构不放的厂商耽误了。

赶紧动,别犹豫。

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:SIMT:算力围城下的最大变量,谁在闷声发大财?
文章链接:https://www.lfdjt.com/info_23_12556.html