算力网络异构资源统一调度:被低估的东数西算核心棋局

今年春天去乌镇参加世界互联网大会,挤在运营商的算力展厅里,听见三个不同厂商的技术负责人,吐槽了同一个问题。GPU卡堆了几十上百张,CPU、NPU更是杂七杂八散在各个节点,算力就像装在不同大小、不同接口的木桶里,要用的时候,得挨个开桶掏,掏半天凑出来的,还拼不成一个能用的完整任务。这不是小问题。这是现在算力网络从“建”到“用”转轨,绕不开的最大坎。

为什么现在才要解决“异构调度”这个老问题?

早十年,算力都集中在互联网大厂的自建数据中心。同一个集群,基本都是同型号、同架构的芯片,要么全是英伟达V100,要么全是Intel Xeon,调度起来没那么多麻烦。 这两年不一样了。东数西算工程启动,八大算力枢纽节点铺开来,算力从少数集中的大院,撒到了全国各个角落。西部大基地攒了批量的国产AI芯片,东部边缘机房躺着大量闲置的通用算力,不同行业用户手里还有一堆架构各异的闲置算力。 说白了,现在我们不缺总算力。缺的是把散的、异架构的算力攒起来用的能力。 我见过一个智驾公司的案例,他们要跑上路仿真测试,需要八百张AI卡做并行计算,自家数据中心只有三百张,买新的要等大半年,找别家的,架构不一样接不进去,硬生生拖了三个月项目进度。 这种事,每天都在发生。
算力网络异构算力资源烟囱示意图
算力网络异构算力资源烟囱示意图
原来的烟囱式调度,每个厂商、每个集群各玩各的,一张闲置A100就在隔壁节点,你昇腾集群的任务就是用不了。说白了就是浪费。据业内不完全统计,国内现有数据中心的平均算力利用率,还不到25%。四分之三的算力,就那么闲着耗电。

异构统一调度的核心:不是“拼积木” 是做“万能翻译官”

很多人刚听这个概念,以为就是把所有算力拢到一块池化,拼起来给用户用。不对。 最核心的难点,根本不是把资源放一起,是不同架构的芯片,指令集不一样、编程模型不一样、接口标准不一样。你一个大模型训练任务,要同时调用英伟达A100和华为昇腾910,原来的调度系统根本读不懂不同芯片的指令,就像你让一个只会说中文的人和只会说阿拉伯语的人一起干活,话都听不懂,怎么配合? 所以现在行业公认的路径,是在应用层和硬件层之间,加一层统一抽象适配层。这层就是那个万能翻译官:上层应用只需要说清楚,我需要多少算力、要做什么任务,不用管底层是什么芯片;翻译官自动把任务拆成符合不同芯片指令的模块,调度完再把结果拼回来,对上层用户来说,完全感知不到底层用了多少种不同的算力。 很多人会问,那为什么不把所有芯片都改成同架构?太扯了。不同芯片就是为不同任务生的,GPU适合并行训练,NPU适合低功耗推理,CPU适合通用计算,统一架构反而会损失性能,成本高到没人能用得起。 异构统一调度的技术边界很清楚:不颠覆现有硬件架构,不强制统一标准,只是在调度层做适配,把散的算力盘活。
算力网络异构资源统一调度分层架构图
算力网络异构资源统一调度分层架构图
说实话,这个思路真的很聪明。相当于不用拆了重建旧房子,就给旧房子装了一个智能中枢,把各个房间的水电煤全通起来,想用哪里开哪里。

落地的坑:标准、安全、利益,一个都绕不开

落地的坑:标准、安全、利益,一个都绕不开
落地的坑:标准、安全、利益,一个都绕不开
现在产业走到哪一步了?三大运营商走得最快,中国移动已经在甘肃庆阳、广东韶关两个枢纽节点做了试点,能跨区域调度不同架构的算力,去年已经给部分大模型企业做了定制服务。阿里云、腾讯云也推出了自己的异构调度平台,内部测试的时候,把大模型训练任务拆分到不同芯片集群,整体算力成本降了快三成。 目前用得最多的场景,就是大模型训练推理、自动驾驶仿真、天文射电信号处理这些,本来就需要超大批量算力,单集群凑不齐,刚好适合拉通异构资源来用。 不过话说回来,离大规模商用还有很远,坑太多了。 第一个坑就是标准不统一。现在每个大厂、每个芯片厂商都搞自己的适配层,你接了昇腾就接不了寒武纪,接了英伟达就接不了海光,每接一款新芯片就要重新写一遍适配代码,成本高到中小厂商根本玩不起。信通院去年牵头拉了标准工作组,现在还在争吵阶段,什么时候出统一标准还说不准。 第二个坑是安全和信任。你把用户的任务拆成好几块,调度到不同厂商的算力节点跑,敏感数据会不会泄露?尤其是政企、金融的任务,没人敢把自己的数据随便放到第三方节点上。现在虽然有隔离计算、可信执行环境这些技术,但是大规模用的时候,出问题谁担责?规则还没理清。 第三个坑是利益分配。跨运营商、跨区域调度,算力用了谁的,流量走了谁的,钱该怎么分?原来都是按整集群包年包月,现在拆分调度到按核心、按卡按时长计费,还没有公认的分账规则。涉及到跨区域的能耗指标,更是扯不清,西部输出了算力,能耗算谁的?现在都没说法。 还有不少炒作的水分,不少公司拿这个概念融钱,PPT做的花里胡哨,其实连10种不同芯片的适配都没做完,就敢说自己能全国调度,太扯了。 未来3到5年,这个领域会怎么走?我个人判断,不会一下子搞出全国性的大一统调度网,肯定是先从枢纽节点内部的区域调度做起,先把同一个枢纽里不同厂商的异构算力拉通,再慢慢跨枢纽。标准会在3年左右落地,现在刚需摆在那,各方都会让步,统一的适配接口标准出来后,整个产业的速度会快很多。 最大的产业机会,不在运营商,也不在芯片厂商,在做中间适配层的第三方创业公司。现在各大厂都不想被绑定在一家的适配标准上,都愿意找第三方做通用适配,这个市场现在还是蓝海,没跑出来头部。 说实话,这件事要是真做成了,我们国家的算力浪费至少能降一半,省下的成本,足够支撑再多出十几个大模型创业公司。算力网络,建得好不如用得好。对吧。

作者|大讲堂

排版|大讲堂

审核|知知

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:算力网络异构资源统一调度:被低估的东数西算核心棋局
文章链接:https://www.lfdjt.com/info_23_22167.html