要闻
WAIC最安静的展品,和750个轰鸣的机房
9 件在你面前。会跳舞的机器人,能聊天的数字人,写代码的 Agent。拍照,互动,发朋友圈。
而位于 H2 馆 A101 展区那件,你得走过去才是一排机柜。这排机柜是昇腾 Atlas 950 SuperPoD,1024 张 NPU 卡在里面运行。没有交互界面,很少有人排队合影,它就那么亮着灯,路过的人扫一眼,可能就去找隔壁会动的机器人了。
现在不一样了。你打开一个 Agent,说帮我订张去上海的机票。它要同时查航班、比价格、读退改规则、填乘客信息、调日历确认时间。十几件事并行推进,每一步都在计算,且用户对延迟的容忍度极低。
这时候加更多机器反而更慢。因为节点增加后,多机之间的通信延迟会急剧上升。你以为算力在跑模型,实际上大量时间耗在机器之间的数据搬运上。业界把这叫通信墙,机器算得再快,多机互联效率低,整体算力就会打折扣。
还有另一个瓶颈。大模型动辄万亿参数,MoE 架构的模型甚至朝着十万亿发展。一台机器的内存装不下整个模型,必须切开分到不同机器上。一旦切开,每次调用都要跨机搬运数据,导致显存利用率下降。业界管这叫显存墙。
通信墙影响协同效率,显存墙限制模型规模。两堵墙的解法其实是同一个:把多台独立的机器,在物理和逻辑上整合成一个计算单元。
昇腾 Atlas 950 SuperPoD,简单说就是通过一套叫灵衢的高速互联协议,把 1024 张卡拼成一台计算机。由此实现了 1024 张卡共享同一段内存空间,不再各算各的再汇总。
还有两个关键词:256TB 统一编址。这意味着万亿参数的 MoE 模型跑在上面,跟跑在一张卡上一样流畅。跨机柜的数据搬运开销,被架构本身消化。通信墙和显存墙,同时被这一架构解决。
过去五年,算力竞争围绕单卡性能展开,谁的制程更先进,谁的峰值算力更高。但 Agent 时代到来之后,模型规模突破单机极限,推理需求成倍增长,决定 AI 能跑多远的已经不是单卡速度,而是千卡能否像单卡一样协同工作。
Atlas 950 SuperPoD 虽然在展台上是第一次亮相,但昇腾超节点技术在市场上不是新面孔。这届WAIC上,鹏城实验室与全球计算联盟联合发布的明确提出,超节点已成为AI基础设施建设全新范式。其核心在于通过跨物理节点的统一内存编址,把多台独立机器在逻辑上变成一台计算机来调度,这恰恰解决了Agent时代最棘手的通信墙和显存墙问题。
更值得一提的是,上一代 384 卡超节点已经累计发货 750 套,每一套都是签了合同、付了钱、在生产环境里运行着的。覆盖互联网、运营商、金融、教育、医疗、交通、制造等 20 多个行业。
750 套意味着什么?这已经过了需要推广的阶段,市场已经用订单验证过了。750 套证明的是跑得稳、用得起、回得来。
但规模商用只是第一步。算力生态要真正确立竞争壁垒,还需要行业标准与技术生态两根柱子协同支撑。
第一根柱子是行业标准,本届 WAIC 上,GCC 全球计算联盟联合鹏城实验室发布了,中国首次有了自己的超节点产业标准。这份文件定义了超节点的概念、架构特征和技术边界。标准这件事容易被当成一份技术文档略过去,但它是产业最底层的竞争。谁定义标准,后来者就按谁的规则走。中国从追赶标准到拿出标准,这个角色切换本身就是信号。
第二根柱子是技术生态,CANN 是昇腾的软件底座,角色类似 NVIDIA 的 CUDA,而今天CANN 已全面开源,67 个社区项目,1244 万行代码,月活超过 3500 位开发者。兼容 Triton、PyTorch、vLLM、SGLang,支持 600 多个开源生态算子。一个今天用 PyTorch 写模型、用 vLLM 做推理的开发者,明天切到昇腾上,工具链不用换,习惯不用改。
这是国内证券行业最大的液冷数据中心之一,核心 AI 负载运行在昇腾超节点上。券商对算力的要求与互联网公司完全不同。互联网追求快,响应再快一点,吞吐再高一点。券商第一要求是不出错。交易系统崩一秒,后果是可量化的资金损失;风控模型慢一分钟,风险敞口就多暴露一分钟。
金融行业选算力底座,从来不选参数跑分最高的,看的是谁已经经过足够长时间的稳定运行验证,谁有足够多的同行在用,出了问题是否有完善的兜底机制。
国泰君安把 AI 核心负载放上来,这个信号本身就比任何性能白皮书都有说服力。你跟券商讲参数,它不听;它只看你在谁家已经跑过,跑了多久,出没出过事。
智源研究院用昇腾超节点运行 Brainμ 神经科学大模型,基于 7 万多晚睡眠脑电数据,进行跨个体、跨模态分析,连续 10 个月稳定运转。今年 6 月,这项研究联合清华大学发表在 Science 上,首次证实睡眠中的记忆重激活可以反向调控睡眠结构,推翻了睡眠是被动恢复过程的传统认知。
这个过程中,科学家不需要瞬时峰值性能,需要的是连续 10 个月、每天面对不同实验条件的新数据,分析结果始终可靠。Brainμ 的分析结果经过超 3000 晚的人工双盲验证,与神经科学博士高度一致。Science 不会因为你的算力底座稳定就发论文,但底座不稳定,10 个月的实验数据出一次差错,论文就发不出来。
同一个底座上还运行着其他成果。中科大灵境造物用昇腾做新材料创制,消防服隔热能力提升 21 倍,直接关系到一线消防员的生命安全。中科院磐石 100 用昇腾做太阳耀斑预警,对 X 级耀斑实现 100% 捕获、零漏报。2003 年那次导致日本卫星损毁和瑞典电网崩溃的 X28 级耀斑,如果当时有这个系统,就能提前预警。
金融场景要求不能出错,科研要求长期撑得住。这两种严苛的业务需求,昇腾超节点都通过了实践检验。
过去五年,AI 算力领域的叙事围绕一个字:快。制程更先进,峰值算力更高,带宽更大,每一代产品都在数字上追赶。
Atlas 950 SuperPoD 的亮相和 750 套商用同时出现在这届 WAIC 上,传递了一个不太一样的信号:单品性能竞赛的天花板已经可见,系统效率的竞争刚刚开始。
GCC 白皮书把超节点的定义写进了产业标准,CANN 的开源代码每天被 6 万多次,全国各地机房里的机器不分昼夜地运转。这些事实合在一起,指向同一个判断:AI 算力竞争的主战场,正在从芯片转向系统。
判断一项技术是否真的到了临界点,不看展台上的灯亮不亮。要看它离开展台之后,还能不能自己走下去。