久冉科技

热点

Kimi K3[*]疯海外,国产超节点集体亮相,中国AI合力出击

时间:2026-07-20 14:08 阅读:

  DeepSeek决定专门针对华为芯片优化V4版本,标志着其在战略上从依赖美国半导体转向更多采用中国本土AI设备。DeepSeek的官方技术报告里,华为昇腾与英伟达被并列写入硬件验证清单。

  紧接着,智谱GLM-5.2开源首日就完成了与华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞八大国产算力的全适配。MiniMax M3同样实现了与华为昇腾、摩尔线程、沐曦、昆仑芯、海光等芯片的Day 0适配。

  “Day 0适配”这个词今年被频繁提及——模型发布当天,芯片就已经能跑了。这在三年前几乎不可想象。当时国产大模型默认跑在英伟达上,国产芯片是备胎。现在,国产芯片成了首发阵容。

  清程极智是这股浪潮里最会玩的一家。这家清华系公司联合联泰集群等算力伙伴,在世博展馆打造了Token“前店后厂”双场景互动空间——“后厂”是算力集群,“前店”是Token商店。清程极智联合创始人师天麾告诉我们,这样做是为了“打破专业内容与大众之间的展示壁垒”,“让Token算力基础设施不再局限于专业圈层,真正走进大众视野”。

  自研赤兔推理引擎是清程极智的核心产品之一,它是真正面向国产芯片原生优化的推理引擎,而非简单移植海外方案。清程极智联合创始人唐适之举例说,DeepSeek等新一代大模型原生采用FP4精度训练,但国内绝大多数国产芯片硬件层面不具备FP4/FP8原生计算单元。传统方案只能转成BF16或降级INT8,赤兔通过自研软件浮点模拟计算架构解决了这个问题。硬件成本上,传统开源推理框架部署DeepSeek满血版至少需要4台国产8卡服务器,搭载赤兔后仅需单台即可完整跑通

  在清微智能展台,相关负责人也对凤凰网科技表示:“大家都来看了,也是在横向对比——我要买一个Token工厂,你的方案怎么样?”他给我们算了一笔账:客户选谁,看的是“建设成本、部署和互联成本、运营成本”三项叠加,“直接决定了百万Token的性价比”。

  目前,清微智能的客户构成以三大运营商和区域性算力节点为主,“他们有比较强的国产化动力,你跟他讲国产自主可控的架构,他会比较buy in”。

  提到当前的算力紧张问题,这位工作人员提到两个方向:一是模型侧优化降低Token消耗,二是算力侧“用国产替代英伟达”,“英伟达的建设成本是最高的”。

  逛完整个展馆,一个感受越来越清晰:国产芯片的硬件参数在追,但真正难追的,是英伟达藏在硬件之下的那道护城河——CUDA软件生态。

  “大量模型的训练还在CUDA上面,相当于在苹果iOS上训出来的模型,要放到你的安卓上去用,就得改。但你的安卓,用的人还不够多。”前述清微智能负责人告诉凤凰网科技。

  清微智能透露,他们联合华为、寒武纪、摩尔线程、天数智芯、燧原科技等九家单位,与北京智源研究院一起做联合生态。“大家不要再每家重复造轮子了,芯片公司把注意力放在芯片上,操作系统交给‘安卓’去干。”目标是今年在80%的层面上替代CUDA。

  摩尔线程是这场“国芯国模”运动里走得最远的玩家之一。展台工作人员向展示了三大“AI工厂”——模型训练工厂、词元生产工厂、智能体生产工厂。其夸娥万卡级智算集群已成功落地,Dense模型训练算力利用率达60%,有效训练时长达90%。

  摩尔线B基础模型从零开始的完整训练,以及全球首个5D世界模型“北大EvoPhys-World”的全栈原生训练。上半年预计营收16.5亿至17.5亿元,是去年同期的2.35至2.49倍。

  上游,Kimi K3、DeepSeek V4、智谱GLM-5.2、MiniMax M3——国产大模型在性能上追到了全球前三,在价格上打到了海外同行的几分之一。

  中游,这些模型发布当天就主动适配国产芯片——华为昇腾、摩尔线程、沐曦、燧原、寒武纪、昆仑芯——能上的全上。

  中间还有清程极智、清微智能、硅基流动这样的公司,用推理引擎把芯片算力和模型需求高效对接起来。

  这不是某个环节的突破,而是一条完整产业链的协同发力。目标很明确——围剿英伟达的硬件垄断,挑战海外大模型的高价壁垒。

  2025年初,DeepSeek刚刚爆火时,我们曾过一位算力赛道的资深人士,其曾经告诉我们,当时国内最强模型还跑在英伟达芯片之中,这是该让人担忧的事情。彼时,他们认为性价比将会是国产生态的最大[*]手锏。但他也提及,做生态远比做产品难的多,当时的国产芯片还不好用,但他相信,一切只是时间问题。

  而现在,仅仅一年多过去,一切都变了。国产生态建立的速度比任何人料想的都要快,在WAIC,这种氛围尤其浓厚。

  Kimi K3又一次在海外引发讨论,复刻去年的DeepSeek时刻,更多的是因为海外正越来越多的看清自己的硬伤是成本——训练成本高、推理成本高、API定价高。中国这边的打法是用性能接近的产品,配上国产芯片的性价比,再把Token生产的每一个环节都压到极致。这可能是一次席卷式的扫荡。