华为的昇腾之路:从追赶英伟达到另辟蹊径的集群战

HSK 8テクノロジー上級虎嗅
2387 字~11分HSKレベル: HSK 8
华为的昇腾之路:从追赶英伟达到另辟蹊径的集群战
再生ボタン
拼音
原文を見る

近年来,全球人工智能算力竞争日趋白热化,英伟达凭借其GPU产品和CUDA软件生态长期占据市场主导地位。然而,在地缘政治与出口管制的双重压力下,中国科技企业华为正在走出一条截然不同的追赶之路。华为监事会主席郭平曾罕见而直白地表示:“华为的目标是成为英伟达。”但他随即划定了清晰的边界:华为的核心优势不在于拥有自研大模型,而在于支持客户构建优秀的大模型,确保全球各种大模型都能在华为的昇腾、鲲鹏、超节点及集群上高效运行。这一表态并非一时的豪言壮语,而是有系列产品发布作为支撑的战略说明书。

回顾历史,华为与英伟达的渊源颇为复杂。早在2020年之前,华为几乎所有芯片都从美国采购,一度是英伟达在中国最大的客户之一。当时,华为的智能云硬件平台Atlas在市场拓展上面临的最大阻碍,就是服务器动辄六七十万元的高昂售价,其中仅英伟达的算力卡便占去了40万元。高昂的成本导致这一代产品市场销量寥寥无几,多靠华为内部消化。事实上,转向自研的线索早已埋下。2016年CES期间,华为海思总裁何庭波与英伟达CEO黄仁勋有过一次关键交谈。彼时,英伟达宣布淡出手机芯片市场,何庭波试探性地询问能否将相关技术授权给华为,却遭到黄仁勋当场拒绝。这次拒绝让何庭波坚定了布局AI芯片的决心。回国后,她一度接触了寒武纪,但在听完相关技术演讲后,判断华为内部同样拥有优秀人才,随即把开发AI处理器的任务交给了廖恒。2017年,代号为“达芬奇”的内部AI芯片预研究项目正式立项。

如今,廖恒已担任华为半导体首席科学家。他曾带领团队系统梳理了过去十多年的深度学习成果,发现一条完全不同于英伟达的技术路径。当时,英伟达走的是“积木拼装”的CMP多芯粒异构封装路线。华为想得很清楚:如果像素级模仿英伟达,做出来的产品顶多价格略低,性能却未必跟得上。于是,华为选择了面向特定领域优化的DSA专用架构路线。传统CPU走的是串行处理,一次只算一个任务;英伟达的GPGPU走的是大规模并行,让成千上万个线程同时运行。华为没有选择这两条路中的任何一条,而是把计算单元改造成了三维立体的方块阵列。这种设计使得芯片每瓦功耗能换来的AI算力大幅提升。

2018年上半年,自研昇腾芯片项目正式启动,主要瞄准数据中心推理卡和边缘计算两个场景,明确对标英伟达GPU。然而,华为很快发现,光有芯片远远不够。芯片必须依赖软件生态才能发挥价值,而英伟达的CUDA平台是开发者无法绕开的基础设施。华为曾试图向英伟达申请授权,结果同样遭到拒绝。这条路走不通,华为决定改变策略:不与英伟达比拼单一产品的参数和性能,而是把产品形态从一块卡扩展为一台机器、一个机架、一个集群乃至一个规模化数据中心。这一选择赋予了华为更大的设计自由度,也避开了单卡竞争的正面战场。

在全联接大会上,华为正式发布了采用NPO技术的昇腾960超节点,并公布将在2027年上市。此前,昇腾910C超节点已部署超1000套,昇腾950超节点已规模商用。昇腾960超节点最多可容纳4096张卡,算力达到8 EFLOPS FP8和16 EFLOPS FP4,内存容量达到1PB。这相当于把512台普通8卡服务器“拧成”一台机器来使用。为解决大规模互联带来的“堵车”问题,华为通过灵衢UnifiedBus协议将十余种互联协议统一起来,带宽从百GB级提升到TB级,延迟从7微秒压降到2微秒。全局内存统一编址,使4096张卡的内存变成一个共享的大池子。此外,华为还推动用5500个自研光引擎替换4.8万颗传统光模块,功耗降低超过550千瓦,无故障运行时间翻倍,一年内非计划停机不到18小时。

更值得关注的是,华为首次公开了一组来自其马尔科夫实验室的仿真数据。由4K超节点组成的10万卡集群,相比由8卡服务器组成的同规模集群,模型算力利用率提升了2.75倍。华为同时透露,目前业界10万卡集群的MFU普遍不足30%,约七成时间处于故障及故障修复状态。MFU每提升1个百分点,10万亿参数大模型的训练周期可缩短约3天。但必须清醒地看到,2.75倍是仿真数据而非实测结果。截至目前,尚未有百万卡级集群在实际生产训练中的验证数据公开。相关负责人在演讲中也承认,100万卡只是技术指标,实际部署中10万卡已可基本满足需求。

英伟达最深的护城河是CUDA软件生态,华为对此始终保持清醒认知。在全联接大会上,华为宣布“昇腾已跨越生态拐点”。数据显示,CANN开源社区月活开发者突破5200名,其中非华为的外部开发者占比达到61%。昇腾还成为首个被全球主流AI框架PyTorch官网直接支持并提供安装分支的中国算力平台,基于昇腾与CANN的原生训练模型已超过40个。然而,“跨越拐点”并不等于“迁移零成本”。业界绝大多数代码都是基于英伟达环境编写的,迁移成本依然高昂。据参与迁移的工程师估算,对于DeepSeek这类开源模型,借助现有生态支持,通常只需额外增加2至3名工程师、耗时约一个月便可完成训练适配;但对于仅公开权重、不开放源码的商业模型,则可能需要约10名工程师额外投入6个月以上。

市场已经给出了阶段性的答案。研究机构Bernstein Research预测,2026年华为将占据中国AI芯片市场50%的份额,而英伟达的份额将从2025年的约40%萎缩至8%左右。另一家研究机构TrendForce的预测更为激进,认为国产AI芯片在国内高端市场的份额将接近90%。英伟达CEO黄仁勋也已公开确认,该公司在中国AI加速器市场的份额降至0%,并在采访中直言,放弃中国这样体量的市场“在战略上并不合理”。然而,这些数据只是反映了地缘政治驱动下的国产替代进程,而非全球技术竞争格局的彻底扭转。英伟达在中国的退场,更多源于外部的出口管制政策,并非产品核心竞争力的直接易主。华为能否真正完成从追赶到引领的跨越,仍需要时间与实战的检验。

リスニング練習

1/57
[A][B]でループ範囲を設定

関連語彙

白热化báirèhuà
becoming intensely fierce; reaching a fever pitch
主导zhǔdǎo
to dominate; leading role
罕见hǎnjiàn
rare; uncommon
直白zhíbái
blunt; straightforward
划定huàdìng
to delineate; to demarcate
支撑zhīchēng
support; to sustain
渊源yuānyuán
origin; profound connection
试探shìtàn
to probe; to sound out
坚定jiāndìng
firm; steadfast; to strengthen one's resolve
模拟mónǐ
to imitate; simulation
赋予fùyǔ
to give; to endow
压降yājiàng
to reduce; to compress downward
护城河hùchénghé
moat; protective barrier (in business context)
萎缩wěisuō
to shrink; to wither

読解問題(0/6)

問題 1/60%

1.根据文章,华为选择不与英伟达比拼单一产品参数的主要原因是?

2.关于昇腾960超节点,下列哪项说法与文章内容不符?

3.根据文章,华为的DSA架构与传统CPU和英伟达GPGPU的主要区别是什么?

4.文中提到“昇腾已跨越生态拐点”,主要依据是什么?

5.关于10万卡集群的MFU数据,下列哪项表述是正确的?

6.对于英伟达在中国市场份额下降的原因,作者最终持什么看法?