庞大研发为什么仍会错过浪潮:华为的系统工程优势与控制层盲区

如果只看研发规模,华为几乎应该是一家“很难错过任何重大技术浪潮”的公司。

它拥有:

  • 极高的研发投入;
  • 超过十万人的研发体系;
  • 通信、芯片、操作系统、云、存储、能源等横跨多个产业的技术积累;
  • 长期的大型工程项目管理能力;
  • 能够承受多年投入、短期不盈利的组织耐心。

因此,当华为在某些技术方向上并没有表现出与研发规模相匹配的领先地位时,问题就会显得格外值得研究。

最典型的几个例子是:

  • 生成式 AI 时代,盘古并没有成为中国最有影响力的通用基础模型;
  • 数字能源非常强,却没有掌握电芯;
  • 企业存储能力很强,却没有进入 DRAM / NAND 制造;
  • AI 计算平台不断增强,却又受到先进制程、HBM 等底层资源约束。

这些现象很容易被解释成:

“华为看错了方向。”

但如果把这些问题放在一起看,会发现背后其实存在同一种长期组织偏好。

华为最擅长的是复杂系统工程,以及对系统中高价值控制层的掌握。

而这套能力,在过去三十年里极其成功。

问题在于:

当一个新时代重新把底层材料、物理介质和探索型研究推到价值链中心时,过去成功的世界观也可能成为新的盲区。


一、研发规模并不等于前沿创新能力

首先需要拆掉一个很常见的直觉:

[ \text{R&D Spending} \uparrow \quad\Rightarrow\quad \text{Frontier Innovation} \uparrow ]

这个关系并不成立。

研发投入只能说明:

一家公司愿意投入多少资源去解决技术问题。

却不能直接说明:

  • 这些资源是否集中在正确问题上;
  • 组织是否允许高失败率探索;
  • 决策链是否足够短;
  • 是否拥有少数真正顶尖的研究者;
  • 研发目标是工程交付还是科学突破;
  • 当前技术范式是否与组织过去的能力结构相匹配。

这在生成式 AI 时代表现得尤其明显。

一个只有几百人的高密度研究组织,也可能在某个关键算法方向上影响整个产业。

反过来,一个拥有十万研发人员的大公司,也可能因为绝大多数资源分散在:

  • 通信;
  • 芯片;
  • 网络;
  • 软件;
  • 终端;
  • 汽车;
  • 能源;
  • 云;

而无法把足够高密度的注意力集中在某个前沿研究问题上。

所以:

[ \boxed{\text{研发规模不是前沿突破的线性函数}} ]

真正重要的是:

[ \text{人才密度} + \text{方向判断} + \text{实验速度} + \text{组织自由度} ]


二、华为真正的核心能力,是“把复杂系统做成”

华为过去最成功的产业,几乎都具有相似特征。

例如:

  • 无线通信;
  • 光通信;
  • 路由交换;
  • 基站;
  • 芯片系统;
  • 存储;
  • 电力电子;
  • 操作系统;
  • 大规模企业基础设施。

这些领域共同需要:

  • 长周期研发;
  • 极高可靠性;
  • 多模块协同;
  • 标准兼容;
  • 复杂软硬件整合;
  • 大规模验证;
  • 工程纪律。

这恰好是华为最强的地方。

如果把一个大型技术系统抽象成:

[ \text{Physical Layer} \rightarrow \text{Device} \rightarrow \text{Control} \rightarrow \text{Software} \rightarrow \text{System} ]

华为最喜欢占据的通常是中上层:

芯片、控制、协议、软件、系统架构。

因为这些环节:

  • 技术密度高;
  • 差异化强;
  • 容易形成 IP;
  • 可以控制整个系统;
  • 不一定需要承担最重的制造资本。

这可以称为:

控制层偏好。


三、数字能源为什么强,却不造电芯

数字能源就是这个思路的典型例子。

华为在能源领域重点掌握的是:

  • PCS;
  • BMS;
  • EMS;
  • 热管理;
  • 电站控制;
  • 构网能力;
  • AI 运维;
  • 电力电子。

它关注的是:

电如何被转换、管理、调度和优化。

而不是:

电芯内部的电化学机制由谁生产。

从传统 ICT 公司视角,这其实非常合理。

因为电芯意味着:

  • 材料科学;
  • 电化学;
  • 矿产资源;
  • 电池工厂;
  • 良率;
  • 安全;
  • 周期性;
  • 巨额资本支出。

这些能力和通信设备公司的核心积累并不高度重合。

因此,最自然的战略就是:

[ \text{采购标准化电芯} + \text{掌握能源控制系统} ]

这种逻辑和基站非常相似:

不需要自己生产每一块原材料,只要掌握真正决定系统性能和客户体验的核心层。


四、问题在于,电芯后来并没有完全变成 commodity

新能源汽车和储能产业快速发展之后,人们逐渐发现:

电芯并不是一个简单可替换的标准件。

它直接决定:

  • 能量密度;
  • 循环寿命;
  • 快充倍率;
  • 安全边界;
  • 成本;
  • 热管理策略;
  • 系统重量。

于是系统性能可以写成:

[ \text{Energy System Performance}

f(\text{Cell Chemistry},\text{BMS},\text{PCS},\text{Thermal}) ]

电芯本身重新成为系统性能的硬边界。

这时问题就出现了。

如果企业只掌握:

如何管理电池,

却不能影响:

电池本身的物理性能曲线,

那么它仍然可能做出很强的系统,但会失去最底层的一部分技术主动权。


五、数据存储里也存在同样的问题

华为在企业存储领域并不弱。

它可以做:

  • 高可靠存储阵列;
  • 分布式存储;
  • SSD 控制;
  • FTL;
  • ECC;
  • RAID;
  • firmware;
  • AI storage;
  • 数据管理。

但 DRAM 和 NAND 的 wafer fabrication 是另外一个世界。

它依赖:

  • 制程;
  • 蚀刻;
  • 沉积;
  • 高深宽比结构;
  • 良率;
  • 超大规模 fab;
  • 长期工艺积累。

因此,从系统公司角度看,最自然的选择仍然是:

[ \text{Memory Chip} + \text{Huawei Controller} + \text{Huawei Software} + \text{Huawei System} ]

这在全球化时代完全合理。

只要:

内存可以买到。

那么真正值得投入的就是:

控制器、系统和软件。


六、HBM 让过去的分工逻辑突然失效

AI 时代改变了这一点。

过去 DRAM 可以被理解成:

一个高性能计算系统里的内存组件。

但随着大模型训练规模扩大,HBM bandwidth 直接成为算力瓶颈。

一个 AI 系统的性能越来越接近:

[ \text{AI Throughput}

\min( \text{Compute}, \text{Memory Bandwidth}, \text{Interconnect} ) ]

这意味着:

只要 HBM 不够,计算芯片再强也无法充分发挥。

于是过去可以外购的“基础组件”,突然重新变成战略资源。

这就是价值链迁移。

原来:

[ \text{Compute} \gg \text{Memory} ]

现在逐渐变成:

[ \text{Compute} + \text{HBM} + \text{Interconnect} ]

三者共同决定系统能力。

对于一个长期偏好控制层的公司,这就是非常典型的盲区:

曾经可以外包的底层能力,突然重新决定了系统上限。


七、先进制程也是同一问题

芯片设计和芯片制造是两种完全不同的能力。

华为可以掌握:

  • CPU;
  • NPU;
  • modem;
  • GPU;
  • SoC architecture;
  • compiler;
  • software stack。

但如果先进制程受限,那么最终产品仍然会受到:

  • 功耗;
  • 面积;
  • 频率;
  • 晶体管密度;

的硬约束。

于是出现一个很典型的结构:

上层设计能力很强,但底层物理资源限制了最终性能。

这也是为什么系统工程公司在供应链正常时期,会倾向认为:

制造可以产业分工。

而在地缘政治和技术封锁时代,这种依赖就会突然显现为:

[ Strategic Dependency ]


八、生成式 AI 暴露出的则是另一种“能力错配”

相比电芯和 DRAM,大模型问题稍微不同。

这里不是简单的“底层制造缺失”,而是:

华为过去最强的组织能力,并不天然适合前沿模型探索。

大型工程组织通常擅长:

[ Requirement \rightarrow Architecture \rightarrow Design \rightarrow Review \rightarrow Verification \rightarrow Delivery ]

这是一套非常强的工程方法。

它适合:

  • 基站;
  • 路由器;
  • SoC;
  • 存储;
  • 电源系统。

因为这些产品必须:

按时交付,而且不能出严重问题。

但前沿 AI 研究很多时候更像:

[ Idea \rightarrow Experiment \rightarrow Fail \rightarrow Discard ]

然后:

[ New\ Idea \rightarrow Train \rightarrow Unexpected\ Result \rightarrow Scale\ Up ]

大量实验最终不会形成产品。

这是一种高失败率、高不确定性、需要极强研究 taste 的探索过程。

大组织并不是不能做。

但它并不会因为人数更多就自动更有优势。


九、华为甚至还背着别人没有的“AI 基础设施重建成本”

普通 AI 公司可以直接:

[ NVIDIA + CUDA + PyTorch + HBM + Cloud ]

然后集中研究:

模型本身。

华为却必须同时考虑:

[ Ascend \rightarrow CANN \rightarrow Compiler \rightarrow Kernel \rightarrow Cluster \rightarrow Interconnect \rightarrow Model ]

也就是说,它不仅在训练模型。

它还在重新构建:

从芯片到集群的软件和硬件计算栈。

因此,华为巨大的研发投入中,很大一部分并不会直接反映为:

大模型 benchmark 排名。

这些投入可能流向:

  • 芯片;
  • 软件栈;
  • 编译器;
  • 集群;
  • 网络;
  • 适配;
  • 国产供应链。

所以简单问:

“研发这么多,为什么模型不如 DeepSeek?”

本身就有点混淆分母。


十、这也是为什么华为在 AI 上可能更适合成为基础设施公司

如果把 AI 产业拆开:

[ \text{Model} \rightarrow \text{Framework} \rightarrow \text{Accelerator} \rightarrow \text{Cluster} \rightarrow \text{Cloud} ]

华为最强的其实未必是第一层。

它更擅长的是:

  • accelerator;
  • interconnect;
  • cluster;
  • cloud;
  • enterprise deployment。

也就是说:

它更像一个基础设施型组织。

从这个角度看,最理想的战略未必是:

盘古一定要击败所有中国大模型。

而可能是:

DeepSeek、Qwen、Kimi 等模型都能高效运行在 Ascend 上。

如果未来:

[ \text{Best Models} \rightarrow \text{Ascend} ]

那么华为依然占据了非常重要的产业位置。

这和 NVIDIA 并不一定需要自己拥有最强 ChatGPT,是同一个逻辑。


十一、庞大研发体系的另一个风险,是资源分散

华为的研发预算非常大。

但它同时覆盖:

  • 通信;
  • 芯片;
  • AI;
  • 云;
  • OS;
  • 手机;
  • 汽车;
  • 数字能源;
  • 存储;
  • 数据库;
  • 企业软件;
  • 基础研究。

所以:

[ \text{Huawei R&D} \neq \text{AI Model R&D} ]

一个小型研究公司可能:

[ 80% ]

甚至更多资源都集中在一个问题上。

华为却必须在几十个复杂技术体系之间分配资源。

因此它拥有的是:

广度极大的研发机器。

而前沿技术突破有时需要的是:

极高的局部资源密度。

这两者不是一回事。


十二、大组织还有一个天然风险:错误方向也能被坚持很久

长期主义通常被理解成优势。

但它同时存在另一面。

如果一个小公司判断错了:

很快会没有钱。

如果一个大型公司判断错了:

可能仍然可以继续投入多年。

这意味着:

[ \text{Strategic Patience} ]

和:

[ \text{Organizational Inertia} ]

之间并没有明确界线。

一个体系能够坚持十年做正确的事情,当然非常强。

但同样的机制,也可能让错误技术路线被保护十年。

所以真正优秀的研发组织,不只是:

能长期投入。

还必须具备:

能够主动停止错误方向的能力。

这其实比坚持更难。


十三、华为过去最成功的世界观,是“控制系统比制造介质更重要”

如果把前面的案例放在一起,可以看到一个非常稳定的模式。

数字能源

掌握:

PCS / BMS / EMS

不掌握:

电芯制造。

企业存储

掌握:

Controller / Software / Storage System

不掌握:

DRAM / NAND wafer。

芯片

掌握:

Architecture / IP / Software

长期依赖:

外部先进制造。

汽车

掌握:

智驾 / 座舱 / OS / 电控 / 通信

长期避免:

自己制造整车。

这些并不是偶然。

它们共同体现一种产业哲学:

[ \boxed{\text{Control without owning every physical layer}} ]

在全球化、产业高度分工的时代,这种模式非常高效。

因为公司可以:

用相对有限资本控制系统中最高附加值的部分。


十四、但今天的问题是:物理层重新回来了

过去三十年,数字产业给人一种错觉:

一切真正重要的价值最终都会向软件、算法和控制层迁移。

但 AI、新能源和地缘政治正在证明:

物理世界仍然存在无法抽象掉的硬边界。

例如:

  • HBM;
  • 先进制程;
  • 电芯;
  • 封装;
  • 能源;
  • 材料。

这些东西没有办法通过更聪明的软件完全绕开。

如果底层不足,上层系统工程可以补偿一部分,但不能无限补偿。

所以今天华为面对的真正问题是:

它必须重新判断哪些底层能力仍然可以市场采购,哪些已经变成必须长期管理的战略依赖。


十五、这并不意味着华为什么都应该自己做

这里很容易走向另一个极端。

如果结论变成:

“电池重要,所以华为应该造电池。”

“HBM重要,所以华为应该自己建DRAM厂。”

“先进制程重要,所以华为应该自己建foundry。”

那同样不合理。

任何公司都不可能同时成为:

  • TSMC;
  • Samsung Memory;
  • CATL;
  • BYD;
  • NVIDIA;
  • Cisco;
  • Microsoft。

真正的问题不是:

是否全部纵向整合。

而是:

如何管理战略依赖。

例如可以:

  • 投资关键供应商;
  • 深度联合研发;
  • 长期锁定产能;
  • 建立多供应源;
  • 参与标准和技术定义;
  • 维持关键能力的替代方案。

也就是说:

[ \text{Strategic Control} \neq \text{100% Ownership} ]


十六、华为真正需要升级的,是“什么叫核心技术”的定义

传统系统工程思维容易认为:

能够控制系统行为的部分才是核心。

但新技术时代迫使企业承认:

某些无法直接控制的底层能力,同样可能决定整个系统上限。

因此核心技术不再只是:

  • 算法;
  • 软件; -芯片架构; -协议; -控制器。

还需要包括:

任何一旦失去,就会使整个系统无法继续演进的能力。

可以把这种思路写成:

[ \text{Core Capability}

\text{High Value Layer} + \text{Strategic Bottleneck Layer} ]

前者决定企业能赚多少钱。

后者决定企业是否还能继续存在。

这两者并不总是重合。


结语:真正危险的不是错过一次浪潮,而是用过去成功的逻辑解释未来

华为最值得研究的地方,从来不是:

“为什么一个这么大的公司也会犯错。”

大公司当然会犯错。

真正值得关注的是:

它过去最成功的能力结构,是否仍然适合下一个技术时代。

华为过去三十年的核心优势,可以概括成:

[ \boxed{\text{复杂系统工程} + \text{高价值控制层} + \text{长期组织投入}} ]

这套方法帮助它在:

  • 通信;
  • 网络;
  • 芯片;
  • 存储;
  • 能源;

建立了极深的技术体系。

但 AI、新能源和供应链重构正在提出一个新的问题:

如果系统最重要的瓶颈重新出现在 HBM、电芯、先进制程和材料这些底层物理环节,那么只掌握控制层是否还足够?

答案显然已经不是过去那么简单。

因此,华为真正需要解决的并不是:

“以后所有东西都自己做。”

而是:

哪些东西可以继续依赖市场,哪些东西即使不自己拥有,也必须确保永远不会成为单点失效。

这是一种比“自研还是外购”更成熟的产业战略。

同样,在 AI 时代,华为也未必需要成为中国最强的通用聊天模型公司。

它更需要找到:

自己真正具有长期比较优势的位置。

如果 Ascend、CANN、AI 集群、企业部署和云最终成为大量中国模型共同使用的基础设施,那么华为依然可能在 AI 产业中占据极重要的位置。

只是那种成功方式,未必表现为:

排行榜第一。

而可能表现为:

排行榜上的所有模型,都运行在你的系统上。

这恰好再次回到了华为最熟悉的领域:

不一定创造最显眼的应用,但试图掌握支撑所有应用运行的系统。

真正需要警惕的,也因此不是它没有拥有所有底层能力。

而是:

[ \boxed{\text{不要把过去成功的能力边界,误认为未来永远正确的价值边界}} ]

这或许才是一个庞大研发体系在技术范式切换中最容易忽视的问题。