GPU:AI 算力之王的架构、生态与国产突围
定义:GPU(Graphics Processing Unit,图形处理器)是以数千至上万个计算核心做大规模并行计算的处理器芯片,最初为图形渲染而生,如今是 AI 大模型训练与推理的主力算力底座,核心壁垒是芯片架构、先进制程封装与 CUDA 软件生态的三重复合。
说明:本文基于本地研究报告库 GPU 产业主稿,结合英伟达 FY2026 财报、AMD 公告、摩尔线程/沐曦/壁仞上市文件、A 股上市公司 2025 年年报等公开资料整理,仅供研究学习,不构成投资建议。
TL;DR · 一句话结论
GPU 不是”显卡”,而是 AI 时代的通用算力发动机:Yole Group 统计 2024 年全球 GPU 销售额约 1130 亿美元,占处理器总销售额 39%,历史上首次超越 CPU 成为第一大处理器品类(Yole Group,2025)。 格局是”一超多强”:英伟达 FY2026(截至 2026 年 1 月)数据中心收入 1937 亿美元、同比增长 68%,靠”架构一年一代 + CUDA 生态 + 系统级交付”三重壁垒通吃训练市场(英伟达财报,2026);AMD 拿下 OpenAI 6 吉瓦大单成为第二极(AMD 公告,2025)。 中国市场被管制博弈重塑:H20 禁售—恢复—抽成 15%—事实停摆,英伟达 FY2026 业绩指引已不含中国数据中心收入,国产 GPU 获得历史性替代窗口(英伟达财报电话会,2026)。 国产侧完成资本化关键一跃:摩尔线程 2025 年 12 月登陆科创板、2025 年营收 15.06 亿元(+243.37%)且 2026Q1 单季扭亏,沐曦、壁仞接连上市,全国产供应链产品开始量产(公司公告,2026)。 核心风险:CUDA 生态代差短期难消、先进制程与 HBM 产能是国产物理天花板、A 股相关标的估值已计入多年高增长,以及管制口径反复的双向冲击。
一、这是什么:AI 时代的通用算力发动机
定义:GPU(Graphics Processing Unit,图形处理器)是以大规模并行计算为核心设计的处理器芯片。它用数千到上万个精简计算核心,同时执行同一类计算任务,最初用于游戏画面的图形渲染,后来被发现极其适合科学计算和深度学习的矩阵运算,逐步演化为 AI 训练与推理的主力芯片。今天说”算力”,大多数时候说的就是数据中心里的 GPU。
通俗理解:CPU 像几位教授,核心少但每个都很强,擅长处理复杂逻辑、分支判断和串行任务;GPU 像一万名小学生,单个核心简单,但可以同时做一万道加减乘除。AI 大模型的训练和推理,本质就是把海量参数反复做矩阵乘法——这正是”一万名小学生”最擅长的活。英伟达最新的 Blackwell 旗舰芯片 B200 集成约 2080 亿个晶体管,其行业演讲资料显示单卡 FP8 精度算力达到 20 PFLOPS 量级,相当于每秒两万万亿次运算(英伟达 GTC 发布资料,2024)。
三类算力芯片的分工可以用一张表说清:
| 维度 | CPU | GPU | ASIC(定制芯片) |
|---|---|---|---|
| 核心数量 | 几个到上百个强核心 | 数千到上万个精简核心 | 面向单一负载的定制阵列 |
| 擅长任务 | 复杂逻辑、串行、操作系统 | 大规模并行、矩阵运算 | 固定算法的极致能效 |
| 灵活性 | 最高 | 高(通用可编程) | 低(换算法要重新流片) |
| AI 角色 | 调度与预处理 | 训练主力 + 通用推理 | 超大规模稳定推理 |
| 代表 | Intel Xeon、AMD EPYC | 英伟达 H100/B200、AMD MI 系列 | 谷歌 TPU、AWS Trainium |
一个重要的边界说明:本文聚焦 GPU 芯片本身——架构演进、CUDA 生态、英伟达与 AMD 的格局、国产 GPU 公司的横向比较。谷歌 TPU 代表的自研路线、定制芯片赛道和国产算力生态的整体图景,站内另有专文(见文末相关研究),不在此重复展开。
二、起源与发展历程:从游戏显卡到算力之王
GPU 的历史是一部”副业逆袭”史:为游戏而生,因 AI 封王。
| 阶段 | 时间 | 核心事件 | 意义 |
|---|---|---|---|
| 图形起源 | 1999 年 | 英伟达发布 GeForce 256,首次提出”GPU”概念 | 图形渲染从 CPU 独立出来 |
| 通用化转折 | 2006-2012 年 | CUDA 平台发布(2006);2012 年 AlexNet 用两块 GTX 580 训练夺冠 ImageNet | GPU 从画图工具变成科学计算工具,深度学习革命引爆 |
| 数据中心化 | 2016-2022 年 | Pascal/Volta 引入 Tensor Core,A100、H100 相继发布 | GPU 成为数据中心一等公民,专为 AI 优化 |
| AI 超级周期 | 2022 年至今 | ChatGPT 引爆大模型军备竞赛,Blackwell(2024)、Rubin(2026)接力 | GPU 销售额超越 CPU,英伟达登顶全球市值最高公司之列 |
两个转折点值得细看。第一个是 2006 年 CUDA 的发布:英伟达把 GPU 的并行算力开放给通用编程,让科研人员不必懂图形学也能调用 GPU。这个当年看似”烧钱做慈善”的决定,二十年后成了最深的护城河——今天主流深度学习框架的底层都构建在 CUDA 之上。第二个是 2012 年 AlexNet:Hinton 团队用消费级游戏显卡训练神经网络拿下图像识别冠军,证明”游戏芯片”就是深度学习最好的载体,从此 AI 与 GPU 深度绑定。
规模的变化更直观。Yole Group 数据显示,2024 年全球 GPU 销售额约 1130 亿美元、一年增长超过一倍,占各类处理器总销售额的 39%,历史上首次超过 CPU(Yole Group,2025)。而英伟达单家公司 FY2026 收入就达 2159 亿美元、同比增长 65%,公司披露其数据中心业务自 ChatGPT 出现以来的三个财年里扩大了近 13 倍(英伟达财报及电话会,2026)。
三、行业本质:硬件迭代、生态锁定与系统交付的三重生意
GPU 表面是卖芯片,实质是三层生意叠加,每一层都在加深壁垒。
1. 硬件层:一年一代的”死亡行军”
英伟达把数据中心 GPU 的迭代节奏压缩到一年一代:Hopper(2022)→ Blackwell(2024)→ Blackwell Ultra(2025)→ Rubin(2026)。AMD 也被迫跟进一年一代(MI300→MI325→MI350→MI400)。这个节奏意味着每代产品的研发、流片、爬坡都以数十亿美元计,中小玩家在资金上直接出局。快节奏还有一个隐性作用:让客户的采购永远追不上迭代,旧卡尚未回本、新卡性价比又高出一截,需求被持续制造出来。
2. 生态层:CUDA 是复利最厚的资产
CUDA 生态积累近二十年,覆盖编译器、算子库、通信库、开发工具链和海量存量代码。客户换芯片的成本不是买卡的钱,而是重写和重新验证整个软件栈的时间。国产厂商普遍选择”兼容”策略降低迁移门槛:海光 DCU 兼容”类 CUDA”环境,沐曦 MXMACA 软件栈披露已适配超 6000 个 CUDA 应用(沐曦招股书及审核问询回复,2025)。但兼容永远慢原生一步——CUDA 每次升级,兼容层都要重新追赶。
3. 系统层:从卖芯片到卖”AI 工厂”
英伟达早已不按”单卡”卖货,而是 NVLink 互联 + 整机柜(GB200/GB300 NVL72)+ 网络(InfiniBand/Spectrum-X)打包交付。财报显示其 FY2026 网络业务收入同比增长 142%,正是机柜级方案放量的直接证据(英伟达财报,2026)。系统级交付把竞争门槛从”芯片性能”抬高到”数据中心工程能力”,这也是 AMD 收购 ZT Systems、国产厂商纷纷推超节点方案的原因。
盈利结构上,这门生意的分层非常残酷:英伟达 FY2026 非 GAAP 毛利率约 75%(英伟达财报,2026);追赶者摩尔线程 2025 年毛利率 65.57%,但研发投入占营收比例高达 86.68%,仍在亏损(摩尔线程年报,2026);再往下的图形 GPU 厂商景嘉微,图形显控业务毛利率 56.90%(景嘉微年报,2026)。垄断者吃利润,追赶者烧研发,是这个行业最真实的分配格局。
四、产业链全景
GPU 产业链可以概括为:EDA/IP 工具 → 芯片设计 → 晶圆代工 → 先进封装 + HBM 存储 → 板卡与服务器 → 云与应用。
| 环节 | 关键内容 | 代表玩家 | 中国位置 |
|---|---|---|---|
| EDA/IP | 芯片设计软件、GPU IP | Synopsys、Cadence、Imagination、芯原股份 | 华大九天等局部突破,高端依赖进口 |
| 芯片设计 | 架构、微架构、软件栈 | 英伟达、AMD、摩尔线程、沐曦、壁仞、景嘉微、海光 | 设计能力最接近国际水平的环节 |
| 晶圆代工 | 3/4/5nm 先进制程 | 台积电(垄断高端)、三星、中芯国际 | 先进制程受设备管制约束,成熟制程扩产快 |
| 先进封装 | CoWoS、Chiplet、2.5D/3D | 台积电、日月光、长电科技、通富微电 | 国内与国际差距最小的环节之一 |
| 存储配套 | HBM 高带宽内存 | SK 海力士、三星、美光 | 国产 HBM 尚在追赶(另见 HBM 专文) |
| 整机与云 | AI 服务器、智算中心 | 浪潮信息、中科曙光、各大云厂商 | 系统集成能力强,中国公司主导份额高 |
三个关键卡点需要划重点。第一是先进制程:英伟达全部高端 AI 芯片由台积电代工,从 4nm 一路走向 Rubin 时代的 3nm/2nm;AMD 下一代 MI450 的计算芯粒更是直接采用台积电 2nm(行业资料,2025)。第二是先进封装:AI GPU 普遍采用 CoWoS 类 2.5D 封装把计算芯片与 HBM 拼在一起,台媒与供应链口径显示台积电 CoWoS 产能虽持续翻倍扩产至 2026 年的月产十万片级别,但仍供不应求(工商时报等台媒供应链报道,2025)。第三是 HBM:显存带宽已取代算力成为大模型推理瓶颈,HBM 由三大存储厂垄断供应,涨价与分配直接影响 GPU 出货节奏。
国内的对应变化是”全国产供应链”跑通:沐曦曦云 C600 从设计、制造到封装测试构建了全国产闭环,2025 年 7 月回片点亮、2025 年底风险量产、2026 年上半年量产销售(沐曦公告,2026);中芯国际披露折合 8 英寸月产能于 2025 年突破 100 万片大关,为国产 GPU 提供制造底座(公司披露/每日经济新闻,2025)。
五、供需格局:需求看云厂资本开支,供给看先进产能
需求端:AI 资本开支是总水龙头
GPU 需求高度集中于头部云厂商与 AI 公司。英伟达财报电话会披露,前五大超大规模云厂商合计贡献其数据中心收入的 50% 以上,且需求旺盛到”Hopper 乃至六年前的 Ampere 老卡在云上都已售罄”(英伟达财报电话会,2026)。公司对 FY2027 一季度给出 780 亿美元(±2%)的收入指引,并预计 2026 日历年逐季环比增长,超出此前披露的 5000 亿美元 Blackwell+Rubin 订单能见度(英伟达财报电话会,2026)。
需求的第二极是主权 AI 与企业本地部署,第三极才是传统的游戏与专业可视化——英伟达 FY2026 游戏业务收入 160 亿美元、同比增长 41%,规模可观但已不足数据中心的十分之一(英伟达财报,2026)。
供给端:瓶颈从”造芯片”转移到”封装和内存”
先进制程产能长期紧张,但当前更尖锐的约束在 CoWoS 封装与 HBM 供给:一颗旗舰 AI GPU 要消耗多颗 HBM 堆栈和大面积中介层,封装产能扩张速度追不上芯片设计的堆料速度。供应链的每一次扩产(台积电 CoWoS 翻倍、存储三巨头 HBM 转产)都被下一代产品的更高需求吞掉。
中国市场:政策缺口造出的”平行市场”
管制让中国形成了独立的供需循环:需求侧,智算中心、运营商集采、金融与互联网大厂的算力采购持续放量且明确倾向国产;供给侧,国产 GPU 出货能力成为核心约束。业内估计英伟达在中国算力市场的份额已从管制前的约 95% 降至约 50%,且仍在下行(联合早报引述业内人士,2025)。沐曦披露截至 2025 年末 GPU 产品累计销量突破 5.5 万颗、已交付十余个智算集群(券商研报援引公司资料,2026)——绝对量与英伟达百万颗级出货不可同日而语,但增速和方向已经确立。
六、竞争格局:一超多强,生态是最深的分水岭
全球 GPU 市场是教科书级的”一超多强”。
| 阵营 | 玩家 | 位置与打法 |
|---|---|---|
| 一超 | 英伟达 | 数据中心 AI 芯片绝对主导(行业机构估计份额约九成),架构 + CUDA + 系统三重壁垒 |
| 第二极 | AMD | MI 系列一年一代,OpenAI/Oracle 大单落地,性价比 + 开放生态(ROCm)打法 |
| 边缘化 | Intel | 数据中心 GPU 屡次跳票,Arc 独显份额小,重心转向代工与 CPU |
| 中国阵营 | 摩尔线程、沐曦、壁仞、景嘉微、海光、华为昇腾等 | 政策保护下的平行市场,替代窗口明确,生态与产能是短板 |
英伟达的统治力直接写在财务上:FY2026 数据中心收入 1937 亿美元,同比增长 68%,第四财季数据中心单季收入 623 亿美元、环比再增 22%(英伟达财报,2026)。
AMD 的看点是从”陪跑”到”第二供应商”的实质跃迁:2025 年 10 月与 OpenAI 签署 6 吉瓦 GPU 部署协议,首批 1 吉瓦 MI450 于 2026 年下半年上线,AMD 同时向 OpenAI 发行至多 1.6 亿股认股权证绑定利益,公司称该合作预计带来数百亿美元收入(AMD 公告,2025)。下一代 MI450 搭载 432GB HBM4,内存容量反超英伟达同代 Vera Rubin,训练侧内存密集负载有差异化竞争力(AMD 发布资料,2025)。
国产阵营内部则按技术路线分成三类:全功能自研架构(摩尔线程 MUSA、壁仞 BR 系列、沐曦 XCORE——图形与计算兼顾或聚焦训推)、类 CUDA 兼容路线(海光 DCU,源自 AMD GCN 架构授权,迁移成本最低)、图形/信创路线(景嘉微 JM 系列,深耕军用与国产化桌面)。华为昇腾走 ASIC 化的 NPU 路线且不单独售卡,与本文的 GPU 口径不同,详见站内国产算力专文。
竞争格局的关键判断:芯片性能差距可以用制程和堆料在两三年内缩小,但 CUDA 生态的迁移成本、机柜级系统工程能力、以及先进产能的优先获取权,构成了追赶者短期难以逾越的三道墙。
七、生命周期与周期属性:成长主线上的三层波动
GPU 行业整体处于成长期,但成长不是直线,叠加了三层周期。
1. 半导体库存周期
GPU 逃不开半导体行业 3-4 年的库存周期。历史上最典型的教训是挖矿:2018 年和 2022 年两轮加密货币退潮,都让游戏显卡渠道库存崩塌、英伟达游戏业务收入大幅下滑。当前数据中心 GPU 的”库存”以云厂商资本开支形式存在,波动被推迟但不会消失。
2. AI 资本开支周期
这是当下最大的争论点。看多者引用英伟达管理层口径:AI 基础设施支出到 2030 年可能达到 3 万亿-4 万亿美元量级,当前建设仅是开端(英伟达财报电话会,2025-2026)。谨慎者担心推理算力的单位成本快速下降(Rubin 平台宣称推理 token 成本较 Blackwell 最多降至十分之一)会在某个时点让”算力囤积”变成”算力过剩”。判断信号不在叙事而在数字:北美四大云厂的季度资本开支指引,是这条产业链最诚实的温度计。
3. 产品代际周期
一年一代的节奏制造了明显的季度级波动:新品发布前客户观望、爬坡期供不应求、代际末期折价清库。对 A 股映射公司而言,还叠加国内特有的”招标周期”——智算中心集采和运营商招标的节奏,直接决定国产 GPU 公司的季度收入确认,这也是寒武纪、摩尔线程等公司收入集中于个别季度确认的原因(公司年报,2026)。
八、政策与监管环境:出口管制改写全球 GPU 版图
GPU 是中美科技博弈最前沿的品类,政策是理解这个行业绕不开的变量。管制口径的演变值得用时间线完整记录:
| 时间 | 事件 | 影响 |
|---|---|---|
| 2022 年 10 月 | 美国禁止 A100/H100 对华出口 | 英伟达推出降配版 A800/H800 |
| 2023 年 10 月 | A800/H800 也被纳入管制 | 英伟达再推 H20(性能约为 H100 的两成,机构口径) |
| 2025 年 4 月 | H20 对华出口需许可证,事实禁售 | 英伟达单季计提 45 亿美元减值、25 亿美元订单无法交付(英伟达财报,2025) |
| 2025 年 7 月 | 美方承诺发放 H20 许可证 | 黄仁勋访华,恢复销售预期升温 |
| 2025 年 8 月 | 曝出对华销售收入 15% 上缴美国政府的特殊安排;中国网信办就 H20 安全风险约谈英伟达 | 国内采购转向谨慎,英伟达一度暂停 H20 生产,转推 Blackwell 降配版 B30A(媒体报道,2025) |
| 2026 年 2 月 | 英伟达披露少量 H200 获批对华销售但尚未产生收入,指引继续不含中国数据中心收入 | 中国数据中心市场对英伟达事实”清零”(英伟达财报电话会,2026) |
这条时间线的产业含义有三层。第一,管制是双刃剑:既掐住了中国获取尖端算力的通道,也把每年数百亿美元级的中国市场让给了国产芯片——英伟达管理层在 FY2026 电话会上罕见承认”中国竞争对手借助近期 IPO 获得资本支持,长期有能力改变全球 AI 产业结构”(英伟达财报电话会,2026)。第二,国内政策形成对冲:智算中心建设、运营商集采对国产芯片的倾斜、信创体系的扩容,为国产 GPU 提供了保底需求池。第三,规则本身不稳定:从禁售到许可到抽成再到安全审查,口径在一年内多次反转,任何基于单一政策状态的投资判断都要预留反转空间。
九、技术变革:架构、封装、互联三线并进
GPU 的技术演进可以沿三条主线跟踪。
1. 架构与精度:从 FP32 到 FP4 的”降精度革命”
英伟达架构演进史就是一部为 AI 持续特化的历史:
| 架构 | 年份 | 关键创新 |
|---|---|---|
| Volta | 2017 | 第一代 Tensor Core,专为深度学习矩阵运算设计 |
| Ampere | 2020 | TF32/BF16 精度,A100 成为大模型时代第一代主力卡 |
| Hopper | 2022 | FP8 精度 + Transformer 引擎,H100 引爆 ChatGPT 军备竞赛 |
| Blackwell | 2024 | FP4/FP6 精度、双芯粒设计,B200 集成约 2080 亿晶体管 |
| Rubin | 2026 | 平台化:Vera CPU + Rubin GPU + NVLink 6 等六芯片协同,宣称推理 token 成本最多降至 Blackwell 的十分之一 |
主线逻辑是”用更低的数值精度换更高的有效算力”:AI 计算对精度不敏感,从 FP32 一路降到 FP4,同样的晶体管预算能换来数量级的吞吐提升。跟踪新架构时,比峰值算力更重要的是看它支持的最低精度和配套软件栈的成熟度。
2. 封装与存储:Chiplet + HBM 成为标配
单芯片逼近光罩尺寸极限后,性能提升转向”拼装”:Blackwell 用两颗芯粒拼成一颗逻辑 GPU,AMD MI450 用 12 颗计算芯粒 + 3 颗 I/O 芯粒组合,配 432GB HBM4(AMD 发布资料,2025)。这条路线把封装厂推到台前——CoWoS 类 2.5D 封装和未来的 3D 混合键合,是决定 GPU 出货量的硬约束,也是中国大陆封测双雄(长电科技、通富微电)切入全球 AI 链条的入口。
3. 互联与超节点:单卡之争变成集群之争
大模型训练早已超出单卡能力,胜负手转向卡间互联:英伟达 NVLink 已迭代至第六代,GB300 NVL72 把 72 颗 GPU 组成一个机柜级”超级芯片”。国产阵营同步跟进超节点方案:沐曦自研 MetaXLink 支持 2-128 卡互联拓扑与统一内存编址(沐曦招股书,2025),摩尔线程、华为等亦有各自的超节点布局。互联能力的意义在于:即使单卡性能有代差,通过更大规模的集群组网也能在总算力上部分弥补——这是国产算力当前最现实的追赶路径。
十、产业进程:国内 vs 海外
海外:进入”平台竞争”阶段
英伟达 2026 年 1 月在 CES 发布 Rubin 平台,包含 Vera CPU、Rubin GPU、NVLink 6 交换芯片等六颗新芯片,AWS、谷歌云、微软 Azure、甲骨文将首批部署,公司预计 2026 日历年 Blackwell 与 Rubin 并行销售、逐季增长(英伟达财报电话会,2026)。AMD 的 MI450 于 2026 年下半年开始 1 吉瓦级部署,Oracle 承诺 5 万颗集群(AMD 及 Oracle 公告,2025)。海外竞争的焦点已从”谁的卡快”升级为”谁的整机柜、网络、软件平台交付快”。
国内:资本化与全国产化双线突破
2025 年末到 2026 年初,国产 GPU 完成了一轮密集的资本化:
| 公司 | 上市时间/地点 | 关键数据 |
|---|---|---|
| 摩尔线程(688795) | 2025 年 12 月 5 日科创板 | 发行价 114.28 元/股,募资总额约 80 亿元,首日盘中一度涨超 500%(上市公告书/央广网,2025) |
| 沐曦股份 | 2025 年 12 月 17 日科创板 | 受理到上市仅 170 天,2026 年 6 月再启动 H 股发行(公司公告,2026) |
| 壁仞科技(06082.HK) | 2026 年 1 月 2 日港交所 | 18C 章规则下募资最高新股,募资总额约 55.83 亿港元,公开发售超购逾 2300 倍(港交所发行结果,2026) |
资本化的意义不只是融资:上市把国产 GPU 从”一级市场故事”变成有审计报表、有季度数据可验证的公开公司,也让”用股权融资养长周期研发”的模式跑通——摩尔线程 2025 年研发投入 13.05 亿元、占营收 86.68%,没有资本市场支持无法持续(摩尔线程年报,2026)。
技术侧的标志性进展是全国产供应链闭环:沐曦曦云 C600 实现设计、制造、封测全国产,2026 年上半年量产销售,公开资料显示其性能定位介于英伟达 A100 与 H100 之间(沐曦公告及媒体报道,2026)。这意味着国产 GPU 的供给不再受海外代工授权的单点制约——代价是制程受限带来的能效差距,需用系统级方案弥补。
十一、中外龙头对比:英伟达 vs 国产 GPU 阵营
把英伟达和国产阵营放在同一张表里,差距和机会都一目了然:
| 维度 | 英伟达 | 国产 GPU 阵营(摩尔线程/沐曦/壁仞/海光等) |
|---|---|---|
| 收入体量 | FY2026 收入 2159 亿美元(约 1.5 万亿元人民币) | 单家最高百亿元级(海光 143.77 亿元),纯 GPU 公司十亿元级 |
| 盈利能力 | 非 GAAP 毛利率约 75%,净利润巨额 | 海光已稳定盈利;摩尔线程 2026Q1 首度单季扭亏;多数仍亏损 |
| 产品代际 | Blackwell 量产、Rubin 上市(3nm/2nm 级) | 主力产品对标 A100-H100(2020-2022 年代际) |
| 制程获取 | 台积电最先进制程 + CoWoS 优先权 | 先进制程受管制约束,全国产供应链成熟制程为主 |
| 软件生态 | CUDA 原生,近二十年积累 | 兼容 CUDA(海光/沐曦)或自建(MUSA 等),适配数千应用级 |
| 需求来源 | 全球云厂 + 主权 AI,前五大客户占一半以上 | 国内智算中心、运营商集采、信创,政策保底 |
| 核心风险 | 中国市场清零、AI 资本开支周期 | 生态代差、产能天花板、估值透支 |
数字对比冷峻,但要看趋势而非静态差距(英伟达财报与各公司年报,2026):英伟达收入是摩尔线程的约五百倍,但摩尔线程收入增速(+243%)数倍于英伟达(+65%);英伟达的中国收入趋近于零,而国产阵营的收入几乎全部来自英伟达退出的空间。两条曲线一个在天花板附近寻找新增长极,一个在替代窗口里加速爬坡——这正是”中国市场平行化”的镜像。
生态对比需要单独强调:沐曦 MXMACA 已适配超 6000 个 CUDA 应用、2200 余个高性能算子(券商研报援引公司资料,2026),兼容层的实用性已过”能用”门槛,但距离 CUDA 的”好用”(调试工具、性能剖析、社区支持)仍有数年量级的工程差距。生态追赶没有捷径,唯一的加速器是国内开发者被迫迁移形成的真实使用反馈。
十二、财务特征与公司横向对比
国产 GPU/算力芯片公司的 2025 年报数据首次可以放在一张表里横向比较(各公司 2025 年年度报告,2026):
| 公司 | 2025 营收 | 同比 | 2025 归母净利 | 研发占营收比 | 关键看点 |
|---|---|---|---|---|---|
| 海光信息(688041) | 143.77 亿元 | +56.92% | 25.45 亿元(+31.79%) | 31.78% | 类 CUDA 生态 DCU + x86 CPU 双线,已稳定盈利 |
| 寒武纪(688256) | 64.97 亿元 | +453.21% | 20.59 亿元(首次扭亏) | 高研发投入 | ASIC 路线云端芯片,收入爆发但客户集中 |
| 摩尔线程(688795) | 15.06 亿元 | +243.37% | -10.01 亿元(收窄 38%) | 86.68% | 全功能 GPU,云端产品占 97%,2026Q1 单季扭亏 |
| 景嘉微(300474) | 7.20 亿元 | +54.41% | -1.65 亿元 | 59.39% | 图形 GPU + 信创,JM11 小批量交付,转型阵痛期 |
| 沐曦股份 | 未满一个完整上市年度 | — | 2025 年亏损约 7.9 亿元 | 高研发投入 | C600 全国产链量产,2026Q1 营收 5.62 亿元(+75.37%) |
财务特征上,这批公司呈现出清晰的三档分化。第一档是已盈利平台型(海光):收入体量、盈利、现金流三项俱全,2026 年一季度营收再增 68.06%、经营节奏稳定(海光信息一季报,2026),估值逻辑接近成长股而非概念股。第二档是拐点型(摩尔线程、寒武纪):收入高增长带动亏损收窄或首次盈利,市场定价的是”斜率”,因此对季度数据极其敏感——摩尔线程 2026 年一季度营收 7.38 亿元、同比增长 155% 并实现归母净利 0.29 亿元的首次单季转正,就是典型的估值锚事件(摩尔线程一季报,2026)。第三档是转型期(景嘉微):收入增长但利润承压,2026 年一季度营收还出现同比下滑 17.87%(景嘉微一季报,2026),需要等待新产品放量证明。
看这类公司的财报,有三个非常规指标比利润更重要:合同负债与存货(备货抢产能的信号)、研发费用资本化比例(利润质量)、前五大客户集中度(收入的脆弱性)。
十三、关键跟踪指标
高频跟踪(季度级)
- 英伟达季度财报与下季指引:全球 AI 算力景气度的锚,重点看数据中心收入环比与中国口径变化。
- 北美四大云厂(微软/谷歌/Meta/亚马逊)资本开支指引:整条链的总水龙头。
- 国产 GPU 公司季度营收与毛利率:摩尔线程、海光、寒武纪的环比趋势,验证替代逻辑兑现节奏。
- 台积电 CoWoS 扩产与 HBM 价格:供给瓶颈的松紧程度。
领先指标
- 国内智算中心与运营商集采招标结果:国产芯片中标份额是政策托底力度的直接读数。
- 管制口径变化:B30A/H200 类产品的许可进展,直接改写国产替代的需求曲线。
- 国产新品流片与量产节奏:下一代产品能否把对标代际从 A100-H100 推进到 Blackwell 级。
- 超节点/集群订单:单卡差距之外,系统级方案的商业化验证。
一票否决信号
- 北美云厂资本开支指引集体转负:AI 硬件周期见顶的最强信号。
- 国产龙头季度营收连续环比下滑且存货高企:替代需求不及预期或产能约束恶化。
- 管制全面放开且英伟达合规产品大规模返场:国产平行市场的保护垫消失,逻辑需要重估。
十四、A 股炒作逻辑
GPU 在 A 股的叙事有四条主线,强度和确定性各不相同。
- 国产替代主叙事:管制把市场让出来,政策把需求托起来,“英伟达退、国产进”是最容易被市场理解和定价的故事。摩尔线程上市首日盘中一度涨超 500%(央广网,2025),说明市场对稀缺纯正标的的定价热情。
- 业绩兑现叙事:与多数题材不同,这条线已有真实财报支撑——海光、寒武纪盈利,摩尔线程单季扭亏,故事正在从”讲逻辑”过渡到”看数据”,季报是最大催化和最大风险点。
- 产业链扩散叙事:GPU 行情通常从设计公司扩散到代工(中芯国际)、封测(长电、通富)、服务器(浪潮、曙光)、连接与散热等配套,越往外围弹性越依赖情绪。
- 事件催化叙事:新品发布、超节点落地、大额集采中标、H 股/科创板新上市(沐曦 A+H、壁仞港股)等事件驱动的脉冲行情。
排雷提示:真正有 GPU 收入的 A 股公司屈指可数,大量”GPU 概念股”仅是参股、供货外围部件甚至只有意向合作。鉴别标准与 ASIC 主线相同——看财报和公告里有没有可验证的 GPU 相关收入、订单或客户披露,名字和题材标签不算数。
十五、最新边际变化与催化剂
截至 2026 年 8 月,值得记录的边际变化有五条:
- 英伟达 FY2026 收官创纪录,Rubin 开启新周期:全年收入 2159 亿美元、数据中心 1937 亿美元,FY2027Q1 指引 780 亿美元且预计 2026 日历年逐季增长;Rubin 平台已发布,Vera Rubin 实例将由四大云厂首批部署(英伟达财报,2026)。全球算力景气度仍在高位。
- 中国市场对英伟达事实清零,替代窗口全开:H20 风波后英伟达指引持续剔除中国数据中心收入,仅少量 H200 获批且未产生收入(英伟达财报电话会,2026)。这是国产 GPU 最重要的外部条件,也是最大的反转风险源。
- 国产 GPU 三连上市 + 首次单季盈利:摩尔线程、沐曦、壁仞在约一个月内相继登陆资本市场;摩尔线程 2026Q1 归母净利转正,国产纯 GPU 公司第一次摸到盈利线(公司公告,2026)。
- AMD 坐实第二供应商地位:OpenAI 6 吉瓦协议 + Oracle 5 万颗 MI450 集群 + 对 Anthropic 的投资绑定,MI450(2nm、HBM4)2026 下半年部署(AMD 公告,2025)。双寡头格局对供应链议价、定价体系都是长期变量。
- 全国产供应链产品量产:沐曦 C600 于 2026 上半年量产销售并进入运营商集采短名单(公司公告,2026),“设计-制造-封测”全链自主从口号变成可交付产品。
十六、多空分歧与投资含义
看多的核心理由
- 需求能见度罕见:英伟达 5000 亿美元级订单口径、云厂资本开支持续上修,AI 算力仍处于供不应求阶段(英伟达财报电话会,2026)。
- 国产替代是”政策 + 市场”双保险:管制让出需求、集采托底订单,且已有年报级业绩验证,不是纯叙事。
- 资本化完成后研发弹药充足:三家新上市公司合计募资超百亿元级,长周期架构迭代第一次有了稳定资金来源。
- 系统级方案(超节点)为单卡代差提供了现实的工程补偿路径。
看空的核心理由
- CUDA 生态代差以年计,兼容路线永远慢一步,客户真实迁移意愿依赖”被迫”而非”自愿”。
- 先进制程与 HBM 是物理天花板:设计追上了,产能和能效追不上,全国产链的成熟制程方案有性能上限。
- 估值透支:新上市公司市值对应市销率极高,任何一个季度增速不及预期都可能剧烈回调。
- 管制的双向风险:若合规版英伟达产品(B30A/H200 类)大规模获批返场,国产平行市场的保护垫会被快速侵蚀。
投资含义
多空的本质分歧在于”替代窗口能开多久、国产公司能在窗口内长多快”。对研究者而言,与其站队,不如盯三个可证伪的信号:国产龙头的季度营收环比、智算中心招标中的国产份额、管制口径的每一次变化。窗口内的成长是真实的,窗口的开合不由公司决定——这是本行业风险收益比的核心结构。
十七、核心结论与展望
一句话总结:GPU 是 AI 时代确定性最高的硬件主线,全球看英伟达的平台化垄断与 AMD 的第二极崛起,中国看管制造出的平行市场里,国产 GPU 从”能用”走向”够用”的替代兑现。
未来一年,行业重点变量是:Rubin 平台爬坡与云厂资本开支的持续性;国产 GPU 公司季度业绩能否延续高增长与减亏路径;沐曦 C600 等全国产链产品的放量规模;以及管制口径下一次变化的方向。
未来三年,可能形成三条主线:
- 平台竞争主线:英伟达与 AMD 的机柜级平台之争,决定全球算力成本曲线。
- 国产代际追赶主线:国产 GPU 能否把对标代际从 A100-H100 推进到 Blackwell 级,关键看先进制程、HBM 国产化与超节点工程能力的协同。
- 生态收敛主线:国内开发者生态在被迫迁移中逐步沉淀,兼容层与自建生态谁先跑通商业闭环,决定国产阵营的内部座次。
值得持续跟踪的 5 个变量:英伟达数据中心收入与指引、北美云厂资本开支、国产 GPU 龙头季度营收与毛利率、智算中心招标国产份额、管制与许可口径变化。
信息来源:公开资料整理,仅供学习研究,不构成投资建议。
产业链全景速查
| 环节 | 关键产品/技术 | 代表公司 |
|---|---|---|
| EDA/IP | 设计工具、GPU IP、SerDes | Synopsys、Cadence、Imagination、芯原股份 |
| 芯片设计 | AI GPU、图形 GPU、DCU | 英伟达、AMD、摩尔线程、沐曦、壁仞、景嘉微、海光信息 |
| 晶圆代工 | 2/3/4nm 先进制程、成熟制程 | 台积电、三星、中芯国际、华虹集团 |
| 先进封装 | CoWoS、Chiplet、2.5D/3D | 台积电、日月光、长电科技、通富微电 |
| 存储配套 | HBM3e/HBM4 | SK 海力士、三星、美光 |
| 整机与集群 | AI 服务器、超节点、智算中心 | 浪潮信息、中科曙光、工业富联、各大云厂商 |
多空分歧
看多核心论点: AI 算力需求能见度罕见(英伟达 FY2026 数据中心收入 1937 亿美元、同比增 68%,指引持续上修),管制让出的中国市场为国产 GPU 提供政策与订单双保险,摩尔线程等公司已用年报和单季扭亏证明替代逻辑在兑现(英伟达财报/公司年报,2026)。
看空核心论点: CUDA 生态代差短期无解,先进制程与 HBM 产能是国产物理天花板;新上市公司估值计入多年高增长,季度数据稍有闪失即剧烈回调;若英伟达合规产品大规模返场,平行市场保护垫将被侵蚀。
我的立场: 中性偏多,但强调结构选择。确定性排序:先进封装与算力配套(跟全球订单走,不赌阵营)> 已盈利平台型(海光式”生态兼容 + 双产品线”)> 高弹性纯 GPU 新股(摩尔线程/沐曦,盯季度营收环比与毛利率)> 外围概念股(原则回避)。核心验证点是国产龙头季度业绩与智算中心招标份额,而非新闻叙事。
相关研究
常见问题
GPU 和 CPU 到底差在哪,为什么 AI 非用 GPU 不可?
CPU 是几个到几十个强核心,擅长复杂逻辑和串行任务;GPU 是数千到上万个简单核心,擅长把同一种计算(比如矩阵乘法)同时做成千上万遍。大模型训练和推理的核心计算恰好就是海量矩阵乘法,所以 GPU 的并行架构天然契合。打个比方:CPU 是几位教授做难题,GPU 是一万名小学生同时做加减法——AI 需要的正是后者。
英伟达的护城河到底是芯片还是 CUDA?
两者叠加,且 CUDA 更难追。芯片层面靠一年一代的架构迭代(Hopper→Blackwell→Rubin)和对台积电先进制程、CoWoS 封装、HBM 的优先获取;软件层面 CUDA 生态积累近二十年,主流 AI 框架、数百万开发者和海量存量代码都绑在上面。竞争对手芯片纸面算力接近不难,难的是让客户放弃整套开发工具链和已验证的软件栈。
国产 GPU 现在到什么水平了?
商业化上台阶、技术上仍有代差。摩尔线程 2025 年营收 15.06 亿元(同比 +243%)、2026 年一季度单季扭亏,沐曦曦云 C600 用全国产供应链在 2026 年上半年量产,产品性能大致对标英伟达 A100 到 H100 之间(2020-2022 年的水平)。差距主要在先进制程获取、HBM 供应、互联规模和软件生态成熟度,而不是单纯的设计能力。
H20 禁售又恢复,到底怎么回事?
2025 年 4 月美国要求 H20 对华出口需许可证,英伟达当季计提 45 亿美元减值;7 月获批恢复,但随后曝出美国政府对相关销售收入抽成 15%,同期中国监管部门就芯片安全风险约谈英伟达,国内大厂采购转向谨慎,8 月下旬英伟达一度暂停 H20 生产。英伟达 FY2026 全年对华数据中心销售几乎归零,业绩指引也不再包含中国数据中心收入——管制博弈事实上把中国市场让给了国产芯片。
A 股和港股怎么映射 GPU 主线?
设计层看已上市的摩尔线程(688795)、沐曦股份、景嘉微,港股看壁仞科技(06082.HK);兼容路线看海光信息(DCU 类 CUDA 生态);配套层看中芯国际(代工)、长电科技/通富微电(先进封装)以及 HBM、服务器、光模块等算力链公司。研究时要区分真有 GPU 收入的公司和蹭概念的公司,不构成投资建议。
数据与参考来源
- NVIDIA Q4 FY2026 财报及财报电话会(截至 2026 年 1 月 25 日财年)
- 摩尔线程首次公开发行股票科创板上市公告书及2025年年度报告
- 沐曦股份科创板上市公告书、审核问询回复及相关公告
- AMD 与 OpenAI 6 吉瓦 GPU 战略合作公告
- 景嘉微、海光信息、寒武纪 2025 年年度报告