2025 年的 AI 芯片市场依然是 NVIDIA 一家独大。多家行业研究机构披露,NVIDIA 在 AI 加速器(数据中心 GPU + 自研 ASIC 之外的部分)市场份额维持在 80% 上下,AMD 则在 5%-7% 之间徘徊。即便 AMD 推出对标 B200 的 MI350X,生态壁垒依然把差距拉得很开。但与此同时,Google TPU、AWS Trainium 2、微软 Maia、Meta MTIA 等自研 ASIC 正在持续蚕食边缘市场,这场比赛远没有结束。
为什么 NVIDIA 这么难撼动
外界在比较芯片时,往往盯着峰值算力、显存带宽这些纸面参数,但企业真正购买的是"算力背后的整套系统":CUDA 生态、cuDNN、TensorRT、NCCL,以及十年积累下来的优化库、训练框架适配、行业解决方案。
对大模型团队来说,换芯片不只是换硬件,还要重写训练脚本、重新调参、重新做性能 profile。即便 AMD MI300X、MI350X 在 FP8 TFLOPS、显存容量上具备竞争力,迁移成本依然让大多数客户选择继续押注 NVIDIA。第三方分析显示,NVIDIA 客户中超过 70% 的训练任务完全跑在 CUDA 上,这些团队的"代码资产"换不了。
更深一层,NVIDIA 的护城河不只是软件,还有"硬件-软件-算法"三层联动的节奏:每一代新架构(B100、B200、RUBIN)发布时,CUDA 同步推出对应优化库,主流框架(PyTorch、TensorFlow、JAX)同步适配,客户只需升级驱动就能拿到性能提升。这种"全栈节奏"让追赶者始终疲于奔命。
Blackwell 与 Rubin:节奏不停
2024 年底, NVIDIA 推出 Blackwell 架构 B100、B200,在低精度推理与训练上同时刷新纪录;2025 年 Q1 起,B 系列开始大规模交付,数据中心收入再次跳升。具体规格上:
· H100(SXM5):80GB HBM3,3350 GB/s 带宽,67 TFLOPS FP32、1979 TFLOPS FP16 Tensor,售价 15000-18000 美元。
· H200:141GB HBM3e,4800 GB/s 带宽(为 H100 的 1.4 倍),支持更长上下文,功耗与 H100 相当。
· B200:192GB HBM3e,8000 GB/s 带宽,Tensor 性能是 H100 的 2 倍以上,FP8 性能最高提升 5 倍,定位高端训练与低延迟推理。
下一代 Rubin 架构预计在 2026 年接棒,把单卡推理成本继续往下压。这意味着即使 AMD MI400 在 2026 年如期发布,Rubin 又会再次拉开差距——这是 NVIDIA "节奏制胜"的核心打法。
AMD:第二名已稳,前两名差距仍在
AMD 已经稳住 AI GPU 市场的第二名位置。MI300X 凭借 192GB HBM3、5300 GB/s 带宽、1307 TFLOPS FP16 Tensor 与 12000-15000 美元的定价,在微软 Azure、Meta、Oracle 等大客户中实现批量部署。AMD 数据中心 GPU 收入从 2023 年的 4 亿美元跃升至 2025 年预计的 50 亿美元,涨幅超过 10 倍。
MI300X 的核心卖点是"显存经济学":192GB HBM3 让 700 亿参数的模型无需张量并行就能跑在一张卡上,显著降低推理部署复杂度。在 FP8 算力与 H100 持平的同时,单卡可服务更大模型,这对中等规模团队的部署尤其友好。
2025 年底,AMD 发布 MI350X——FP8 TFLOPS 与 B200 持平,但 ROCm 软件栈与 CUDA 仍有显著差距。MI400 系列预计 2026 年发布,目标是把训练稳定性、推理性能、内存带宽再上一个台阶。
但 AMD 仍未跨越 25% 市场份额的关键阈值。原因很简单:对头部大模型团队,换硬件意味着整个训练 pipeline 重写,这种"沉没成本"远超硬件差价。第三方分析认为,AMD 在 2028 年前有望拿到 15%-20% 的份额,但突破 25% 的可能性极低——NVIDIA 的生态优势已经形成事实标准。
围剿 NVIDIA 的三股力量
第一股是 AMD。MI300X、MI350X 在性价比与显存容量上具备亮点,部分云厂商(如微软 Azure、Meta)已经批量采购,但份额提升有限。
第二股是自研 ASIC。Google TPU v5p、Trillium 已经在大规模支撑 Gemini 训练,TPU 提供比 GPU 云实例低 30%-50% 的每 TFLOP 成本,Pod 级别的互联让大规模训练效率显著高于单卡集群。AWS Trainium 2 针对分布式训练做了专门优化,在 Anthropic 训练 Claude 的部分工作负载中扮演关键角色,EC2 Trn2 实例提供比 GPU 实例低 40% 的训练成本。微软 Maia 100 在 2024 年底进入小规模量产,主要用于 Bing、Office 的内部推理。Meta MTIA 处理推荐与排序工作负载,大幅降低了 GPU 依赖。
这些自研芯片未必能直接卖给第三方,但能显著降低头部云厂商对 NVIDIA 的依赖度。如果超大规模云厂商在 2027 年前把 20%-30% 的训练迁移到自研芯片,NVIDIA 的定价权将面临真实压力。
第三股是国产替代。华为昇腾、寒武纪、壁仞、摩尔线程等厂商在国内市场获得大量政策性订单,在外部封锁背景下,逐步形成与 NVIDIA 不同的供给体系。这部分市场对 NVIDIA 的全球份额影响有限,但对"AI 主权"和"自主可控"的战略意义重大。
市场规模与未来 5 年的格局
AI 加速器总可寻址市场(TAM)从 2023 年的约 550 亿美元,增长到 2025 年的约 1600 亿美元,预计 2026 年突破 2000 亿美元。其中推理(inference)将占总支出的三分之二,意味着芯片设计的重心正在从"为训练服务"转向"为推理服务"——这对功耗、单卡延迟、token 成本的要求显著高于训练场景。
第三方分析指出,如果只统计"用于 AI 训练的离散 GPU",NVIDIA 的份额超过 90%;一旦把自研 ASIC 算进来,份额会降到 60%-70%。这种"统计口径差异"会让分析师得出截然不同的结论。
对企业用户的现实建议是:短期看,继续以 NVIDIA 为主力是稳妥选择;长期看,多供应商策略可以降低被卡脖子的风险。对于训练大模型的头部团队,合理的做法是:主力训练用 NVIDIA,推理与中小模型尝试 AMD 与自研芯片,逐步建立跨架构工程能力。
AI 芯片之争远未结束
AI 芯片之争远未结束,但可以确定的是:它已经不再是"一颗 GPU 的较量",而是"整个数据中心栈的较量"。NVIDIA 的护城河不在单卡性能,而在 CUDA + 主流框架 + 客户代码资产;AMD 的机会在显存经济学与价格性价比;自研 ASIC 的优势在专属工作负载下的成本结构。
未来 5 年,三股力量会继续在边缘市场激烈交锋:NVIDIA 维持 70%-80% 的核心份额,AMD 拿到 15%-20%,自研 ASIC 与新进入者瓜分剩余市场。但 NVIDIA 的"数据中心栈护城河"短期不会被绕过,任何对 AI 算力基础设施的长期规划,都必须把"NVIDIA 持续主导"作为基准场景。
这也是为什么,在 2025 年的财报会议上,每一家超大规模云厂商都在强调"多供应商策略"——不是因为 NVIDIA 会失去领导地位,而是因为任何单一供应商依赖,都不符合 5 年以上的基础设施投资逻辑。
软件生态:真正的护城河
硬件规格只是冰山一角,真正的护城河是软件生态。NVIDIA 的 CUDA 平台在过去 15 年里形成了事实标准:PyTorch、TensorFlow、JAX 等主流深度学习框架都对 CUDA 做了深度优化,任何新算子、新优化技术,开发者社区会第一时间贡献 CUDA 实现。这种"开发者飞轮"让 NVIDIA 的每一代新硬件都能在发布首日拿到生产级软件支持。
AMD 的 ROCm 平台虽然快速追赶,但仍有几个显著短板:1) 部分算子性能仍落后于 CUDA;2) 调试工具与 profiler 不如 NVIDIA 完善;3) 文档与社区教程相对稀缺。对中小团队而言,这些"软性差距"比硬件性能差距更难弥合。
这也是为什么尽管 MI300X 在性价比上有明显优势,大量训练团队依然选择 H100——他们不愿意承担"迁移到 ROCm 后遇到未知性能问题"的风险。在企业级 AI 基础设施里,"确定性"比"峰值性能"更重要。
中国市场:另一条平行赛道
由于出口管制,NVIDIA H100/H200/B200 在中国市场的可获得性受到限制。这给国产芯片创造了独特的窗口期:华为昇腾 910 系列已经在大模型训练场景中实现批量部署,寒武纪思元 590 拿到部分互联网客户订单,壁仞、摩尔线程、燧原等公司在推理场景也获得突破。
虽然单卡性能上,国产芯片仍与 NVIDIA 顶尖产品有明显差距(通常落后 1-2 代),但在中国市场的"性价比 + 自主可控 + 本地服务"组合下,国产 AI 芯片正在快速积累真实场景反馈,缩短软件生态差距。对中国的大模型团队来说,"国产芯片 + 自主框架"的双栈方案,在 2025-2026 年已经从"备选"变成"主选"之一。
对从业者的建议
无论你是研究者、工程师还是产品经理,理解 AI 芯片市场的真实格局,比追逐"最强 GPU"更重要。NVIDIA 仍是绝大多数场景的默认选择,但 AMD、自研 ASIC、国产芯片在不同细分场景都有独特价值。建立"多供应商工程能力"——理解不同硬件的编程模型、性能特征、成本结构——将是从业者在 2025-2027 年的核心竞争优势。
