2026 年,全球 AI 花在"用模型"上的钱第一次超过"练模型":Gartner 给出 233 亿对 190 亿的分水岭,信通院说推理已占算力负载七成
2026 年,全球 AI 花在"用模型"上的钱第一次超过"练模型":Gartner 给出 233 亿对 190 亿的分水岭,信通院说推理已占算力负载七成

2026 年,AI 基础设施的投资逻辑出现了一道标志性的分水岭:全球花在"运行模型"(推理)上的钱,第一次超过了花在"训练模型"上的钱。Gartner 的最新预测显示,2026 年全球推理支出将达 233 亿美元,首次越过 190 亿美元的训练支出,占到 AI IaaS(基础设施即服务)总支出的 55%;按同一口径,这个比例在 2027 年还会升到 59%。而中国信通院《词元(Token)经济发展研究报告(2026 年)》给出的判断更激进:2026 年推理算力将占 AI 算力总负载的 70.5%。

一句话结论:"训练领先、推理跟随"的时代结束了。当代理式 AI(Agentic AI)把"一次问答"变成"一串自主行动",计算的重心正从实验室转向生产线。但这场转身里藏着三个必须拆开看的账本——其一,推理支出的爆发是真实的,可"Token 消耗量"是工作负载指标而非财务指标,流量不等于收入;其二,词元的价值密度相差十万倍(消费级约 0.01 美元/百万词元 vs 产业级可达 1000 美元/百万词元),堆调用量的叙事远没有堆高价值场景来得扎实;其三,"卖水电煤"式的 API 计费单价持续下行,真正的护城河正在从算力规模转向合规、延迟与行业流程嵌入。

一、先钉口径:两个"七成五成"分别是谁说的、算的是什么

这轮讨论涉及两家机构、三个不同口径的数字,混着读很容易失真,先把它们拆开:

数字出处与统计对象时间窗
推理支出 233 亿美元 > 训练支出 190 亿美元(占 AI IaaS 总支出 55%,2027 年 59%)Gartner 预测口径,统计的是花钱采购推理/训练用的云基础设施服务(IaaS 层支出)2026 全年预测值
推理算力占 AI 算力总负载 70.5%中国信通院《词元经济发展研究报告(2026 年)》,统计的是算力负载(工作量占比),不是金额2026 预计
中国日均词元调用量:2024 年初约 1000 亿 → 2026 年 6 月约 500 万亿同一份信通院报告,统计的是调用量(Token 数),两年半约 5000 倍2024-01 至 2026-06

三点提醒。第一,55% 和 70.5% 不是矛盾,而是两把不同的尺:前者按"钱"算(采购 IaaS 的支出结构),后者按"活"算(算力承载的工作负载结构),单位和分母都不同,不能互相验证更不能平均。第二,Gartner 的 233 亿是预测值不是决算值,IaaS 支出的统计边界也不包含企业自建数据中心的折旧——这部分恰恰是巨头们的大头。第三,"5000 倍"这种量级暴涨要警惕基数效应:起点是 2024 年初那个极小的日均 1000 亿,任何早期渗透曲线都能算出惊人的倍数。

二、为什么偏偏是现在反转:Agent 把"一问一答"变成了"一连串行动"

Gartner 把这次重心迁移归因于一句话:代理式 AI 在提升计算强度。背后的机制值得展开,因为它是理解整场转身的钥匙。

传统聊天式的用法是"一问一答":用户输入一段提示,模型输出一段文字,一次前向传播,消耗有限。而 Agent 的用法是"规划—调用工具—观察结果—再规划"的循环:一个看似简单的任务(比如"帮我把这批发票录入并生成月度汇总"),可能被拆成几十次模型调用、多次外部系统读写、失败后的重试和反思。同一个业务动作,推理消耗从"一条回答"膨胀为"一整段执行轨迹"。站内此前分析过 Uber 的 GDPR 第 22 条罚单(ID 1657)和 New Relic 揭示的 AI 编程验收断裂(ID 1662),它们讲的是 Agent 上生产的治理与质量课题;而从这里看,每一个真正跑在生产里的 Agent,同时也是推理消耗的放大器——采用率和计算强度是同一枚硬币的两面。

需求侧的证据也在积累。信通院报告显示,截至 2026 年 6 月底,中国智能算力总规模达 2185 EFLOPS(FP16 口径),2025 年全国累计建成 42 个万卡级智算集群——这些重资产投下去,承载的越来越多是推理负载而非训练任务。一线从业者的体感更直接:GoodVision AI CEO David Wang 的判断是,2025 至 2026 年是分水岭,"过去企业做 AI 以试验、POC 为主,2026 年大量业务进入常态化运行,编程、生物数据处理、游戏 AI 角色、视频生成成为高消耗场景。"

三、Token 不等于钱:价值密度相差十万倍的两端

推理支出暴涨的第一反应,往往是"卖 Token 的要发财了"。但信通院那份报告里最有价值的一张表,恰恰给这种冲动泼了冷水:不同应用场景的词元价值密度差异巨大。

消费级场景是"流量消耗型":闲聊、娱乐问答这类应用,只需要基础交互能力,价格约 0.01 美元/百万词元。产业级场景则是另一极:药物研发、金融量化、精密代码生成这类任务,词元价值可达 1000 美元/百万词元——两端相差十万倍。David Wang 举的一个生物医药客户案例很能说明问题:过去 1 到 2 名研究员花 7 天处理实验数据,引入 Agent 后压缩到 10 分钟,而 Token 消耗只有个位数美元。他说得很直白:"客户买的不是 Token 数量,是业务任务完成结果。"通过路由优化减少无效调用和重试,Token 消耗反而下降,任务价值却在提升——如果按"消耗量=收入"的逻辑,这单生意是"萎缩"的;可按结果计价,这是典型的增值。

这个反差对企业采购方的含义很实际:考核 AI 用量时,别把 token 消耗当 KPI。调用量高可能说明流程设计糟糕(反复重试、上下文塞爆),调用量低可能说明任务被一次性做对了。更该盯的是单位任务的完成成本与完成质量——这也是为什么"每成功任务成本"(cost per successful task)正在取代"每百万 token 单价"成为新的度量衡(本站 ID 1644 实测过按 token 单价选模型的隐藏陷阱,两者正好呼应)。

四、流量幻觉:OpenRouter 榜单、HF 下载量与"出海成绩"的距离

推理时代还制造了一种新型数据繁荣:调用量榜单。OpenRouter 数据显示,9 月 21 日至 27 日全球 AI 大模型总调用量 146 万亿 Token,环比增长 13.18%;中国大模型周调用量连续二十二周超过美国。这些数字提振人心,但多位受访从业者提醒,市场普遍把 Hugging Face 权重下载量和 OpenRouter 调用量混同为商业成绩,而两者的含金量天差地别。

西南证券首席分析师苟宇睿的界定最清晰:"Token 首先是工作负载指标,不是财务指标。"OpenRouter 统计的只是经由其 API 路由的那部分流量,不包括模型厂商自有 API、其他云市场、企业私有化部署,以及开发者下载权重后本地运行的量。换句话说,你在这张榜单上看到的热度,只是真实世界的一角,而且恰好是最容易虚增的一角(免费额度、批量测试、路由商自身的促销都会灌入水分)。PPIO 的谢晋则点破了另一层混淆:Hugging Face 的高下载量更像"品牌曝光量"而非收入——它说明关注度,从关注度到真金白银之间隔着完整的转化链路。

由此他区分了两件常被混谈的事:"模型出海"卖的是配方(权重开源,建立技术影响力,本身不直接产生收入);"Token 出海"卖的是服务(海外用户通过 API 调用部署好的推理服务,按消耗付费,背后是一整套算力、推理优化、稳定性保障与合规架构)。后者才与实际收入挂钩,但也需要持续承担 GPU 折旧、带宽、海外节点运维、渠道分成和合规成本。

五、Token 工厂:谁在把裸金属变成可计费的推理能力

围绕"推理服务化",一批被称为"Token 工厂"的玩家正在成型。它们的共同逻辑是:不只卖算力,而是把裸金属变成可交付、可计费的模型推理能力。格局大致分三层。

公有云巨头拿走了大头。IDC 数据显示,2025 年中国公有云上大模型调用量达 1944 万亿 Tokens,同比增长 16 倍;其中火山引擎以 49.5% 的市场占比位居第一,阿里云、百度智能云分别拿 28% 和 10%——三家合计接近九成。独立 MaaS 推理服务商在夹缝中融资扩张。硅基流动 9 月宣布完成 B+ 轮二期和 C轮融资,2026 年累计股权融资接近 29 亿元人民币;按营收排名第一的 Fireworks AI 传出考虑新一轮融资,目标估值 300 亿美元,较 7 月几乎翻倍。连运营商和传统 IDC 玩家都在集体转向"Token 经营":中国电信天翼云推出星辰 TokenHub,中国移动 MoMA 引擎升级到 2.0,中国联通"星罗"算力调度平台实现 2000 公里四地三芯跨域混训;优刻得已在全球 28 个地区部署 36 个可用区。

需要给这些份额数字加个注脚:IDC 统计的是"公有云上的大模型调用量"份额,反映的是流量分布而非营收分布——火山的 49.5% 里有多少是低价冲量、多少是高价值产业调用,公开口径看不出来。判断一个玩家的真实位置,还得回到价值密度那张表上去看:它接住的调用,落在 0.01 美元那一端,还是 1000 美元那一端。

六、终局拷问:卖水电煤的模式,能撑起多深的护城河

把上面的链条推演到最后,会撞上一个商业模式的本命问题。谢晋的判断相当清醒:当前 Token 出海的主要收入来源还是 API 调用,这是一种"卖水电煤"的模式——单价持续下降,收入增长完全依赖调用量的指数级增长;一旦调用量增速放缓或价格战加剧,整个商业模式的利润空间会被严重挤压。这与本站此前分析的大模型价格战(ID 1612:token 降价 90% 之后账单反而涨了)形成有趣的对照:对买方,总量上涨让账单没减;对卖方,单价下跌让毛利变薄——两头感受相反,这正是水电煤生意的典型特征。

那么中长期靠什么?刘华列了五个方向:模型 API 与统一推理平台、推理基础设施与成本优化、面向重点行业的 AI 服务、全球网络与本地化部署、安全与合规服务。他特别强调,通用模型能力需要进一步与电商、游戏、金融、制造、安防等行业流程结合,"才能形成持续付费"。而短期最硬的门槛其实是合规与延迟:欧盟 GDPR、中东数据本地化、各国跨境传输规定都要求用户数据留在本地,违规罚款最高可达全球营收的 4%;C 端应用端到端延迟要压进 5 秒以内,跨大洲 API 单程网络延迟就可能超 200 毫秒——这两道墙决定了"多区域本地化部署"不是加分项而是入场券。

对中国厂商而言,机会与约束同样具体:电力成本、基础设施建设与推理工程优化构成结构性成本优势,但 GPU 折旧、带宽、海外运维与渠道分成会吃掉一部分——最终比拼的仍是单位任务的交付成本与可靠性,而不是机房里堆了多少卡。

七、FAQ

Q1:推理支出首超训练,是不是意味着训练(造新模型)不重要了?

不是。这个交叉点说的是"支出结构"的迁移,不是"技术重要性"的降格。前沿模型的训练仍在继续,且单笔规模更大;只是全行业算力的用途分布变了——越来越多的存量算力被用来"服务用户"而不是"培育模型"。对采购方来说,实际影响是预算科目要换:以前关心"哪家的模型强",现在要开始算"每次调用多少钱、千万 Token 能产出什么",这正是 Gartner 把口径定为 IaaS 支出的原因。

Q2:中国日均词元调用量两年半涨 5000 倍,这个数字可信吗?

方向可信,但要会读。这是信通院对全国总量的统计,起点极低(2024 年初日均约 1000 亿),早期渗透阶段的高倍数有基数效应成分;且"调用量"是负载指标,不等于付费收入——免费试用、内部测试、批量跑批都会计入。更有意义的读法是把它和 IDC 的"2025 年中国公有云大模型调用量 1944 万亿 Tokens、同比增 16 倍"放在一起看量级趋势,而不是纠结单一倍数。

Q3:对企业客户来说,推理时代最该改变的一个采购习惯是什么?

停止按"每百万 Token 单价"比价,改按"每个成功任务的完整成本"核算。理由有三:其一,词元价值密度横跨五个数量级,同样的 Token 数在不同场景下创造的价值可以差十万倍;其二,Agent 类应用里重试、反思、长上下文的隐性消耗会让名义单价彻底失真(本站 ID 1644 实测过这一点);其三,供应商的降价竞赛会持续,你今天按单价锁定的合同,明年可能就高于市场价——真正锁死成本的是任务结构与流程嵌入方式,而不是报价单上的数字。


参考来源:

· Gartner — 2026 年 AI IaaS 支出预测(2026 年全球推理支出 233 亿美元首超训练支出 190 亿美元,占比 55%,2027 年 59%;转引自《科创板日报》2026-10-04 报道,记者王耐)

· 中国信通院 — 《词元(Token)经济发展研究报告(2026 年)》(推理算力占 AI 算力总负载 70.5%;日均词元调用量 2024 年初约 1000 亿→2026 年 6 月约 500 万亿;词元价值密度 0.01~1000 美元/百万词元区间)

· IDC — 2025 年中国公有云大模型调用量 1944 万亿 Tokens、同比增 16 倍;火山引擎 49.5%、阿里云 28%、百度智能云 10% 份额(同上科创板日报引述)

· OpenRouter — 2026-09-21 至 09-27 全球大模型周调用量 146 万亿 Token、环比 +13.18%,中国连续 22 周超过美国(榜单口径仅含经其路由的流量,系工作负载指标而非财务指标)

· 站内交叉阅读:每百万 Token 单价的隐藏陷阱(ID 1644)、token 降价 90% 账单反涨的价格战分析(ID 1612)、Uber 人工监督红线(ID 1657)——不同机构口径仅作方向对照,不可相加平均。