同等 AI 能力一年便宜 13 倍:一份报告想给"思考"定出像电费一样的价,但它也自带两盆冷水
同等 AI 能力一年便宜 13 倍:一份报告想给"思考"定出像电费一样的价,但它也自带两盆冷水

电力有每度多少钱($/kWh),计算有每次浮点运算多少钱($/FLOP),存储有每 GB 多少钱,基因测序有每个基因组多少钱。可"让机器想一下"该定价多少?——这个此前几乎没法严肃回答的问题,2026 年 9 月 22 日有人给出了第一份系统性答案。

非营利研究机构 Epoch AI 发布报告《The Plunging Price of Thought(思想价格的暴跌)》,核心估算只有一句:自 2023 年以来,"达到同一个 AI 性能水平"所需的最低推理成本,平均每季度下降约 47%,折算下来一年大约便宜 13 倍。它覆盖数学、硬科学、技能游戏等五类基准;一个直观例子是——2025 年初在博士级科学问答 GPQA Diamond 上拿到 75% 成绩平均每题花 0.30 美元,不到 18 个月后,另一款模型达到同样成绩只要 0.0004 美元,降幅高达 725 倍。

这份报告真正的野心不是"告诉你 AI 变便宜了",而是换了一个计价单位:不再问"一百万 token 多少钱",而开始问"买到一档固定的机器认知能力,最少要多少钱"——即 $/capability。而更难得的是,研究者自己把泼冷水的证据也一并交了出来。

一、为什么"每百万 token"是个会骗人的价签

过去两年,模型厂商最爱比的指标是"每百万 token 单价"。但这个数字有个致命盲区:token 便宜十倍,不代表完成同一件事便宜十倍。因为一个模型为了啃下一道难题,可能要多烧三十倍的 token 去推理、反思、调用工具、反复重试。单价 × 更长的链条,最后算出来的任务成本完全可能不降反升。

Epoch 的做法是干脆绕开 token 单价,改画"成本—性能曲线":给同一个模型更大的推理预算,它会更贵、也可能更准;把很多模型的曲线叠在一起,就能找到"在某个时间点,达到某个能力水平的最便宜方案"。这条外包络线被叫做 cost frontier(成本边界)。于是比较的问题从"谁的模型最强",变成了"要买到同样强的能力,谁最便宜"——这更接近经济学真正关心的东西:不是原材料的价格,而是一单位有效能力的价格。

这也是它和我们此前分析过的两个话题的根本区别:讲"按任务总成本而非 token 单价选模型""价格战之后账单反而涨",谈的都是企业侧怎么算账;而 Epoch 这篇做的是供给侧的一场度量革命——它试图为"机器思考"建立一门像电价一样可比较、可预测的定价学。

二、把 AI 降价放进技术史:它是史上最快的那条曲线

报告最抓人的一组类比,是把 AI 的成本下降速度和历史上几项变革性技术放在一起比。即便计入通胀因素,AI 推理成本的下降速度仍约为:DNA 测序的 4 倍、计算机算力进步的 6 倍、锂离子电池改进的 18 倍、以及 1973 年以前电力降价的 54 倍。

参照技术AI 相对它的降价速度
电力(截至 1973)约 54×
锂离子电池约 18×
计算机算力约 6×
DNA 测序约 4×

Epoch 由此下了一个判断:在所有已知的通用技术里,AI 可能是价格下降最快的一项。报告还发现一条内部规律——一项能力"刚成为业界最强(SOTA)"时降价最猛(每季度约 66%、年化约 75 倍),约两年后放缓到每季度约 32%。换句话说,新能力先经历一段剧烈跳水,再趋于平缓;越早追平前沿、越能吃到这段最陡的红利。

驱动因素主要有二:一是前沿模型本身的迭代,二是蒸馏(distillation)训练方法的普及——让小模型高效模仿高性能大模型,单这一条路径就让成本每季度骤降约 66%。这也解释了为什么 2026 年的发布会都长这样:厂商已经不太靠"更强"竞争,而是靠"同样的强度更便宜"竞争。就在 Epoch 报告发布同一天,OpenAI 推出 GPT-6 Sol/Luna(API 价较前代促销价低 50%)、Anthropic 发布 Claude Opus 5.5(典型负载运行成本低 40%)——整个行业的叙事重心,正在从拼参数转向拼单位能力成本。

三、报告自带的两盆冷水:别急着乐观

值得敬佩的是,Epoch 没有把这份报告包装成纯粹的利好,相关讨论里也挂着两条必须读到的限制:

冷水一:13 倍里有多少是"真技术进步",多少是"竞争补贴"?MIT 的 Gundlach 等人用 Artificial Analysis 的定价数据做了更细的归因,结论是——总降价约每年 5–10 倍,但剔除硬件进步和市场竞争因素后,纯粹算法效率的进步大约只有每年 3 倍。也就是说,Epoch 那个惊人的"13 倍"里,相当一部分来自厂商赔本抢市场的"补贴",而不是技术本身在免费送你红利。一旦竞争降温、厂商要回本,这条曲线的斜率未必守得住。

冷水二:基准降价 ≠ 你的账单下降。Epoch 测的是"固定 benchmark 分数的最低推理成本",不是"现实劳动的价格"。一道数学题、一次法律判断、一段销售谈判、一个产品决策,根本不是同一种"thought"。而且正如第一节所说,推理型模型每道题实际烧掉的算力仍在上涨——单位能力的价格降了,总支出完全可能因为"你用了多得多的能力"而上升。报告本身也承认,"Price of Thought"目前更像一个研究纲领,而非成熟的计量单位。

四、这对企业到底意味着什么

第一,任何基于"今天的 API 单价"做的长期成本模型,都会系统性高估。既然同等能力每季度还在掉近一半,你今天锁死的三年期报价,明年大概率会被同行用新价打穿。做产品定价、签采购合同时,务必把降价条款写进去,或按"每季度 -X%"做敏感性分析——看看哪些功能会在半年后跨过盈亏线。

第二,"因为太贵而砍掉"的功能,值得定期拉回路线图重评。晚半年做同样的事,成本可能只有现在的十分之一。很多今天看起来不划算的 AI 场景(比如让 Agent 全程自动处理某类工单),半年后可能因为单位能力跌到新的成本边界而突然成立。降价带来的第一层变化是单个任务更便宜,第二层变化才是关键——更多原本"不值得自动化"的任务,被纳入自动化的经济射程。

第三,但别把"等待降价"当成策略。这是那两盆冷水教给我们的:其一,降价里有相当部分是竞争补贴,窗口可能随行业理性化而收窄——前面那句"变现技术优势的窗口很短暂"对厂商成立,对买方也同样成立,趁补贴期多用是实打实的省钱;其二,等待有机会成本,竞争对手正用同样的钱跑十倍的实验量。正确姿势是一边享受曲线红利、一边盯紧第④层(真实业务变现),而不是干等下一个更便宜的季度。

五、把这条曲线读成一张"什么时候该动手"的时刻表

如果只是把"每季度降 47%"当成一句利好口号,那这份报告就白读了。它真正值钱的用法,是把它变成一张决策时刻表——因为降价不是均匀的,报告里那条"刚达 SOTA 时每季度猛降 66%、约两年后放缓到 32%"的内部规律,恰恰给出了一个可操作的窗口判断。任何一项能力,在它刚从实验室走进前沿模型的头 18–24 个月里,价格下跌最陡;过了这段,曲线会明显变平。

把这条规律翻译成企业语言就是三类完全不同的动作。第一类是"已经在跑、且已经跨过成本边界"的场景——比如客服知识问答、文档摘要、代码补全,这些能力早在两年前就翻过了那道线,今天的价格只是把它们从"能用"变成"用得起了",此时该做的不是观望,而是把调用量拉满、把流程彻底重排到 AI 之上,因为再等下去红利已经榨得差不多了。第二类是"刚刚摸到边界、还在盈亏线附近挣扎"的场景——比如多步 Agent 自主处理一整条工单、跨系统的长链条决策,这类能力此刻正处在最陡的那段跳水区间,今天的每一分投入都可能被下一个季度的降价摊薄,适合用小额高频的试点去卡位,而不是压上全年预算做重资产建设。第三类是"还远在边界之外"的场景——需要强推理、长记忆、多模态实时协同的复杂任务,现在硬做的单位成本高得离谱,正确做法是把它们挂在路线图上下季度复查,而不是现在就立项。

这里藏着一个大多数团队会犯的反向错误:他们往往对第一类场景抠抠搜搜(因为觉得"AI 就该便宜"),却对第三类场景跃跃欲试(因为觉得"早做早领先")——恰好把资源配反了。理性的配置应该顺着曲线的斜率走:在降价最陡的第二类场景上做期权式的小额押注,在已经翻线的第—类场景上敢于重仓放量,把第三类留给未来更便宜的那个季度。

六、当"能力单价"趋近于零,钱到底花在哪

报告没有明说、但每一个读它的人都该提前想清楚的一个终局问题是:如果单位能力的价格真的像电价一样持续坍缩,那么未来的 AI 支出结构会发生什么变化?答案不在模型本身,而在模型之外的那一圈东西。

回顾电力史就能看清这个规律:电的单位成本降了几十倍,但社会的电气化总支出不但没缩、反而暴涨——因为钱从"买电"迁移到了"用电的装置"(电机、产线、家电、电网改造)。AI 正在重演同一条路径。当 token / 能力的边际成本逼近于零,竞争与预算的重心会整体向上迁移到四个更难被降价稀释的层:数据(你的私有语料和质量)、集成(把能力接进旧系统的工程)、治理(审计、合规、安全护栏)、以及分发(谁能把能力送到客户面前)。这四层恰恰不随 API 降价而变便宜,甚至因为能力泛滥而变得更稀缺、更值钱。

这也解释了为什么我们此前分析过的几个话题——FinOps 精管 AI 支出、AI 安全支出与软件投入的九倍错配、Agent 治理跟不上部署速度——会和这份降价报告指向同一个结论:省钱的战场正在从"谈低模型单价"转向"管好单价之外的钱"。当推理本身几乎不要钱的时候,一家企业 AI 账单里的大头将不再是 API 调用费,而是数据清洗、系统集成、人工审核、安全合规和为这些能力配套的组织变革成本。看得懂降价曲线是第一课;看懂"降价之后钱去了哪里",才是能在这一轮里真正算清账的第二课。

FAQ

Q1:"每季度降 47%"是不是说我的 AI 账单每季度会自动少一半?
A:绝对不是。47% 指的是"达到同一固定能力水平"的最低成本在下降,不是你的总支出。你的账单 = 单位能力价格 × 你消耗的能力总量。如果因为变便宜了你把调用量放大几十倍(这在 Agent 时代极其常见),总支出照样暴涨。这个指标衡量的是"能力的性价比在快速改善",给你的是"敢多用"的底气,而不是"会少花"的承诺。

Q2:Epoch 的 13 倍和 MIT 说的"纯算法约 3 倍",我该信谁?
A:它们没冲突,只是拆的层次不同。Epoch 报的是市场观察到的总降价(含硬件升级、规模效应、厂商竞争补贴、算法进步全部叠加);MIT 做的是归因分解,把非算法因素剔掉后单独看"算法本身贡献了多少",得到约每年 3 倍。做预算时用 Epoch 的总曲线(那是你实际会拿到的市场价),判断"这红利能不能持续"时参考 MIT 的归因(补贴驱动的部分不可长期依赖)。两个一起看才完整。

Q3:这对国内卷价格战的模型厂商有什么镜鉴?
A:一条正向、一条警示。正向是:单位能力成本快速下降确实能打开增量市场,让原本不经济的场景变得可自动化,这是真实的产业价值。警示是:MIT 的归因提醒——如果降价主要靠补贴而非算法/硬件效率,那就是在用资产负债表买份额,一旦融资环境收紧(参考我们上一篇讲的供应商融资风险)就难以为继。健康的降价应该越来越多地来自蒸馏、量化、调度这类真效率,而不是无限烧钱。


参考来源(英文一手材料):
Epoch AI – The Plunging Price of Thought(2026-09-22 发布;估算自 2023 年起达到固定基准性能的最低推理成本平均每季度降约 47%、年化约 13 倍;GPQA Diamond 75% 成绩每题 $0.30→$0.0004(725 倍);方法为 cost frontier 成本边界外包络线,覆盖五类基准;降幅约为 DNA 测序 4×、算力 6×、锂电池 18×、电力(至1973)54×;刚达 SOTA 时每季度降 66%、两年后放缓至 32%;数据与代码 GitHub 公开)
Artificial Analysis 定价数据 / MIT Gundlach 等归因研究(总降价约每年 5–10 倍,剔除硬件与竞争后纯算法效率约每年 3 倍)