大模型价格战:token 降价 90% 之后为什么账单反而涨了
大模型价格战:token 降价 90% 之后为什么账单反而涨了

2023 年初,一份行业报告里最刺眼的数字是:大模型推理的价格正在以每季度数十个百分点的速度下滑。到 2026 年 10 月,Silicon Data 追踪的推理价格指数跌到 97 美分,不到当年夏季高点的一半;token 单价相比 2023 年累计下降超过 90%。

按理说,应用成本应该跟着塌下来。但同期真实发生的是相反的事:Anthropic 在 2026 年披露的 Claude Fable 5.1 数据里,缓存读取价格从每百万 token 1 美元砍到 0.25 美元,降幅 75%;而单任务的实际成本反而上涨了 18%,达到 3.69 美元。原因是输出 token 数量涨到了原来的 1.7 倍。

这组反差是 2026 年 AI 应用经济最重要的一件事。这篇文章要回答的问题是:价格降了 90%,为什么账单涨了,以及企业该怎么重新算这笔账。

一、先把价格表摆出来:2026 年的两端差距是 100 倍

把 2026 年主流厂商的公开 API 定价排成一张表,最右侧和最左侧之间差了 100 倍。

模型输入(美元 / 百万 token)输出(美元 / 百万 token)输出 / 输入倍数
MiMo-V2.6-Flash0.140.282.0×
GPT-5.6 Luna0.100.505.0×
DeepSeek V4-Pro0.4350.872.0×
Gemini 3.8 Flash0.753.755.0×
Claude Sonnet 52.0010.005.0×
GPT-5.6 Sol4.0020.005.0×
Claude Opus 5.54.0020.005.0×

三个可以直接读出来的结论:

第一,输出比输入贵 2 倍到 5 倍,这是当前行业的标准结构。2.0 倍的是 DeepSeek 与 MiMo 这类国产与开源阵营,5.0 倍的是 OpenAI、Anthropic、Google 的旗舰线。这个比例不是随意的,它对应的是推理阶段的算力成本——输入是"读",输出是"写",写需要逐步自回归解码,每一步都要把整个模型的前向传播跑一遍。

第二,最高和最低的输出价差 71 倍(0.28 vs 20.00)。这意味着一个跑在 MiMo-V2.6-Flash 上的日常分类任务,和一个跑在 Claude Opus 5.5 上的复杂推理任务,单价可以差 70 倍以上。路由不是优化项,是决定商业模式能不能成立的前置条件。

第三,Gemini 3.8 Flash 有一个必须注意的时间炸弹。它的当前定价是 0.75 / 3.75 美元,但已公告将在 2027 年 1 月 1 日上调至 1.50 / 7.50 美元,恰好翻倍。任何把成本模型建立在这条线上的方案,都必须把这个变量写进敏感性分析。

二、降价 90% 之后,为什么单任务成本反而涨了 18%

这是整篇文章的核心。Anthropic 的 Claude Fable 5.1 数据把这件事讲得最清楚:

缓存读取价格从每百万 token 1.00 美元降至 0.25 美元(−75%),但单任务实际成本从约 3.13 美元升至 3.69 美元(+18%),原因是输出 token 数量增至原来的 1.7 倍。

把账算清楚:

变量降价前降价后变化
缓存读取单价1.00 美元 / 百万 token0.25 美元 / 百万 token−75%
输出 token 量基准 1.0基准 1.7+70%
单任务总成本约 3.13 美元3.69 美元+18%

这个算式有个值得注意的细节:单价降了 75%,用量涨了 70%,为什么总成本只涨 18% 而不是涨更多——因为降价的作用同时覆盖了输入和缓存部分,而涨的部分集中在输出。输出量涨 70%,最终只推高总成本 18%,恰恰说明输入侧的降价确实吃掉了大部分涨幅。如果输出量不涨,这单任务成本会是 1 美元出头,比降价前省三分之二。

三、杰文斯悖论:这就是它的名字

上面的现象在经济学里有个现成的名字。杰文斯悖论(Jevons Paradox)指的是:当一种生产要素的生产效率提升时,它的总消耗量不降反升。

1870 年英国经济学家 William Stanley Jevons 观察到,蒸汽机效率提升后,英国的煤炭总消耗量反而暴涨——因为省下来的成本让蒸汽机的使用场景扩大到了过去不经济的地方。经济学家 Torsten Sløk 在 2026 年的一次分析中把这个框架直接套在了大模型上:

杰文斯悖论的经典机制在大模型上的对应
单位效率提升每百万 token 单价下降 90%
单位可用性提升便宜到可以做以前算不过来的事:多轮推理、思维链、反思重试、子 Agent 并行
需求规模扩张用量的增幅超过了单价降幅
结果总支出上升

Google 的公开数据是这个悖论最干净的证据:2026 年 5 月的月度 token 处理量达到 3.2 千万亿,是一年前的 7 倍。单价同期降了 90%,但如果 token 量涨 7 倍,总支出是原来的 0.7 倍——听起来降了。但这里的关键在于:Google 的 token 量增长本身是由价格下降解锁的。两年前按当时价格,7 倍的调用量根本不会有客户去做。

换句话说,token 指数不是业务量的度量,是「价格解锁后的最大需求」的度量。用 token 增长来论证「业务在增长」,是拿一把会自己伸缩的尺子在量东西。

四、所以该看什么:三个替代指标

既然每 token 价格已经不能衡量成本,2026 年的行业共识是转向每任务成本和每成功任务成本。这个转变有真实数据支撑。

指标定义为什么它更准可引用的数据点
每 token 价格单价的绝对值只反映供给侧,完全不反映你的实际用量Silicon Data 指数 97 美分
每查询成本一次用户请求的总 token 成本仍然被重试次数和输出长度污染Claude Fable 5.1 单任务 3.69 美元
每成功任务成本总成本 ÷ 成功完成的任务数把失败重试的成本显性化了,这是唯一能对账的指标Pinecone 知识引擎:准确率基本持平,每任务成本降 77%

Pinecone 那条数据特别值得看:它 2026 年 8 月 6 日发布 Nexus 知识引擎正式版时公布的内部生产数字是「在准确率大致持平的前提下,把每任务成本降低了 77%」。注意它没有说"降价 77%",也没有说"token 用量减少 77%"——它说的是每任务成本,而实现手段是在层(知识引擎层)而不是模型层做的优化。这正是 2026 年的技术重心所在:钱省在架构上,不是省在采购上。

另一条来自成本管理侧的实测数据:Claude Code 在企业部署中的平均成本是每开发者每月 150–250 美元,约合每个活跃日 13 美元。这个数字可以换算成一条预算基线:如果一个 20 人研发团队按每人每月 200 美元计,年化是 4.8 万美元;按每人月均 19 美元的普通 AI 编码工具计,年化不到 4.6 千美元。相差十倍——而这两类工具解决的问题根本不是同一个量级的事。

五、成本失控的真实倍数:3 到 10 倍

如果只看价格表,会严重低估真实的落地成本。Gartner 在 2026 年的 Agentic AI 相关分析里给出了一个非常重要的量化:

按简单演示(demo)建模的每任务成本,在 Agent 处理真实世界的变化时,会低估生产环境成本的 3 倍到 10 倍。

3 到 10 倍这个区间,正好解释了前面所有的悖论。成本从 demo 到生产的放大,主要来自四个方向:

放大来源机制量级
重试与反思模型不确定时自己再跑一轮;Agentic RAG 单轮平均就要 5–7 次 LLM 调用(路由、文档打分、生成、幻觉复核)3–5 倍
工具调用链每步成功率 95% 的十步工作流,整体成功率只有 0.95¹⁰ ≈ 59.9%;失败就要重跑2–4 倍
上下文膨胀Claude Fable 5.1 的输出 token 涨 1.7 倍就是这个机制的表现1.5–2 倍
长尾输入demo 里 10 条精心挑的测试集,生产里是十万条真实提问的分布1.5–3 倍

0.95¹⁰ ≈ 59.9% 这个算式是所有 Agent 项目预算讨论的起点。它意味着一个十步的自动化流程,跑一次只有六成把握成功——那另外四成的成本谁来付?Gartner 给的处方是设硬性支出上限:每任务、每会话、每天三个层级的封顶。这不是财务技巧,这是架构约束。

六、怎么用这份信息:五条实践建议

第一,把成本模型从 token 维度重建到任务维度,一次算清三个数。输入单价 × 输入 token + 输出单价 × 输出 token + 重试系数 + 成功率折损。这四个变量里,前两个每次都在变,后两个才是你的架构决定不了的常数。做预算时按 Gartner 的 3–10 倍留余量。

第二,做多模型路由,不要押注单一供应商。输出价 0.28 美元和 20.00 美元之间差 71 倍。一个成熟的做法是把 80% 的简单请求路由到 0.14–0.75 美元那一档,剩下 20% 的复杂推理才走旗舰线——即使旗舰线用得少,整体账单也能降一半以上。同时记得给 Gemini 3.8 Flash 写进一条价格触发的降级规则:它的价格 2027 年 1 月 1 日翻倍。

第三,缓存和提示词前缀共享的收益是实打实的,但要盯住输出侧。75% 的缓存降价摊到总账上只换来 −7%(因为输出涨了 70%)。这说明缓存优化的边际收益正在快速衰减,而输出长度的控制才是新的成本主战场——限制最大输出 token 数、要求结构化输出而非自由发挥,通常比做缓存优化的收益大。

第四,接受杰文斯悖论,放弃"降本"叙事,改用"单位任务毛利"叙事。如果你在给业务方承诺"用 AI 降低成本",token 降价这条线会不断证伪你——因为总支出会因为用量扩张而上升。正确的框架是:用 AI 之后,每个流程的单位毛利是否提高。这个指标既不受价格战影响,也不受用量增长影响。

第五,把成本可观测性当成第一优先的基础设施。用 AI Gateway 按模型、按供应商、按用户追踪调用费用,先找出异常消耗,再谈优化。成本失控极少来自单价出错,来自某个租户或某条工作流悄悄跑了几万次——这件事没有任何一张账单能告诉你,但网关能。

七、结语

回到开头那组反差:单价降 90%,单任务成本涨 18%。

这不矛盾,这恰恰是 2026 年大模型应用经济的真实形状。成本没有下降,它换了地方——从模型供应商的定价表,转移到了应用架构本身。你省下的每 token 成本,被更长的输出、更多的重试、更多的工具调用吃掉了,然后以另一个名字回到账单上。

所以对你的实际决策只有三句话:用每成功任务成本去算账,用多模型路由去控价,用每任务/每会话/每天三重硬上限去兜底。至于"token 单价已经降了 90% 所以我的 AI 应用会很便宜"这个判断——那是一句关于 2023 年的事实,被安在了 2026 年的方案上。