别再按"每百万 Token 单价"选模型了:一次实测揭示 AI 账单的隐藏陷阱
别再按"每百万 Token 单价"选模型了:一次实测揭示 AI 账单的隐藏陷阱

2026 年 9 月 30 日,Cloudflare 发布了一篇带着完整基准测试的技术博客,介绍其 AI Gateway 的 Auto Router(自动模型路由)。这篇文章的价值不在于又一款路由器产品,而在于它用一组可复现的数字,戳破了一个几乎全行业都在默认接受的采购假设——「哪个模型每百万 token 便宜,就选哪个」。

Cloudflare 的原话把结论摆在了最前面:"lower token prices do not always produce lower-cost outcomes"(更低的 token 单价,并不总能带来更低的总成本)。一个纸面上看起来更便宜的模型,可能要多花不成比例的 token 才能把问题解出来。真正该被最小化的,是「完成这件事的预期轨迹成本」,而不是「每百万美元的价格标签」。

一、一次硬核实测:三个模型,一张账单

Cloudflare 用一个内部通用知识工作基准(模拟邮箱、日历、Slack、文件、差旅、财务等真实工作流,每个任务要求模型调用工具产出可验证的结果)跑了三方对比。样本设计很讲究:97 个任务 × 每个模型每任务 3 次采样 = 291 次试验,并给出从 10,000 次任务级 bootstrap 重抽样估计的 95% 置信区间。这是难得一见的、把不确定性都摊开讲的厂商实测。

模型成功率总成本每次成功成本
Cloudflare Auto Router86.6%(+6.2 / −6.9 pp)$2.10$0.0084
Anthropic Claude Opus 5.596.6%(+2.7 / −3.8 pp)$5.91$0.0210
OpenAI GPT-6 Sol84.2%(+6.5 / −6.9 pp)$2.64$0.0108

把这张表读对,比记住数字更重要:

  • 最强 ≠ 最划算。Claude Opus 5.5 成功率最高(96.6%),但每次成功的成本也最高($0.0210)。它是三者里唯一明显拉开成功率差距的,代价是单位成功成本约为 Auto Router 的 2.5 倍。
  • Auto Router 用约 80% 于 GPT-6 Sol、35% 于 Opus 的成本,拿到了介于两者之间的成功率。它的取胜逻辑不是"更聪明",而是"把不同难度的任务分发给不同价位的模型"——简单请求走便宜小模型,难请求才升级到大模型。
  • 置信区间提醒你别过度解读。Auto Router 与 GPT-6 Sol 的成功率区间高度重叠(86.6% vs 84.2%,区间互相覆盖),意味着在这份样本量下二者成功率并无统计上的显著差异;而 Opus 的高成功率区间与另两者基本不重叠,才是真实力差距。
一句话结论:当你把度量从"每百万 token 多少钱"换成"每完成一次任务多少钱",最优选择往往不再是单价值钱的那个模型,也不是能力最强的那个模型,而是能把任务按需分配的那一层。

二、为什么"单价低"会骗人:jagged frontier(参差的前沿)

Cloudflare 用一个概念解释了这一切——jagged frontier:不同模型的能力边界不是一条整齐的直线,而是参差不齐的。某个模型可能在代码上很强、在规划上很弱;另一个反过来。"解决某个问题的能力,往往散落在整个模型组合里的某一个角落。"

这直接击穿了"选定一个主力模型用到死"的采购思路。如果你只用一家旗舰,你会为大量本可以交给便宜模型的简单任务,持续支付旗舰溢价;而你偶尔遇到该旗舰不擅长、却被另一家轻松搞定的任务时,又白白多绕弯路。单价思维让你只盯着"每 token 成本"这条轴,却忽略了"这个任务到底需要几个 token、由谁来做最少"这条更关键的轴。

三、Agent 时代,这条轴被急剧放大

如果说单次问答时代,"单价 vs 总成本"的差异还不算致命,那 Agent 把它变成了决定性因素。原因很简单:一个 Agent 完成一次研究、编程或数据分析任务,背后可能是几十次甚至上百次模型调用——规划、检索、调工具、检查、失败重来。用户只看到"问了一次",账单却是按整条执行轨迹累加的。

几条相互印证的一线数据:

  • OpenRouter 平台上,与 Agent 相关的 token 使用量已增长约 14 倍(a16z 市场洞察口径);
  • Gartner 在 2026 年 8 月判断:随着 AI 产品从辅助功能转向多步骤自主执行,单个 Agentic AI 工作流的推理成本预计到 2028 年将增长超过 5 倍;同一份分析特别强调——"模型单位 token 成本下降并不意味着整体 AI 支出同步下降,因为更复杂的工作流会消耗更多、甚至更贵的 token";
  • Gartner 预计 2026 年全球 AI 推理支出将达 233 亿美元,首次超过训练支出的 190 亿美元——基础设施重心正从"训模型"迁到"跑模型"。

这三条凑在一起,就是 Cloudflare 那句结论的产业级版本:降价是每 token 的事,涨价是每任务的事。你买到的一直在变便宜的单价,很可能被 Agent 越来越长的调用链悄悄吃掉。

四、Cache 才是长会话的真凶,不是 list price

Cloudflare 在文中埋了一个容易被跳过、但对重度 Agent 用户最关键的细节:"对于调试、编码这类长 Agent 会话,成本更多由缓存读取(cache reads)决定,而不是模型的挂牌价——而且这部分成本随会话长度增长。"

这一点值得单独拎出来讲。长会话里,上下文会被反复喂给模型,如果每次都当新内容全价计费,成本会随对话长度非线性膨胀。业界已有的降本案例几乎都压在这条线上:

  • Hebbia 通过复用已处理背景信息的 Cache,把部分金融聊天负载成本降低约 10 倍;
  • Databricks 用 Router 按任务选模型,在提高完成率的同时把成本压低约 35%;
  • Elise AI 通过微调更小模型,把成本降低约 60%,同时降低实时语音场景延迟。

这三个数字来自不同公司、不同场景,不能横向比较高低,但它们指向同一个动作:降本的杠杆不在"谈一个更低的 token 单价",而在"缩短轨迹、复用上下文、按任务匹配模型"。

五、给企业的四条落地建议

建议一:把 KPI 从"每百万 token 成本"改成"每次成功任务成本"。这是最根本的一步。前者奖励你买便宜的模型,后者才奖励你把事情办得又对又省。做法:给关键工作流定义"什么算成功"(可验证的产出/动作完成),再统计达成一次成功的平均花费。

建议二:上路由层,别让所有流量都走旗舰。哪怕先用最简单的规则路由(简单任务→小模型、复杂任务→大模型),也能立竿见影。Cloudflare 的做法更进一步:用一个多头分类模型给请求打「14 类任务 + 复杂度/模糊度/风险/上下文依赖四维评分」,再结合各模型基准结果和 token 价格,估算最合适的落点。你可以从规则版起步,逐步演进。

建议三:优先做缓存与上下文瘦身。长会话先查 cache 命中策略是否配好,再查能不能压缩重复喂入的背景信息。对编码/调试类 Agent,这一项的收益常常大于换模型。

建议四:采购前自己跑带置信区间的评测,别信厂商单一榜单。Cloudflare 这份实测之所以可信,恰恰因为它给了样本量和 95% 置信区间。你在选型时也应针对自己的真实任务集做多轮采样,看"每次成功成本"而不是看跑分排名——别人的基准不等于你的成本结构。

六、FAQ

Q1:那是不是越便宜的模型越好?
A:不是。Cloudflare 的数据恰恰说明,Auto Router 靠"混合分配"拿到最优的每次成功成本,而不是无脑选最便宜的单一模型。目标函数是"单位成功成本",便宜只是其中一个变量,能力够不够、要不要重试,都是成本。

Q2:Opus 明明成功率最高,为什么说它不划算?
A:要分场景。如果你的任务确实只有旗舰能稳定完成(高风险、高难度),那为高成功率付费是对的。"不划算"指的是——把大量本可由中小模型胜任的日常任务也一律丢给旗舰,那部分溢价才是浪费。路由层的价值正是把这两类分开。

Q3:这套结论对中国企业用国产大模型同样成立吗?
A:底层逻辑完全成立——任何多家模型共存的环境都会有 jagged frontier 和"单价≠总成本"的现象。差别只在具体模型组合和价格表。落地时把上面的"每次成功成本"评测针对你实际接入的国产模型重跑一遍即可,不要照搬别人榜单。


参考来源(英文一手材料):
Cloudflare – Cut your AI spend with AI Gateway's Auto Router(2026-09-30,97 任务×3 采样基准 + 95% 置信区间)
Gartner – Agentic AI Inference Cost Forecast(2026-08,单工作流推理成本到 2028 增超 5 倍;2026 推理支出 233 亿 > 训练 190 亿)
a16z – Market Insights(OpenRouter Agent 相关 token 用量增约 14 倍;Hebbia/Databricks/Elise AI 降本案例)