一、写这篇的动机

2026 年 8 月,如果只看新闻头条,大家还是会以为企业 AI Agent 落地的卡点是"模型不够聪明"或者"工具接不通"——但把视角从演示台移到 CFO 的桌面和采购部门的对账单,过去三个星期发生的几件看似无关的事件,正在悄悄把 AI Agent 落地的瓶颈,从"工程层"挪到了"金融基础设施层"。

8 月 19 日,Stripe 正式披露收购 OpenRouter,交易金额在 70 亿到 80 亿美元之间,被 Stripe 自己称为"公司史上最大一笔收购"。OpenRouter 是一家只有 90 人、成立三年的公司,核心产品是给开发者一个账号就能调用 400 个 AI 模型、80 家供应商,每天跑 10 万亿 token,在 5 月 Alphabet 旗下投资基金领投一轮时估值还是 13 亿美元,三个月涨 6 倍。Stripe 创始人 Patrick Collison 给出的解释不是"AI 模型路由很重要",而是把 token 称为"建造 AI 公司的中央货币"。

8 月 16 日,DeepSeek 把自己原本固定费率的 API 改成"高峰期/低谷期"分时电价。8 月 21 日,OpenAI 旗舰模型官降超过 20%,但只作为促销、只持续三个月、月度订阅用户不在列。同周期,Anthropic 把大量订阅用户迁到按 token 计量的方案上。几乎所有头部供应商在 2026 年 8 月同时做了同一件事——把"按席位收费"换成"按用量收费",而且让价格随着时间、套餐、是否订阅浮动。

这条曲线告诉我们一件事:Token 不再是稳定数字,它已经进入"实时行情"模式。在这种模式下,挑最便宜的模型不是比拼价表格,而是一个 4 点钟行情变、11 月份就过期的实时交易问题。答案是:谁来处理一个 AI Agent 跑一晚任务花了哪些 token、走的是哪家模型、调用方哪个部门、怎么分摊、怎么对账、怎么扛住审计——这些事情,过去归工程,现在归金融。

把这件事接到"美辰帮企业接 Agent"这条主线上:企业今天采购一个 Agent 系统,真正的预算盲区不是许可证、不是训练、不是 GPU 租赁,而是运行时按 token 计费的不可预测性。一个中型企业的 AI Agent 一个月跑下来,token 费用占比常常超过整套 IT 预算的 5-15%,但其中能讲清楚"哪些部门、哪些流程、哪些 prompt 在花这笔钱"的公司占比不到 20%。这不是工程问题,这是计费层问题。

二、把 2026 年 8 月这一周放在一起看

把三件表面无关的事件放在一起,会发现一条非常清楚的金融基础设施升级链:

第一件:Stripe 80 亿美元收购 OpenRouter。这件事的实质,是支付行业最大的"按用量计费"基础设施公司,把"按 token 计费"的中间层吃进自己的产品体系。Collison 公开讲话里强调的不是 AI、不是模型质量、不是 benchmark,而是"稀缺算力的有效使用"和"可被审计的账本"。Stripe 当天同时把 OpenRouter 的产品挂在自己原本的"按用量向客户收费"的产品旁边——一边是入口,一边是出口。

第二件:DeepSeek 把固定费率换成峰谷分时电价。表面上是一次 API 价格调整,本质是把"按秒针计费"这件事,推到了头部供应商默认配置的位置。一旦定价变成"高峰一小时 0.7 元/百万 token、低谷半小时 0.07 元/百万 token",企业做 Agent 调度的工程师必须考虑"这个任务什么时候跑、用哪一档模型最划算"。这不是工程优化,这是金融调度。

第三件:OpenAI 旗舰模型在 8 月 21 日官降超 20%,但同时叠加"三个月限时""月度订阅不可用""只对新窗口计费"三重条件,本质是一次非常精准的"按场景价格歧视"。同一时刻,Anthropic 在年中把大量订阅用户迁到按用量计费,GitHub Copilot 在 6 月 1 日把所有套餐迁到用量积分制。

三件事叠在一起,说明 2026 年下半年,token 的定价已经完成一次历史性切换:从"月度订阅 + 限量配额"切换到"按秒按 token 波动 + 多重促销 + 峰谷电价"。一旦进入这个模式,过去几年采购部门用 Excel 维护的"AI 模型单价表"全部失效,过去由 SaaS 财务系统承担的对账工作突然多了一个新层级——"AI Agent 计量层"。

三、为什么这件事比模型升级更被低估

把"模型升级"放在时间轴上看,从 GPT-4 到 Claude Opus 4.6,基准分数在涨,能力在涨,但同一时间段内,token 单价降幅并不显著——大部分企业每次用 AI,花的钱是上一年的 0.7 到 1.3 倍,而不是 0.3 倍。原因很简单:模型升级带来更高的 token 消耗,推理链变长、多步规划变深、上下文窗口变大、Agent 跑多轮工具调用,每一次"升级"都同时把单次任务消耗的 token 数量推上一个数量级。

但是,把"计费层"放在时间轴上看,2026 年 8 月这一周发生的变化,几乎是过去三年里最大的一次:定价模式从静态变动态,从固定变浮动,从单档变多档,从订阅变按用量。理论上,这件事对成本的影响大于模型升级,但整个行业——包括供应商、咨询公司、企业采购部门、AI 工程团队——几乎没有把这件事列为独立议题。

低估它的原因有三个:第一,这件事不是任何一家供应商可以单独解决的,它需要一个新的中间层,OpenRouter 之前做的事情是把 80 家供应商统一到一个接口,Stripe 做的事情是把用量和支付对接到一起,两个能力拼在一起才是"计费层";第二,企业的财务体系通常以月为单位,而 token 计费以分钟甚至秒为单位,两者时间粒度不对齐;第三,采购部门习惯按席位签合同,把 token 当成可预测物料,但过去一年里没有任何一家头部供应商还在按这种假设销售。

四、新范式:Agent 计费层 = LLM Gateway + 用量计量 + 金融对账

当 token 价格变成实时行情,企业 AI Agent 必须跑在一个新的中间层上——可以叫它 LLM Gateway、AI Operations Gateway、Agent 计费层。三件能力必须同时具备:

第一,实时计量。每一个 Agent 任务从开始到结束,内部调用了几个模型、每一次输入多少 token、输出多少 token、命中缓存多少次、走了几次工具调用、最后被人工复核几次——这些数据必须以秒为单位落库,并能按任务 ID、Agent ID、租户、部门、产品线任意切片聚合。

第二,成本路由。给定一个任务的复杂度、延迟要求、合规区域、可用预算,网关层要在几十毫秒内决定"哪一家供应商、哪一档模型、哪个时段、是否走缓存"——这件事对最终成本的影响经常在 30% 到 300% 之间。比如一个夜间批量任务可以切到 DeepSeek 低谷窗口,一个欧洲金融场景因为 GDPR 必须走 Azure EU 节点,一个对延迟极敏感的场景需要短上下文模型。

第三,金融对账。每天结束,网关要把"实际花的钱"按部门、合同、预算中心、PO 号拆分,和供应商账单对得上,经得起外部审计。这一层过去归财务,现在必须由工程和财务共同维护,而且延迟要求从"月"降到"日"——很多企业在 2026 年开始按日核对 token 预算,而不是按月。

五、四个 8 月新动作如何重写企业 Agent 预算

把这套范式落到 2026 年 8 月的产品动态上,可以看到四个非常具体的可观察变化:

第一,Stripe 收购 OpenRouter 后,马上把它挂在了 Stripe Billing 旁边。这意味着从 2026 年 Q4 开始,Stripe 的支付 SaaS 用户可以直接用同一套财务基础设施向自己的客户收"按 token 用量"的钱——这件事对 SaaS 公司的意义远超对 AI 公司的意义,因为它让"按用量收费"从一个工程难题变成一个开箱即用的财务开关。

第二,DeepSeek 把 API 切成峰谷两档。头部供应商第一次用"分时电价"作为默认配置,这意味着任何一份"哪家模型最便宜"的比较表在发布当天就可能过期,因为高峰时段和低谷时段的价格差经常在 5 到 10 倍之间。

第三,OpenAI 限时降价叠加"只对新窗口、订阅不在列"三重条件。这是头部供应商第一次把"促销 + 定向 + 时段"三个维度组合使用——本质上已经把 AI 用量变成了"零售业"。

第四,LiteLLM、Portkey、Kong AI Gateway、Cloudflare AI Gateway 四款网关产品在过去 12 个月同时升级了"用量计量 + 路由 + 缓存"三大模块,Proxy 延迟从 40 ms 进一步压到 1 ms 到 25 ms 之间,已经接近生产可用——这意味着任何一家中型企业都可以用开源或 SaaS 方式,把上述三层能力拼起来,代价是一两个工程师一个月。

六、今天就能落地的 7 道预算与对账工程

把上面四件事落到企业可执行清单,从美辰过去一年做企业 Agent 落地的项目里,沉淀出 7 道"今天就能做"的预算与对账工程,按优先级排序:

第一,先用开源 LiteLLM 或 Cloudflare AI Gateway 把"全公司 token 用量"接到一个统一面板上,把每一笔调用按"模型 × 部门 × 项目"切片,哪怕只是看一周,绝大多数企业都会发现 3-5 个 token 黑洞——某些 prompt 重复率 80% 却没有命中缓存、某些工程团队的回归测试每天跑 200 万 token 但已经半年没人清理。

第二,把高峰 / 低谷时段的策略写进 Agent 调度器,夜间批量任务切到 DeepSeek 低谷窗口,白天 P95 延迟敏感场景走 OpenAI 旗舰或 Claude Opus,合规要求严格的场景按地区路由,这一步平均能压 20% 到 40% 的 token 成本。

第三,引入语义缓存。对每一条 prompt 检索其语义相似度,命中阈值就复用上一轮的输出——这一改动在客服、知识库、检索类场景里,平均能再砍 30% 以上支出,代价是接一个向量数据库和加一个缓存层。

第四,部署 Fallback Cascade。一条主路由 + 两条备用 + 一条应急,自动在 HTTP 429、503、529 错误、超时等场景下切换——这件事不是"为了省 token",而是为了把"半夜 API 限流导致整个 Agent 队列雪崩"这类故障从 SRE 凌晨 3 点的电话里剔除。

第五,把 Agent 任务粒度从"工程 ID"切到"业务 ID + 部门 + PO"。每一次 Agent 调用必须落到一个具体的业务诉求,而不是一个工程师的某个 PR;这一步让财务部门能够在月底把 token 账单按业务维度汇总,而不是按 IT 部门一笔糊涂账。

第六,设定"每任务预算"。给每一个 Agent 任务一个 token 上限 + 单次失败成本上限,超出就降级到更便宜的模型或转人工。这一步是从"按席位预算"切换到"按任务预算",是企业 AI 财务模式的根本性迁移。

第七,把每日对账改成"日报 + 周报 + 月报"三层。每天对账的目标不是审计,而是发现异常——某个部门的某一天突然多了 5 倍 token 消耗,可能是 prompt 注入攻击,也可能是恶意内部使用,日报能在 24 小时内发现这件事。

七、含义:Agent 采购合同的话语权正在移位

把这套 7 道工程做完,企业 AI Agent 采购合同的话语权会发生一次非常明显的移位:从 2023 年由供应商主导的"席位 + 配额"模板,转向 2026 年由买方主导的"任务 + 预算"模板。

具体来说,合同里会出现几个之前没有的字段:任务粒度的 token 单价上限(而不是月度订阅)、峰谷分时定价条款、特定地区合规溢价条款、缓存复用条款(命中缓存不计费或低单价)、紧急备用通道条款(主供应商故障时启用替代供应商并锁定价格)、按结果计费的对接条款(出错的 token 不计费或低单价)。

这一变化对供应商的反作用力同样巨大。Stripe 收购 OpenRouter 实际是供应商意识到"中间层"是不可绕过的——任何一家直接面对最终企业的供应商,如果自己的 token 价格随时浮动,又没有用量计量和金融对账能力,客户必然转向多供应商策略,这是 Stripe/Portkey/Cloudflare 这一层存在的根本逻辑。

八、方向:未来 12 个月的三件事

把上面的分析向前推 12 个月,2026 年 9 月到 2027 年 9 月,可以预言三件事:

第一,头部供应商会推出"任务型 API",一次调用给一个目标 + 输入 + 预算,供应商内部决定怎么分配 token。Intercom Fin 的 $0.99/resolved ticket 已经在客服场景验证过这条路,Gartner 内部预测"40% 的 agentic AI 项目将在 2027 年前被取消",意味着用结果定价的产品会比用 token 定价的产品更容易过采购委员会的预算审查。

第二,出现"Agent 成本对账中间件",专做"每月自动把 token 账单按业务切片、写入 ERP、附带 GL Code、附带成本中心"。这类产品的客户是 CFO 和采购委员会,不是工程师。它的商业模式大概率是"按对账金额抽成 + SaaS 订阅",Stripe + OpenRouter 的组合已经把基础设施摆齐,只缺一个把这套能力封装成企业级 SaaS 的团队。

第三,Agent 计费层会被监管。EU AI Act 已经在 8 月 2 日生效,要求 GPAI 提供商和高风险系统保存完整的"训练 + 推理 + 决策日志",这条要求落在企业层面就是把 Agent 的每一次输出都留痕并对得上账本。一旦这条要求扩到中型企业,今天的"按席位订阅"和"按月度账单"都无法满足,只剩"实时计量 + 标准化对账"这一条路。

九、给美辰客户的对照清单:三档行动方案

最后落到美辰服务的"帮企业接 Agent"这条主线,给三档行动方案:

如果你是刚刚开始评估 AI Agent 的中大型企业,先做第 1、5、7 三件事——用量可视化、业务粒度切片、日报对账——三件事一周可以做完,代价是不到两个工程师一周,回报是 CFO 第一次能看懂 Agent 预算。

如果你的 Agent 已经跑在 3 个以上的模型和工具上,做第 2、3、4 三件事——峰谷调度、语义缓存、级联回退——把整体 token 成本压 30% 到 50%,在金融场景落地尤其划算。

如果你的 Agent 已经进入核心生产流程、每天有上千万 token 调用、做 7×24 小时运行,把第 6 件和 8 件合起来——按任务预算 + 应急备份锁价——重点不是省钱,是在供应商故障时业务不受影响。

十、结语:把 AI 当成货币,而不是当成工具

2026 年 8 月这一周告诉我们一件事:当 Stripe 用 80 亿美元买了"按 token 计费的中间层",当 DeepSeek 把电价按小时切分,当 OpenAI 在 4 周内改了两次价格——token 已经不再是"工具的某种消耗",而是"AI 时代的中央货币"。

作为企业,现在要做的不是继续纠结"哪家模型最聪明",而是把 Agent 计费层当成一个新的金融基础设施来建设——用量可视化、业务粒度切片、峰谷调度、缓存复用、对账自动化、应急备用,每一项都是工程问题,但合起来是金融问题。美辰过去一年帮十几家中大型企业把这套基础设施拼起来,真实经验是:做完第 1 和第 5 两件事的 CFO,都把 Agent 采购预算从"试验田"挪到了"正式预算线"——这才是今天 Agent 落地的真正分水岭。