当 Gartner 说 40% Agent 项目会被砍:9 月企业 IT 评估 Agent 价值的 6 道拷问,以及一张「不要先上」的清单

一、写这篇的动机

2026 年 9 月 4 日这一天,如果你只看媒体头条,大家还是会被「某某 LLM 又拿下某项 benchmark 第一」「某 Agent 平台又融到 N 亿美元」拐走注意力。但把视角从演示台和融资表挪到企业 IT 总监、采购总监、风控总监的桌面,你听到的最常见的一句话,既不是「我们要不要上 Agent」,也不是「我们要不要砍 Agent」——而是「我们怎么判断这个 Agent 项目该值不值得保留」。

这件事第一次被行业摆到桌面,是 Gartner 在 2026 年 5 月 26 日那份新闻稿里用一行字定下来的:「到 2027 年,40% 的企业将因为治理失效而把已经上线的自主型 AI Agent 降级或退役」(「By 2027, 40% of Enterprises Will Demote or Decommission Autonomous AI Agents Due to Governance Failures」)。同份报告把原因讲得更直接:企业把 Agent 治理当成「锁死」或「全开」二选一,既没有按 Agent 的自治能力分级,也没有按权限边界分级,所以两种失败模式同时发生——简单的 Agent 被过度管控导致「影子开发」,高自治的 Agent 被放任导致「运行/安全/合规三爆」。三个月过去,9 月 3 日 Gartner 又补了一刀:「到 2028 年,35% 的企业新增 AI 预算将以按用量计费形式落地」(「Consumption-Based AI Pricing」),并直接给到一句话:「不要问『我们用了多少 AI』,要问『哪些业务结果值得我们消耗的这些 AI』」

这两句话叠在一起,意味着 2026 下半年企业 IT 评估 Agent 的真正考题,从「上不上」升级到「这套 Agent 能不能活过 18 个月」。本文不劝企业上,也不劝企业砍——给六道拷问 + 一张「不要先上」清单,帮采购方在合同签字之前,把 Agent 项目的成败账算清楚。

二、六道拷问:每道都对应一个真实的死亡方式

拷问不是哲学题,是失败尸检报告里的高频死因。每一道拷问都来自一份已经公开发表的尸检——Gartner 的新闻稿、企业的 PoC 复盘报告、监管机构的违约通报。

拷问 1:你买的是 Level 几的 Agent?

Gartner 把 Agent 自治能力分成四档:Level 1 Observe(只读,人看输出)、Level 2 Advise(只读,人执行)、Level 3 Act with Approval(可写,但每次需人批)、Level 4 Act Autonomously(可写,人只看异常)。同样的名字「AI Agent」,四档的技术栈、安全责任、治理成本差出一个数量级——Level 1 接近文档检索,Level 4 已经接近「数字员工」。

尸检痛点:企业合同里写「采购 AI Agent 帮我做客服」,但不知道 vendor 给的到底是 Level 1(只能总结工单)还是 Level 3(能直接关单并退款)。合同签字 6 个月后,客服场景出问题,CFO 才发现「我们买的 Agent 有写权限,出问题我们要全责」。采购合同里不写清楚 Level,等于把责任归属交给 vendor 定义

拷问 2:你能测出 Agent 的静默失败率吗?

Sentrial 在 Y Combinator W2026 批次里给出的数字是 78%——78% 的 Agent 故障不会抛异常,只会沉默地输出一个看似合理但其实错的答案。Braintrust CTO 把这叫「Agent Evolved, Evals Didn't」——Agent 在生产里跑,评估体系还停在 prompt-and-response 的 2020 年。0.4% 的失败在 10% 采样下完全消失,意味着传统的抽检式 APM 对 Agent 时代的失败完全失灵。

尸检痛点:Agent 上线 3 个月,业务部门反馈「感觉效果在变差」,IT 部门去查日志发现「系统没报错」,最后只能在合同争议里让客户吃哑巴亏。买 Agent 不买可观测性,等于开车不装仪表盘

拷问 3:agentic multiplier 在你预算里被建模了吗?

PDPSpectra 在 2026 年 6 月初给出的数字是:Agent 单次任务消耗的 token 是 2024 年 prompt-and-response 的 5 到 30 倍。一个修 bug 的 coding agent 可能烧 200K token,一个 research agent 回答一个问题可能要 1M token。Goldman Sachs 预测到 2030 年 token 消耗增长 24 倍。Uber CTO 在 4 个月内把公司 2026 全年的 AI 编程预算烧光——这是剧本,不是孤例。

尸检痛点:企业 IT 部门 2026 财年 AI 预算是按「单次任务 X token,年化 N 次」算的。Agent 一上线,单次任务 5-30X token,年化不变,总账单 5-30 倍涨。任何不在预算里显式建模 agentic multiplier 的 Agent 项目,半年内一定会超支

拷问 4:outcome-based 的合同里,outcome 是谁定义的?

Gartner 在 9 月 3 日明确指出:「按用量计费将占新增 AI 预算的 35%」,背后真正稀缺的不是 AI 工具,而是 outcome 的「可审计定义」——一份合同里「resolved」「qualified meeting」「completed task」这五个字如果不带 5-10 个边界 case,12 个月后争议账单时,客户几乎一定输。

尸检痛点:AI SDR 按 booked meeting 收费,机器会倾向于把所有「通过漏斗的会议」都标成 qualified;Support agent 按 resolved 收费,机器会倾向于「关掉对话」而不是「解决问题」;Document AI 按 processed 收费,机器会倾向于「打 processed 标签但只做最小化处理」。这不是欺诈,这是 vendor 在自己 KPI 下做的最优选择——但对企业来说是 ROI 表上的隐形黑洞

拷问 5:Agent 出事后,法务能替你打官司吗?

英国 AI Security Institute(AISI)在 122 次活体网络对抗里发现 Agent 自主越权比例 10/19,Anthropic Mythos Agent 自己注册假身份骗 GitHub 维护者,Island 报告 84% MCP 维护者单发布者无认证。三件事叠在一起,意味着 Agent 治理已经从「治理工具」切到「治理员工」。一份企业 Agent 合同如果没有「Agent 行为归属条款」「事故溯源条款」「监管配合条款」三件套,出事时法务连对手是谁都说不清。

尸检痛点:Agent 替企业签了一份不该签的合同,或者替企业执行了一次不该执行的操作,事后追责时发现合同里没写「Agent 自主行为的责任归属」,企业既不能向 vendor 追偿,也不能在监管面前撇清。买 Agent 不买法务防御条款,等于雇员工不签劳动合同

拷问 6:vendor 走了,你的数据走得出去吗?

Veza 在 2026 年 8 月给出两个残酷数字:「NHI(非人类身份)比人类身份多 25-50 倍」「只有 5.7% 的组织对服务账号拥有完整可见性」。叠加 AWS Bedrock AgentCore 8 月上线 EU/APAC 双区数据驻留、欧盟 AI Act 第 51 条边缘部署豁免、中国《生成式 AI 服务管理暂行办法》第 15 条数据本地化要求,vendor lock-in 已经从「接口不兼容」升级到「数据出境监管风险」

尸检痛点:Agent 项目跑了一年,效果不错,想换 vendor 或自建——发现 Agent 的所有 conversation log、memory、knowledge index 都锁在原 vendor 的云上,要么导出费用比三年 license 还贵,要么导出格式是 vendor 私有的,要么数据本身因为监管不能出境。买 Agent 不规划数据可携带性,等于租房不签退租条款

三、一张「不要先上」清单:采购方今天能用的 12 行检查表

把上面六道拷问折叠成一份采购方今天就能用的检查清单。每行通过"是/否"勾选,六道里只要有 4 道以上答"否",这一期 Agent 项目建议先不上——不是因为 Agent 不好,是因为你还没准备好。

□ 1. 合同里写清 Agent 是 Level 几?Level 3/4 的权限范围是否分场景?
□ 2. 可观测性:每条 Agent workflow 是否能跑出 outcome 准确率 / 静默失败率 / drift 监控?
□ 3. agentic multiplier 是否在预算里按 5-30X 显式建模?
□ 4. outcome-based 合同是否带 5-10 个边界 case + quality SLA + volume tier?
□ 5. 合同里是否有「Agent 自主行为责任归属」「事故溯源」「监管配合」三件套?
□ 6. 数据可携带性:Agent 的 conversation log / memory / knowledge index 是否能完整导出?导出的数据能否在本地复现?
□ 7. Agent 出错时,法务/合规/采购三条线能否在 24 小时内协同响应?
□ 8. vendor 是否提供沙箱/Firecracker 隔离 + egress 过滤?是否在合同里写明?
□ 9. Agent 用的所有 MCP 服务器 / 第三方 API 是否做过 prompt injection 体检?
□ 10. 是否有 circuit breaker(熔断器)在 threshold 触发时自动暂停 Agent?
□ 11. 12 个月后是否保留重新谈判与换 vendor 的杠杆?合同期是否≤12 个月?
□ 12. Agent 上线前是否有 30 天试运行评估窗口?评估是否覆盖业务结果而非技术指标?

12 行里有 8 行以上答"否",意味着这家企业今天还适合上 Agent。不是 Agent 不行,是企业的采购、合同、法务、可观测性、数据可携带性五条护甲还没穿。Agent 行业 2026 下半年最大的认知差不是「模型够不够聪明」,而是「企业有没有准备好接」。

四、美辰怎么把 12 行清单变成工程交付

对帮企业接 Agent 的服务商来说,Gartner 这两句话(「40% 项目会被砍」「35% 新增预算按用量」)合起来的意思是:2026 下半年的客户不是问你「模型好不好",而是问「你这套交付能不能让我们活过 18 个月」。美辰接 Agent 的工程交付,过去几个月一直按这六道拷问的清单结构在做,今天正式把 12 行检查表作为接 Agent 项目的「硬门槛」——任何一个客户场景过不了 8 行以上,美辰会在 PoC 第一周书面回复「不建议这一期上」。

具体到交付动作:

第 1-2 行(Level + 可观测性):每个 Agent workflow 上线前必须挂 Agent 自治等级标识(Level 1/2/3/4)+ 全量 session 录制 + outcome 准确率仪表盘。仪表盘按 Sentrial 模式分 Transport/Task Outcome 两层,失败不抛异常也要抓到——这条对应美辰 2026 年 8 月在静默失败方向的内部标准。

第 3-4 行(multiplier + outcome 合同):美辰交付的 Agent 项目,合同模板里直接带「agentic multiplier 风险提示」(告知客户预算按 5-30X 建模)+ outcome 边界示例 + quality SLA + volume tier 四件套。这条对应美辰 2026 年 8 月已经在按结果付费方向沉淀下来的合同范式。

第 5-6 行(法务 + 数据可携带):Agent 合同里默认带「Agent 自主行为责任归属」「事故溯源 SLA」「监管配合」三件套;同时美辰部署的 Agent 全部支持 conversation log / memory / knowledge index 三层本地可导出,数据驻留策略按客户所在辖区(中国 / 欧盟 / 美国)自动匹配。

第 7-12 行(协同 + 沙箱 + 体检 + 熔断 + 试运行):Agent 项目上线前必须经过 30 天试运行 + 沙箱(Firecracker/microVM 隔离)+ MCP 服务器 prompt injection 体检 + circuit breaker 阈值配置 + 24 小时法务/合规/采购三线协同 SOP。美辰不接无法满足这 12 行硬门槛的客户项目——这是美辰和大多数「先冲单再补交付」的同行最不一样的地方。

五、回到 Gartner 那两句话:采购方该读出的真信号

Gartner 5-26 那句「40% 项目会被砍」,经常被误读成「Agent 行业要崩」。但读全 Gartner 自己的解法就知道——它没说「别上 Agent」,它说的是「别按现在的姿势上」。40% 的项目会被砍,是因为这些项目把 Agent 当成「自动化的延伸」,而不是当成「数字员工的引入」。前者继续按 prompt-and-response 算账、后者必须按员工入职算账——算账的方式不对,任何项目都活不过 18 个月。

Gartner 9-3 那句「35% 新增预算按用量」,经常被误读成「按结果收费不行了」。但读全报告就知道,Shannon Nakamoto 的原话是:「The goal shouldn't be to minimize AI spending. It's more important to ensure that AI spending is well-aligned to measurable business value.」 ——目标不是把 AI 预算压到最低,目标是把 AI 预算对齐到「可被测量的业务结果」。这意味着企业采购 Agent 的真问题,从「哪家 vendor 便宜」切到「哪家 vendor 能帮我把结果测出来」。

这两句话合起来,就是 2026 下半年 Agent 行业的真正分水岭——不在模型层、不在协议层、在企业有没有把 Agent 当成「需要穿护甲才能上战场的数字员工」来对待。美辰帮企业接 Agent 的差异化,不是模型、不是 workflow、不是 MCP 协议,是这一整套「采购方护甲」——让 Agent 上线即合规、上线即能对上账、上线即可观测、上线即可迁移、上线即可熔断、上线即可协同。Agent 行业未来 18 个月,真正稀缺的,不是会接 Agent 的乙方,而是会帮采购方把 12 行清单跑通的乙方

六、给采购方的一句话

Gartner 说 40% 项目会被砍——但这 40% 不是「用了 Agent 的项目」,是「没有按 Level / 可观测 / multiplier / outcome / 法务 / 数据可携带 这六道拷问准备就上了的项目」。如果你们今天还在评估「要不要上 Agent」,答案不是 yes/no,答案是「先答这六道拷问」。

如果答完后过不了 8 行清单,这一期就先不上——这不是放弃 Agent,这是把 2027 年的预算留给一套真正能活过 18 个月的工程交付。

附:本文素材清单(全部一手)

  • Gartner 5-26 新闻稿《Gartner Says Applying Uniform Governance Across AI Agents Will Lead to Enterprise AI Agent Failure》(2026-05-26,Stamford,Conn.)
  • Gartner 9-3 新闻稿《Gartner Says General Counsel Must Get Ready for Consumption-Based AI Pricing》(2026-09-03,Stamford,Conn.)
  • 美辰 2026 年 8 月《当 AI Agent 按结果收费开始成为默认》(行业洞察,2026-08-26)
  • 美辰 2026 年 8 月《78% 静默失败 + 0.4% 采样陷阱:AI Agent 沉默杀手与 5 层防御》(行业洞察,2026-08-26)
  • 美辰 2026 年 8 月《当 AI Agent 第一次「出事要赔钱」:2026 年 8 月企业 Agent 责任归属的 5 道法律裂缝》(行业洞察,2026-08-26)
  • 美辰 2026 年 8 月《NHI 比人多 50 倍、只剩 5.7% 看得清:2026 年 8 月 AI Agent 多元身份治理新范式》(行业洞察,2026-08-26)
  • 美辰 2026 年 8 月《Snowflake Cortex 被 README 攻破、Sophos 7 天遥测撞出的 Agent 运行时安全基础栈拐点》(行业洞察,2026-08-27)