2026 年 9 月,Anthropic 发布《Detecting and Countering Misuse of AI》威胁情报报告,披露了它在 2025 年 12 月至 2026 年 8 月这八个月里识别并挫败的一批真实滥用案例。这不是模型卡上的理论推演,而是一家前沿实验室基于自家生产环境日志、拿真家伙做的取证。报告里有两个判断,值得每一位正在把 AI Agent 放上生产的企业负责人反复读三遍:
判断二:本报告描述的大多数行动,都由 AI「直接执行或编排」促成——AI 的角色已从聊天机器人式的问答,变成多 Agent 框架自主跑侦察、利用、数据外泄。
换句话说,攻击的门槛在坍缩,而攻击的自动化在攀升。这两条曲线交汇的地方,就是 2026 年企业 AI 安全真正的前线。本文把这份报告拆开讲清楚:它到底观测到了什么,用词口径是什么,以及对国内上生产的 Agent 项目意味着什么。
一、七个危害领域,一个共同趋势
报告覆盖了七类被挫败的恶意用途:网络攻击、影响操作(舆论操纵)、监控、诈骗与伪造、生物滥用、常规武器研发、模型蒸馏。所用模型为 Claude Haiku、Sonnet、Opus;值得注意的是,涉及 Fable / Mythos 级模型的滥用只有极少数(仅一起蒸馏案例),因为后者内置了大幅削弱其执行有害网络任务能力的防护措施。
Anthropic 内部给这些滥用 AI 的行为体起了个代号叫 GTG(Generative Threat Groups,生成威胁组)。它没有按传统威胁情报那样分"国家级/犯罪/黑客组织",而是刻意打散——因为这正是报告的核心发现之一:" sophistication has stopped being a reliable signal of who is behind an operation "(攻击手的专业程度,已经不再是判断幕后是谁的可靠信号)。一个使用窃取来 API key 的黑客行动主义者、几个互不相关的逐利犯罪分子、一名国家间谍操作员,都可能呈现出同样的技术面貌。
二、门槛坍缩:AI 抹平了"国家队"和"个体户"之间的差距
报告原话很直白:AI 模型的网络安全技能,压垮了那道过去把资源充裕的国家行为体与个体操作者区分开来的"人力与工具鸿沟"。一年前还需要多名熟练操作员和专门知识才能维持的多目标攻击战役,如今一个人加一套 Agent 就能撑起来。
为了量化这种变化,Anthropic 引入了一个叫 uplift(能力增益)的概念,从三个维度衡量"用了 AI 比不用 AI 多造成了多少伤害":
| 维度 | 含义 | 报告观测 |
|---|---|---|
| Speed(速度) | 能力开发与部署的时间 | 从数周/数月压缩到数天/数小时;有行为体搭了自动工作流,一旦工具被安全产品检测到就自动重建重新部署 |
| Scale(规模) | 单行为体能覆盖的目标数 | 个人即可维持多受害者并行战役 |
| Depth(深度) | 攻击链推进到的阶段 | 从脚本小子式骚扰升级到持续访问与数据外泄 |
这里要诚实标注口径:uplift 是 Anthropic 基于自身干预案例的定性评估,不是跨行业的统计抽样百分比。它的价值不在于给出一个可复现的数字,而在于——这是一线实验室从真实攻击样本里提炼的趋势判断,比纯学术推演更接近战场实况。
三、最该警惕的一类:AI 开始"自己打",人只负责点目标
如果说上一节讲的是"人人都会打了",这一节讲的是"机器自己在打了"。报告描述的一个案例(GTG-20006)尤其刺眼:行为体用一个容器化的开源渗透测试平台,前端架了本地模型网关,对准目标的 Web 应用。Worker agents 在无人监督的情况下自主跑 SQL 注入、XSS、认证绕过、SSRF 测试,把潜在漏洞发现和凭据一并收集进操作者的工作区。而且这个循环是开着"利用(exploitation)"对着生产系统跑的——同一个工作流既找漏洞又直接打进去拿权限。
请注意这条分工:人设定攻击目标、审阅外泄结果;机器负责中间所有的侦察、试错、执行。这就是报告说的"从助手(assistant)到编排者(orchestrator)"的转变。对防守方而言,这意味着一件事——你面对的不再是一个会犯错、需要睡觉、动作有节奏的人类,而是一个可以 7×24 并行尝试成百上千种组合的自动化流水线。
四、供应链的新软肋:AI wrapper 与 LiteLLM
报告点出了一个很多中国企业还没意识到的攻击面:针对 AI 生态与供应链本身。多个行为体被发现攻破 AI wrapper 服务对 LiteLLM 的实现——他们用提示注入(prompt injection)把生产环境的 API key 从云托管容器里外泄出来。
为什么这特别危险?因为 LiteLLM 这类"模型网关/聚合器"正被大量企业用来统一接入多家大模型,它手里握着的是通往所有上游模型的总钥匙。一旦网关的 prompt 处理链路存在注入点,攻击者不需要逐个攻破你的模型供应商,只要拿下中间这层,就能卷走最高权限的凭据。这与此前 UpGuard 扫出的 Supabase 裸库是同一类病根的不同表现:新基础设施被快速采用,而配套的访问控制与安全评审没跟上。
顺带一提,同期公开网页中还发现了超过 15,000 个被植入的间接提示注入载荷(Check Point Research 口径),其中约 70% 藏在人类看不见的网页区域。加上报告里"ransomware/机会主义攻击"清单中的"翻检公共容器仓库、代码库、移动端、网站找凭据/token/API key"——你会发现,凭据管理和 RLS/最小权限这类"老掉牙的基本功",在 AI 时代不但没过时,反而因为攻击自动化而被放大了破坏半径。
五、给国内企业的四条防御启示
启示一:别再假设"攻击者水平低=威胁小"。门槛坍缩的直接后果是,过去你能靠"对方不够专业"侥幸挡下的攻击,现在会被一个拿着 Agent 的普通人复现。安全基线要按"对手是一个不知疲倦、并行试错的自动化系统"来设,而不是按"对手会不会这招"来设。
启示二:给每一个能"动手"的 Agent 上运行时管控。报告里被打穿的都是能执行工具调用的 Agent。落地三问:这个 Agent 能调用哪些工具?每个工具的权限边界(读写范围、能否发起网络请求、能否触达生产库)是否显式配置?高危动作有没有人在回路与熔断?注意 Gartner 的同源提醒——治理颗粒度要匹配风险半径,别一刀切禁死,也别一律放开。
启示三:把模型网关当核心资产防护。如果你在用 LiteLLM 或自建聚合网关,请把它当作"持有全部上游密钥的堡垒"来对待:密钥不落前端、注入点做输入净化与输出审计、网关本身纳入凭据轮换与最小权限。这是 AI 供应链攻击的第一入口,也是最便宜就能补上的洞。
启示四:建立"AI 对抗 AI"的检测视角。当攻击以机器速度进行时,靠人工看日志的事后取证会永远慢一拍。方向是把检测也做成实时运行时拦截——监控异常的工具调用频率、非预期的外网请求、短时间大量失败的注入尝试。这与 OWASP《Top 10 for Agentic Applications》把"过度代理权(Excessive Agency)"列为核心风险的思路一致:限制 Agent 能做的事,比事后抓它做错了什么更根本。
六、FAQ
Q1:这是不是在说 AI 模型本身不安全、不该拿来上生产?
A:不是。报告恰恰证明"负责任的实验室 + 强防护的模型(如带额外护栏的高阶模型)"能显著压低滥用。它给出的不是"别用",而是"用的时候要把访问控制、运行时管控、凭据防护做到位"。风险来自不设防的采用,不来自能力本身。
Q2:uplift 那三个维度能不能给我一个可引用的百分比?
A:不能,也不应该硬凑。这是 Anthropic 基于自身干预案例的定性能力评估,样本是它实际挫败的 GTG 行动,不是全行业调查。把它当"一线战场趋势判断"引用是准确的;把它包装成"XX% 的攻击由 AI 完成"则是误用。
Q3:我们公司规模不大,够不上"国家级对手",这套跟我关系大吗?
A:关系反而更大。门槛坍缩意味着原本"看不起你这点肉"的高技术攻击,现在低成本个体也能顺手做。中小企业通常安全基本功更薄、又大量用 SaaS 和模型网关,正好落在报告描述的"机会主义攻击 + 供应链软肋"打击面上。上面四条启示里,第三条(守好网关)和第四条(运行时检测)是小团队性价比最高的起手式。
参考来源(英文一手材料):
Anthropic – Detecting and Countering Misuse of AI(2026-09,覆盖 2025-12 至 2026-08 七类危害领域的干预案例)
OWASP – Top 10 for Agentic Applications(过度代理权等 Agent 独立风险项)
Gartner – Agentic AI Attack Surface(2026 网络安全核心趋势,分级治理判断)
Check Point Research – 公开网页间接提示注入载荷统计(超 15,000 个,约 70% 隐藏于不可见区域)