一、写这篇的动机
2026 年 8 月这一周,如果只看新闻头条,大家会以为企业 AI Agent 的卡点是模型不够聪明——Claude Opus 4.6 又把 SWE-Bench 推到 74.5%,Gemini 2.5 Pro 在 LMArena 又拿第一。但把视角从演示台移到生产机房,真相完全不同:2026 年 4 月一篇被业界反复引用的生产指南给出一个相当不吉利的数字——只有 9 分之 1 的企业 Agent 测试项目真正跑到了生产。换句话说,不是模型答得不对,而是 Agent 在生产里"做着做着就忘了自己在做什么",或者"做着做着成本爆表"。把这件事拆开,罪魁祸首十有八九不是模型本身,而是被严重低估的一道工程环节:上下文工程(Context Engineering)——也就是"喂什么给模型、以什么顺序、多久清一次、关键信息钉在哪里"这一整套。
2026 年 8 月恰好是上下文工程第一次从"边缘技巧"升格为"基础设施"的拐点:Microsoft Research 把 ACON(Agent Context Optimization)论文投进了 ICML 2026,在 AppWorld、OfficeBench、Multi-objective QA 三个长程任务上把峰值 token 用量压掉了 26–54%,并让小模型在长任务里获得了最多 46% 的性能提升;NVIDIA 把 KVpress 上 20 多个 KV-cache 压缩方法统一到一张排行榜,Google 在 3 月放出训练无关的 TurboQuant 把 KV-cache 内存砍 6 倍、注意力计算提速 8 倍;与此同时,Anthropic、OpenAI 都把 compaction API 写进了官方 SDK,Letta(原 MemGPT)、Observational Memory 等外部记忆架构正式进入生产案例库。这一切叠在一起意味着,2026 年下半年任何一家还在用"把全部历史塞进窗口"的 Agent 项目,都已经在结构上落后了。
更深一层的问题不是"省 token",而是"上下文腐烂"(context rot)——Chroma 对 18 个模型做的实证研究指出,几乎每一个 LLM 在长上下文里都会出现注意力扩散(attention diffusion)、近因偏差(recency bias)和"中间遗忘"(lost-in-the-middle)三种症状,而且这是一个跟窗口大小无关的退化规律:上下文越长,模型越分不清信号和噪声。RULER 基准对这件事给出过非常硬的数字——Gemini 1.5 Pro 从 4K 涨到 128K 只掉 2.3 分,GPT-4 掉 15.4 分,Llama 3.1-70B 掉 29.9 分,Mixtral-8x22B 掉 63.9 分。也就是说,"我换了个 1M 窗口的模型"这件事在生产里很可能让 Agent 表现更差而不是更好。
对企业落地而言,这件事最危险的地方在于它是"沉默失败"——Agent 不会报错,只会安静地越做越错、越做越贵。等到月底账单来的时候,大部分团队才会意识到:70% 的 token 都花在了"重复读历史 + 不必要地携带旧工具输出"上。Agent 落地三件事:模型选型、工具集成、可观测性,前两件已经被讲过太多遍了;第三件事目前主流叙事仍然停留在"接 Datadog / New Relic",而真正决定 Agent 在生产能不能跑超过 30 分钟的,是上下文工程这一层。
所以这一篇要把上下文工程这件事系统讲一遍:从为什么会腐烂,到 KV 缓存层、上下文层、外部记忆层三层各有什么生产级打法,再到今天就能落地的 7 层工程清单,最后落在美辰怎么帮企业把这套体系接进 Agent 项目里。
