一、写这篇的动机
2026 年 8 月 25 日,铂傲智能把过去 12 天的 6 起 AI Agent 事件压缩成一句话——"Agent 范式从标准化协议层(MCP/Agent Plugins)正式下移到 Harness 执行层"。同周期 OpenAI、DeepSeek、Microsoft、Omarchy、xAI、字节、Hugging Face 几乎同时在 Harness 层发力,这在过去三年里从未出现过。如果把这件事只看做"开源框架又多了一个",你就错过了 2026 下半年企业 AI Agent 落地路径被重写的那一页。
大模型是引擎,Harness 是把引擎变成"真能跑在路上的可控汽车"的工程系统。这是 8/14 DeepSeek Harness(DSH)MIT 开源、5 天 173700 GitHub Stars 后,行业被锤出来的共识。从这一天起,企业聊 Agent 不再是"模型哪家强",而是"你的 Harness 接不接得住生产"。
二、一组反常数据:为什么 8 月不该被低估
把 8/14 到 8/25 的 6 起事件排成一条时间线,看出来的不是"事件多",而是"同一层问题被全行业同时认领":
- 8/14 DeepSeek Harness (DSH) MIT 开源,5 天 173700 GitHub Stars + 17880 Forks,Hacker News 744 分 310 条评论;
- 8/19 OpenAI Codex Harness Apache-2.0 全量开源(github.com/openai/codex),5 天 107443 Stars + 16354 Forks,三层接口(codex exec / Codex SDK / Codex app-server)全开放;
- 8/24-25 Microsoft Agent Lightning v1.0 + v1.0.1 Skill GA,17600 Stars,3500 行核心代码,零代码改造 Agent RL 训练,6000 训练样本把 Qwen3.5-9B SWE-bench Verified 从 41.8% 推到 56.4%(+14.6);
- 8/20 起 Omarchy 4.0(DHH + Dell + Jack Dorsey 等 8 人 Omacom Foundation,800 万美元首轮)把 AI 编程 Agent 写进 Linux 发行版系统层,10 天 1000+ 社区插件;
- 8/22-23 xAI Grok Bot 24/7 自洽云 Agent 上线,接入 SuperGrok Heavy + Cursor Ultra + Cursor Teams;
- 8/23-24 字节 TRAE + Coze 办公线合并入豆包,赵琪统一汇报,飞书 aily 更名"豆包工作伙伴";
- 同期 Hugging Face 聘投行探索 130 亿美元出售,估值从 2023 年 45 亿涨到 130 亿(+189%)。
这 6 件事每一件单看都不算"颠覆",但把它们叠在一张图上看,会发现一个共同指向:Agent 行业的基础设施建设重心,正在从"模型 + 协议"两段式,切换到"模型 + 协议 + Harness + 厂商整合 + 平台收购"五段式。换句话说,过去两年所有人争论的"模型哪家强",已经不是主战场了。
三、为什么是 Harness 这一层突然变热闹
Harness 这个词来自工程语境,字面意思是"马具/挽具"——把马力变成可控牵引力的中间装置。在 Agent 语境里,它指的是模型外面那一整套工程:上下文管理、工具调用编排、记忆与状态持久化、错误恢复、权限治理、可观测性、人类审批回路,以及把上面这些组合成一个"可以长期运行的产品"的运行时(Agent Runtime)。
过去两年为什么 Harness 没被认真讨论?因为行业前两年花在两件事上:一是大模型本身还在快速迭代,所有人押注下一版模型会解决剩下的问题;二是 MCP/A2A 这类协议层刚搭起来,大家忙着"先把工具接入标准化"。结果是:模型能力追得越来越快,但 Agent 一进生产就崩——Stanford 2025 年调研直接说,85% 的企业 Agent 项目死在生产环境前 6 个月,死因 70% 都不是模型,而是 Harness 层不完整。
8/14 开始的 6 起事件,是行业第一次集体把"Harness 层不完整"当作头号问题来回答。OpenAI 直接把 Codex Harness 全栈开源(连 codex exec 这种最底层的非交互 CLI 都给了),DeepSeek 用"Everything is a plugin"哲学把 Harness 拆到 MIT 协议级别让企业可以本地自部署,Microsoft Agent Lightning 用 RL 给 Harness 做训练(零代码改动、6000 样本就能让 Qwen3.5-9B 在 SWE-bench 上涨 14.6 个点),Omarchy 把 Harness 直接写进 Linux 发行版作为系统服务,xAI Grok Bot 用 Harness 把 Agent 推到"永远在线"形态。
四、新范式三轴共振:协议、Harness、厂商整合
铂傲智能 8 月研报把这三轴写得很直白:
协议轴:Google A2A(Agent2Agent)协议在 8 月加入 Agentic AI Foundation,跟 Anthropic 的 MCP 放在同一个中立治理下,150+ 厂商背书,生产环境覆盖供应链、金融、移动平台。MCP 8 月主线报告仓库 modelcontextprotocol/servers 已经 89800+ 星、Python SDK 24100+ 星;MCP-A2A 这对组合把"工具接入"和"Agent 互操作"两件事都标准化了。
Harness 轴:OpenAI Codex Harness(平台化栈)、DeepSeek Harness(插件化栈)、Microsoft Agent Lightning(训练化栈)、Omarchy(系统化栈)、xAI Grok Bot(自洽化栈)五个方向同时被做。这五个方向不互相冲突,而是分别瞄准 Harness 层的五个不同维度——接口稳定性、可扩展性、可训练性、可系统化部署、长时在线能力。
厂商整合轴:字节 TRAE + Coze 入豆包是中国互联网巨头第一次把 Agent 产品线全量合并;Hugging Face 130 亿美元出售谈判是"AI 中间层平台被收编"的早期信号。这两件事单独看是商业新闻,叠在 Harness 主线看意味着:Agent 厂商正在把"Harness + 模型 + 协议 + 应用"打包成整套对外交付能力,小厂商独立生存的空间被快速压缩。
三轴共振的结果是:Agent 行业第一次出现了"标准化输入 + 模块化中间件 + 整合化输出"的清晰分层结构。MCP/A2A 是输入层,Harness 是中间件,豆包/Hugging Face 这类平台是输出层。
五、Agent = Model + Harness:一个新公式的诞生
8/25 这一天行业里被引用最多的一句话,是 AI Disruption 8/24 文章里的总结:"Agent = Model + Harness,大模型是引擎,Harness 是把引擎变成可控汽车的工程系统。"
这个公式值得被记住,因为它重写了 Agent 工程师的工作清单。以前一个 Agent 团队的工作清单大概是:选模型 → 写提示词 → 接 API → 上线。现在的工作清单变成了:选模型 → 选/搭 Harness → 接 MCP/A2A → 配置 Harness 的工具/记忆/上下文 → 跑 Agent Lightning 这类工具做 Harness 训练 → 把 Harness 包成产品接口 → 接入可观测性 → 上线。
注意第二张清单里,"写提示词"已经从第一项变成第四项甚至第五项——提示词工程的优先级被 Harness 工程显著降级了。Microsoft Agent Lightning 的 6000 样本案例就是这个判断的硬证据:同样的 Qwen3.5-9B 模型,不重写提示词,只训练 Harness,就能在 SWE-bench 上从 41.8% 涨到 56.4%。这说明 Agent 能力的瓶颈大量分布在 Harness,而不是分布在大模型本身。
对企业的直接含义是:不要再花预算去"换更聪明的模型",先盘点一下自己的 Harness 是不是完整的。一个完整的 Harness 至少包含工具调度、上下文管理、记忆持久化、错误恢复、权限治理、可观测性、人类审批回路这七块。少任何一块,Agent 进生产都会出问题。
六、美辰视角:为什么 Harness 工程是"帮企业接 Agent"真正的活
美辰在过去两年服务企业落地的过程中,反复撞到同一类问题:客户的 Agent 跑通了 demo,业务也说有用,但只要一进生产,就出现三类典型崩溃——
第一类:工具调用跑飞。Agent 在 demo 里有 5 个工具,生产里接了 50 个,模型开始乱调工具,出现"循环调同一个工具""跳过必要的前置工具直接跳到后果工具"等行为。这种问题 90% 不是模型问题,是 Harness 的工具调度层没做约束。
第二类:上下文超长崩溃。Agent 跑了几十轮对话,上下文膨胀到几十万 token,模型开始遗忘前文指令,出现"前 5 轮我说要 X,后 5 轮它开始按 Y 干"。这种问题 90% 是 Harness 的上下文管理没做(没压缩、没摘要、没滚动窗口)。
第三类:失败无法恢复。Agent 在生产里调外部 API 失败、数据库连接超时、第三方服务 5xx,模型不知道下一步该做什么,卡死或乱回。这种问题 90% 是 Harness 的错误恢复机制没设计。
这三类崩溃在 demo 阶段几乎不会出现,因为 demo 时人盯着。但生产环境是无人值守,容错能力是生存能力。OpenAI Codex Harness 的 codex exec 三层接口、Microsoft Agent Lightning 的零代码 RL 训练、Omarchy 的系统级 Agent 服务,本质上都是在回答"如何让 Agent 在无人值守的生产环境里不崩"。
美辰把"Harness 工程"作为 2026 下半年的核心交付能力,核心就是帮企业把这七块补齐——按客户业务挑合适的 Harness 框架、按场景配 MCP/A2A 协议、按 SLA 设计可观测性和恢复回路、按合规要求嵌入人类审批。
七、Opus 4.6 把 Anthropic 推到 70% Agent 任务覆盖:另一条 Harness 主线
除了上面提到的 6 起事件,8 月还有一条容易被忽略但重要的线:Anthropic 8/22 发布 Opus 4.6,内部测显示在 Agent 类任务(长链软件工程、复杂工具编排、跨工具调用规划)上覆盖度达到 70%。Claude Code 2.1.237 也在这周期更新。这说明模型层并没有停滞,只是 Harness 主线把聚光灯抢走了。模型层和 Harness 层是在同步进化的,不是互斥的。
企业 Agent 落地的下一步规划应该是双线并行:模型层用 Opus 4.6、GPT-5.6 Luna、Gemini 3.7 Flash 这一档;Harness 层用 Codex Harness / DSH / Agent Lightning / Omarchy 这一档。两层选型完成后,剩下的工程量是配置,不是从零开发。
八、企业 Agent 落地的 7 步 Harness 清单
把上面所有判断压缩成一张今天就能开干的清单:
- 盘点现有 Harness 七块:工具调度 / 上下文管理 / 记忆持久化 / 错误恢复 / 权限治理 / 可观测性 / 人类审批。缺哪块先补哪块,不要"模型一升级就期待自动化解决"。
- 协议接入统一到 MCP + A2A:MCP 接工具和资源,A2A 接 Agent 间协作。这对组合是 8 月 Agentic AI Foundation 给出的事实标准。
- 选 Harness 框架做基座:OpenAI Codex Harness(平台化栈,适合全栈接入)、DeepSeek Harness(插件化栈,适合自部署)、Microsoft Agent Lightning(训练化栈,适合长期迭代)、Omarchy(系统化栈,适合自托管 Linux 环境)。
- 用 Agent Lightning 这类工具训练 Harness:不再靠人工调提示词,直接用 RL 在生产数据上训 Harness。Microsoft 的案例是 6000 样本 +14.6 SWE-bench。
- 可观测性先于功能:所有工具调用、所有上下文变化、所有错误都要 trace。Datadog 8 月推出的 Agent Observability 产品线就是这个方向。
- 人类审批回路嵌入 Harness:高风险操作(写数据库、发对外消息、调支付)必须有审批节点。Microsoft Agent Lightning v1.0.1 Skill 把这点内建进了框架。
- Harness 治理优先级高于模型治理:模型治理是"换版本",Harness 治理是"换工程模式",后者决定了 Agent 能不能在生产里待下去。
九、给企业决策者的一句话
过去两年,Agent 行业的所有问题都被推到"模型不够好"这一个篮子里。8 月 12 天的 6 起事件,加上 Microsoft Agent Lightning 6000 样本 +14.6 SWE-bench 的硬数据,已经把那个篮子捅破了。模型不是瓶颈,Harness 才是。
如果你的 Agent 项目卡在生产里 6 个月以上,先别换模型,先把 Harness 七块补上,大概率会有立竿见影的改善。这件事不需要等新模型发布,今天就能开干——这也是美辰为什么把 Harness 工程作为核心交付能力的根本原因。
美辰做的事情很简单:帮企业把 Harness 七块补齐、把 Harness 训练搭起来、把 Harness 治理做透,然后让 Agent 真的能在无人值守的生产环境里跑下去。"帮企业接 Agent"这句话,在 2026 下半年的具体含义,就是帮企业把 Harness 工程做扎实。
十、结尾与三个预测
预测 1:未来 6 个月内,大厂会陆续发布自己的"Agent Runtime/Harness"商业版。OpenAI 已经有了 Codex Harness 的商业订阅,Anthropic 在 Claude Code 2.x 里加入 Harness 概念只是时间问题,Google 大概率会把 A2A 与 Gemini Enterprise 打包成 Harness 套件。
预测 2:Agent 中间层平台(Hugging Face 这种)会被收购整合。Hugging Face 130 亿的谈判只是开始,Lamini、Cohere、Mistral 这些平台型公司,在 2026 年底之前要么被收,要么被边缘化。中间层平台的"中立"价值,在 Harness 主线确立之后,会被重新定价。
预测 3:企业 Agent 落地会从"模型选型驱动"切换到"Harness 选型驱动"。选型清单会从"哪家模型最准"变成"哪家 Harness 七块最完整、可观测性最细、训练闭环最短"。美辰已经在和客户讨论"Harness 健康度评估",这个评估会替代过去两年的"模型成熟度评估",成为企业 Agent 项目立项的第一道门槛。
最后一句话总结:2026 年 8 月 12 天 6 起事件,共同回答的不是"Agent 会不会取代人",而是"Agent 进生产还需要补什么"。答案是:Harness。模型是引擎,Harness 是把引擎变成汽车的工程系统。这件事,从 2026 年下半年起,会变成所有企业 Agent 项目立项、选型、验收的共同语言。
美辰的工作,就是和客户一起,把这件事做扎实。
关键词:AI Agent、Harness 工程、Codex Harness、DeepSeek Harness DSH、Microsoft Agent Lightning、Omarchy AI OS、xAI Grok Bot、字节豆包、Hugging Face 收购、MCP 协议、A2A 协议、Agentic AI Foundation、Agent Runtime、企业 Agent 落地、模型到 Harness 下移
