2025 年 5 月 22 日至 23 日,Anthropic 连续两天发布两款 Claude 4 系列模型——Claude Opus 4 与 Claude Sonnet 4。这两款模型首次把"混合推理(Hybrid Reasoning)""扩展思考(Extended Thinking)""并行工具调用(Parallel Tool Use)"作为默认能力交付给所有用户,并同步上线 Computer Use 与 Claude Code 两项企业级功能,标志着代理式 AI(Agentic AI)从演示阶段正式进入企业生产环境。
混合推理:一个模型两种模式
Claude Opus 4 与 Sonnet 4 都采用了混合推理架构。模型既能像传统大模型一样以秒级速度响应短问题,也能在遇到复杂任务时切换到"扩展思考模式",用更长的内部推理链路换取更高准确率。官方技术报告强调,这种切换不依赖外部 Agent 框架,而是模型自身在权重层面学会的策略——也就是所谓的"原生推理"。
对开发者而言,这意味着不需要为同一个应用维护两套模型:同一个 API 调用,加一个参数(比如 thinking=true)就能让模型进入慢思考路径。返回结果中还会附带"思考摘要(Thinking Summary)",让用户能直观看到模型在思考链路中尝试了哪些路径,而不只是一个黑盒答案。这种透明度对企业审计、可解释性要求极高的金融与法律场景意义重大。
扩展思考还支持"带工具的扩展思考(Extended Thinking with Tool Use, Beta)"——模型在推理过程中可以调用外部工具,例如实时联网搜索、查数据库、调用公司内部 API。这让模型的推理过程不再只是"内部独白",而是能与真实世界数据实时交叉验证,显著降低幻觉与陈旧信息带来的风险。
基准成绩:SWE-bench 领先,Terminal-bench 拉开差距
在 Anthropic 官方公布的基准对比中,Claude Opus 4 在 SWE-bench Verified(真实 GitHub Issue 修复)上拿到 72.5%,Terminal-bench(命令行场景代理)上拿到 43.2%,两项指标均刷新当时业界纪录。同为 Claude 4 系列的 Sonnet 4 在 SWE-bench Verified 上拿到 72.7%,Agentic Coding 综合得分 80.2%(高计算设置),显示其与 Opus 4 的差距正在缩小。
其它基准上,Opus 4 在 GPQA Diamond(研究生级推理)上拿到 79.6%、TAU-bench Retail 81.4%、TAU-bench Airline 59.6%、MMMU(视觉推理)76.5%、AIME 2025(高中数学竞赛)75.5%。在与 OpenAI o3、GPT-4.1、Google Gemini 2.5 Pro Preview 的横向对比中,Claude 4 系列在"代理类"与"工具调用"类任务上明显领先,而 Gemini 2.5 Pro Preview 在 GPQA Diamond 与 AIME 2025 上的得分更高,这反映了 Gemini 在"知识检索型"基准上的传统优势。
Claude Code:驻留在终端里的工程师
与模型同步发布的 Claude Code,是 Anthropic 在"AI 工程师"赛道的旗舰产品。它以命令行(CLI)形态出现,能直接在本地代码库中阅读、修改、运行命令、提交 Pull Request,并通过权限闸门让人类开发者在关键节点确认。
在 2025 年 GA(General Availability)版本中,Claude Code 已经支持:1) GitHub Actions 触发后台长任务;2) VS Code 与 JetBrains IDE 原生集成,改动直接显示在用户文件里;3) 长上下文(200K tokens)的本地代码库分析;4) 与 Cursor、Replit、Block(codename goose)、Rakuten、Sourcegraph、Augment Code 等十多家 IDE 与 SaaS 平台深度集成。
Rakuten 案例尤其值得关注:Claude Opus 4 在一项高难度开源重构任务中,独立运行了 7 小时并保持稳定性能。这意味着它已经具备"多小时持续专注"的能力,远超传统 AI 助手"分钟级"的可用时间窗口。多家硅谷公司在 2025 下半年披露,Claude Code 已经承担了 30%-50% 的日常代码改动工作量。
Computer Use:让 AI 直接操作电脑
Computer Use 是 Claude 4 系列最具想象力的能力。模型可以像人类员工一样观察屏幕、移动鼠标、点击按钮、填写表单,在用户的桌面、浏览器、文件和应用程序之间穿梭,完成跨应用任务——例如把一份 Excel 报表自动整理成 PPT,并把结果发到指定邮箱。
对开发者来说,Computer Use 不再要求为每个 SaaS 单独写 API 适配器,只要软件有图形界面,Claude 就有可能接入。这极大降低了企业自动化的集成成本——那些没有开放 API 的老旧 ERP、只有 Web 界面的内部工具,如今第一次成为可被 AI 自动化的对象。
Anthropic 披露,2025-2026 年公司收入快速增长,核心驱动力正是 Claude Code 与 Computer Use 这两项代理式 AI 产品。在企业付费意愿、订阅续费率、单客户 ARR(Annual Recurring Revenue)上,代理式 AI 都显著高于传统 ChatGPT 类对话产品。
定价、渠道与生态
Claude Opus 4 定价为 15 美元 / 百万 token 输入、75 美元 / 百万 token 输出,与上一代 Opus 持平;Claude Sonnet 4 定价为 3 美元 / 百万 token 输入、15 美元 / 百万 token 输出,与 Sonnet 3.7 持平。这种"加能力不加价"的策略,让 Claude 4 在企业侧的迁移成本非常低。
渠道方面,Claude 4 系列在 Anthropic API、Claude.ai(Pro / Max / Team / Enterprise)、Amazon Bedrock、Google Cloud Vertex AI、GitHub Copilot、Databricks 等多个平台同步上线。Amazon 与 Google 既是 Anthropic 的云渠道商,也是其战略投资人,这种深度绑定让 Claude 在企业市场获得了少见的"多云可达性"。
同步推出的四项 API 新能力(Code Execution Tool、MCP Connector、Files API、Prompt Caching 1 小时)直接补齐了"代理式 AI"的基础设施——开发者可以快速搭建从"意图理解"到"工具执行"再到"结果回写"的完整闭环。
对企业意味着什么
Claude 4 系列把"代理式 AI"从演示阶段推到了真实生产环境。在客服、运维、数据分析、代码审查等场景,模型不再只是回答问题,而是直接完成任务;企业的关注点也从"模型够不够聪明"转向"权限、审计与可回滚机制是否到位"。
Anthropic 在 AI Safety Level 3(ASL-3)标准下部署 Opus 4——意味着模型在金融、法律、医疗等高风险场景的输出风险被显著降低,组织可以放心地让 Opus 4 处理涉及个人隐私、商业机密、合规审计的工作流。
下一步:从模型到工作流
Anthropic 后续路线图显示,团队将持续强化长任务可靠性、多步规划与多模型协作能力。目标不只是"单次任务完成",而是让 Claude 在企业内部承担可衡量的实际工作量——例如按月交付的代码重构、按周迭代的客户研究报告、按日更新的财务对账。这些工作流的"单位经济学"正在被重新定义:以前需要一个团队花一周完成的事情,Claude 配合人类审核,可能只需要几个小时。
对企业 CIO 而言,真正的挑战不再是"要不要用 Claude",而是"如何把内部流程重新设计为 AI 友好的形态"——这要求组织结构、KPI、审批流都做出相应调整。Claude 4 不会替代企业组织,但会重新定义企业组织的运转方式。
