2026 年,Apple 做了一件过去十年都没做过的事:把基础大语言模型作为系统级 SDK 开放给所有开发者。这件事的标志节点是 6 月 WWDC 2026 推出的 Foundation Models framework。一个多月后的 8 月,这层 SDK 已经覆盖到 iOS 26、iPadOS 26、macOS 26、Mac Catalyst 26、visionOS 26,以及最新发布的 watchOS 27——含 watchOS 在内的全部 Apple 主流平台都被装上了一致的 LLM 编程接口。这是 Apple 历史上第一次大规模、跨产品线地把"AI 模型调用"作为操作系统的标准能力交付出去。

这件事的工程意义被严重低估了。开发者不再需要云端 API key、不需要签约 OpenAI 或 Anthropic,只要用户的设备支持 Apple Intelligence(自 A17 Pro / M1 起所有 Apple Silicon 机型),就可以在 App 内调用本机或 Private Cloud Compute(PCC)上的大语言模型,对文本、图像、结构化数据做生成、抽取、改写、分类、归纳——而且完全离线。

更关键的是:这不是一个简单的"模型调用 SDK"。Foundation Models framework 在三个层面上做得比多数商业 API 更深:第一,它把 on-device 与 Private Cloud Compute 抽象成同一套接口,业务代码不需要分叉;第二,它提供结构化生成的强保证,任何 LLM 调用都能引导生成具体的 Swift 类型;第三,它原生支持 Tool Calling,你可以把模型当成 Agent 用,把外部 API、本地数据库、系统能力作为可调用工具注册进去。放到一起看,这是一套面向"端侧 AI Agent"的完整运行时。

一、为什么 Foundation Models 是过去一年最被低估的 Apple 改动

2024 年 WWDC 发布的 Apple Intelligence,大家记忆里主要是"AI 摘要、AI 修图、AI 翻译"——集中在系统自带 App。2025 年 WWDC 苹果公布端侧约 3B 参数模型与服务器端 PT-MoE 模型,但 SDK 没有下放,开发者只能在 iOS 系统 App 内部使用。2026 年这一变化是质变:

  • Foundation Models framework 作为独立 SDK 上线,Swift Package 形式可被任意 App 引入。
  • API 表面抽象到 LanguageModelSession 一种入口,模型在端 / 在云由动态 profile 自动决定,业务代码不需要 if/else 分叉。
  • 默认调用无成本、无网络依赖、无 token 费用,云端补充按用户 Apple ID 配额计费但不向开发者抽佣。

对一个正在做 B2B SaaS 的 iOS / macOS / visionOS 团队来说,这一层的意义接近于"一夜之间把 OpenAI/Anthropic 从必选合作伙伴清单里降级为可选项"。当你面对的是一个内置了 LLM runtime 的操作系统,且这个 runtime 拥有用户原生授权的数据回流通道,你原来花在 OpenAI SDK 嵌入、本地 prompt 工程、token 计费策略、数据出境合规上的时间,可以被显著压缩。

但这不是彻底的替代。Foundation Models 是 Apple 自己的模型系列(端侧 ~3B、PT-MoE 服务器端),它在垂直领域推理、代码生成、长上下文上不如 GPT-5.6 或 Claude Opus 5。Apple 给出的方案是兼容扩展:通过 Tool 协议,开发者可以把"远端第三方 LLM"包装为一个 Tool 接入对话流,这样既有"端侧可用"的快捷、又能按需升级到云端更强的模型。这种"本地优先 + 远端增强"的形态,正在变成 2026 年下半年 AI Agent SDK 的事实标准。

二、三层核心 API:从 Prompt 到 Agent 全栈覆盖

Foundation Models framework 暴露出来的 API 按层级可以拆成三层:会话与 prompt 层、附件与多模态层、动态 profile 与工具调用层。这三层组成完整的"端侧 AI Agent 编程图谱",从最小的 prompt 到最复杂的 agent 都能落地。

第一层:会话与 prompt

这一层定义了"用户怎么跟 LLM 交互"的最基本抽象。LanguageModelSession 是会话对象,一个会话代表一次与模型的持续上下文——你在会话里发 Prompt,模型返回响应,会话历史被框架管理。Instructions 是会话级指令,定义模型在该会话内的行为意图,比如"你是一名帮用户改简历的中文写作助理"。Prompt 是用户输入,可以是纯文本,也可以是文本 + 附件。GenerationOptions 控制生成长度、温度、采样参数,ContextOptions 配置上下文窗口与历史长度。

这层看似跟任何 SDK 的 chat completion 接口类似,但 Foundation Models 做了一个关键设计:会话历史是可以被结构化检查和回放的。Transcripts 模块允许 App 读取完整的 session 入口、段落、附件,可以在合规审计、A/B 评估、用户回放界面里直接使用。这点对受 EU AI Act 约束的企业 App 来说尤其有价值——8 月 2 日大限已过,透明度义务在移动端 App 上的可执行细则正在由各成员国市场监管机构落地,你能"读出模型对用户说了什么"的能力,直接对应到 Article 50 的"AI 输出可被审计"条款要求。

第二层:多模态与附件

Attachment 是基础类型,把一段资产(目前支持图像)装入 prompt。ImageAttachmentContent 在保留图像数据的同时,可以跟文本 prompt 一起送进模型。模型会用 Apple 自家多模态能力进行"图文混读",典型场景是:用户拍一张截图,App 让端侧模型生成一句结构化描述,或者把图像里的发票抽出字段回填到表单。

值得关注的是 Foundation Models 内置的多模态能力——通过 Analyzing images with multimodal prompting 这条官方指南可以看到,Apple 在图像理解上做了不少底子:它支持 OCR 风格文字抽取、对象识别、场景理解。但 Apple 自家端侧模型的多模态规模比纯文本略小,这意味着图像理解的复杂度上限有限。这点跟你调 GPT-5.6 Vision 或 Claude Opus 5 多模态有差距;但对于 80% 移动 App 场景——表单抽取、截图识别、文档拍照——这个能力完全够用。

更深的价值在于 privacy:图像数据不出设备、不上云(除非 fallback 到 PCC),这对医疗、法律、金融类 App 是合规加分项。

第三层:动态 profile 与 Tool Calling

这一层是 Foundation Models 真正的"Agent 引擎"。动态 profile(dynamic profiles)允许业务方在每次 LLM 调用前选择最合适的模型配置,包括端 / 云切换、上下文长度、采样策略。这点是 Apple 明确推荐用来做"agent or skill"抽象的——同一个业务流可以让模型在不同阶段用不同的 profile,比如决策阶段用端侧小模型(快、便宜、隐私)、执行阶段调远端大模型(强、慢、需授权)。

Tool 协议是 OpenAI function calling / Anthropic tool use 范式在 Apple 平台上的官方对应物。开发者定义一个 Tool 结构体,声明模型可以调用的外部能力(读数据库、调 REST、读本地文件、控制系统服务),模型根据当前对话流决定何时调用哪个 Tool、你给它工具的返回后再决定后续步骤。这是一条标准 agentic loop:模型 → 工具调用 → 工具响应 → 模型继续推理 → 下一个工具调用 ……

Foundation Models 的 Tool 设计有一个非常 Apple 的细节:工具调用上下文会被自动纳入 session transcript,完整可审计。

三、WWDC 2026 三个视频里 Apple 公布的真实参考架构

Apple 在 6 月 WWDC 2026 配合 framework 发布,给出了三个开发者视频教程,分别为编号 242、339、243:

  • 视频 242:Build agentic app experiences with the Foundation Models framework——这是端侧 Agent 范式的官方教学。Apple 演示了一个完整的"个人旅行规划"agent:用户说"我下个月想去日本旅行,预算 5000 美元",agent 通过 Tool 调用读取用户日历、读取用户位置偏好、读取航空公司价格 API,组装出一份建议行程。整个过程在端侧完成,网络往返只有最后落地价格 API 那一步。
  • 视频 339:Bring an LLM provider to the Foundation Models framework——这是给"非 Apple 模型供应商"的对接规范。Anthropic、OpenAI、Cohere、智谱、月之暗面这类厂商可以按照这个规范把自家模型适配进 Foundation Models,让开发者在使用 Apple native API 的同时,可以选择用 Apple 模型或第三方模型。Apple 在这里给出的信号是"我们不锁独家",这跟 Microsoft 365 Copilot 强推 OpenAI 完全相反——Apple 把模型层竞争保留给了开发者。
  • 视频 243:Debug and profile agentic app experiences with Instruments——这是性能分析配套。Foundation Models 在 Xcode Instruments 里暴露了 token 消耗、响应时间、tool call 调用栈的可视化面板,可以直接观测到一次 agent loop 里每个 tool 的延迟分布,这对调优是直接有效的。

这三个视频组合到一起给出的信号是:Apple 在 2026 年下半年押注的"AI Agent 平台"是开发者友好 + 模型中立 + 审计透明这套底层架构,跟 Microsoft + OpenAI 的"垂直整合"路线、Google + Gemini 的"全家桶"路线都不一样。

四、与 macOS 26.7 RC 同期的系统级 AI 联动

Foundation Models 不只是 SDK,它在系统层也悄悄在扩张能力。8 月 19 日 macOS 26.7 Release Candidate 的 seed 文件被开发者逆向,里面提到的 10+ 款新品都跟 AI 直接相关:AirPods 带红外摄像头用于 Visual Intelligence(端侧多模态);foldable iPhone(柔性设备上的 agent 体验);smart home hub(家居 agent);OLED MacBook 与 OLED iPad mini(更大屏幕更适配 agent 交互);Siri Remote 改版(语音 agent 控制器)……

把这些点串在一起看,Apple 的 2026 年下半年战略路径已经清晰:模型 → SDK → 设备 → 系统能力四层同向加强。Foundation Models 是 SDK 这一层,设备是 input/output layer,系统能力是被调用的 tool layer。一个完整闭环在 8 月的 RC 里首次显形。

对应用开发者来说,Foundation Models + 多模态 + 工具调用 + 系统能力 TCC API 这套组合,在 2026 年下半年会比直接调 OpenAI API 更具备产品差异化能力——因为你能利用的不仅仅是模型,还包括 Apple 全平台用户的私域授权通道。这是单纯 OpenAI API 用户所没有的资产。

五、端侧 AI Agent 的几个真实落地场景

把 Foundation Models 套到具体业务里去思考,2026 年下半年最可能先跑通的端侧 Agent 场景包括:

  1. 个人健康助理:HealthKit 数据不出设备,Foundation Models 在端侧做周期性总结、症状模式抽取,提供给用户的对话全程本地完成。可穿戴设备与 HealthKit 的数据深度,是 Apple 独有的资产。
  2. 跨应用任务自动化:Tool 协议 + Shortcuts + TCC 权限组合,让模型可以把"创建会议、改日历、起草邮件、归档附件"这种跨 App 流程自动化掉。Shortcuts 已经支持 Foundation Models 触发的脚本,非开发者用户也能用。
  3. 本地优先的代码助手:开发者用 Xcode 自带的 Coding Assistant,Foundation Models 在工程文件层做 autocomplete、补全单元测试、生成 mock。代码不离开设备意味着公司源码不会被训练回流。
  4. 法律 / 财务文档摘要:用户拍一张 PDF 合同照片,Foundation Models 在端侧抽取责任条款、金额、终止条款,做风险提示。所有内容不出设备,合规边界清晰。
  5. 教育类自适应辅导:学生输入数学题截图 + 文本提问,Foundation Models 在端侧推理,生成解题步骤。家长可以放心用,因为学生的全部数据停留本地。

这些场景的共同特征是:数据敏感 + 实时反馈 + 离线优先 + 跨设备闭环。它们正是 Apple 在 WWDC 2026 Keynote 的 Foundation Models 段落里反复举的例子。

六、对企业 IT 的合规与生态意义

把视角拉到企业 IT 与合规层面,Foundation Models 打开的几扇门值得提前规划:

  • 数据出境合规:PCC fallback 仍然是 Apple 数据中心,数据物理位置依然在用户 Apple ID 所属司法辖区。这对跨国企业是有帮助的——开 iOS / macOS App 时不需要一家一家谈 LLM 供应商的数据处理协议。
  • 成本结构:端侧调用免费,PCC 调用按用户配额计费(Apple 不向开发者抽佣)。对一个日活百万级 App 来说,Foundation Models 调用成本可以大幅低于 GPT-5.6 或 Claude Opus 5 的 API 价格,尤其在用户大量使用但单次 LLM 调用很轻的场景——表单抽取、邮件分类、推送摘要。
  • 审计与可解释性:Transcripts 完整可读、Tools 调用链透明可追,这两件事直接对应 EU AI Act Article 50 透明度义务。
  • 多模型策略:通过"bring an LLM provider to the Foundation Models framework"(WWDC 视频 339),企业可以在不重写业务代码的情况下,在 Apple 模型、Anthropic Claude、OpenAI GPT、自家 fine-tune 模型之间动态切换。这是过去商业 API 时代做不到的事。

结语:Apple 在抢 AI Agent 操作系统的"事实标准"位置

回看 Foundation Models framework 这件事的本质,它不是 Apple 在做"另一个 LLM SDK"。它是 Apple 在抢一个操作系统级别的事实标准:端侧 AI Agent 运行时。Microsoft + OpenAI 在云上做这件事,Google + Gemini 也在云上,但 Apple 把这件事压在端侧、压在系统层、压在开发者友好模型中立这一套组合上。

2026 年 8 月的 macOS 26.7 RC 里读到的那些"AI 周边新品",是 Apple 把这件事做成"全平台基础设施"的物证。一个多月过去,Foundation Models 已经成为 macOS 26 文档中与 SwiftUI 并列的核心栏目。下一次开发者大会 WWDC 2027 之前,我们大概率会看到 Foundation Models 进入 visionOS 的 3D 空间感知、进入 watchOS 的健康助理、进入 Apple TV 的客厅娱乐 Agent。

对企业 IT 与产品决策者而言,Foundation Models 已经不是"未来选项",而是今天 iOS 26 / macOS 26 / visionOS 26 App 是否要构建在端侧 AI Agent 之上的"现在进行时"决策。

(本文基于 Apple 官方 Foundation Models framework 文档(developer.apple.com/documentation/FoundationModels)、Apple WWDC 2026 视频教程 242 / 339 / 243 概述、macOS 26.7 RC 8 月 19 日代码逆向发现综合作成)