2024 年 WWDC 上,苹果首次发布 Apple Intelligence,把生成式 AI 能力深度集成进 iOS 18、iPadOS 18 与 macOS Sequoia。2025 年 6 月 WWDC,苹果更新了端侧与服务器端基础模型,并首次向第三方开发者开放 Foundation Models framework——开发者可以直接调用 iPhone、iPad、Mac 本地运行的大模型来完成摘要、分类、抽取等任务。Apple Intelligence 的核心架构由两类模型组成:一类是跑在 iPhone、iPad、Mac 本地芯片上的端侧模型(约 30 亿参数),另一类是放在 Private Cloud Compute(私有云计算)上的服务器模型。

端侧优先的产品哲学

对苹果而言,端侧推理不仅是工程选择,更是产品哲学:用户输入的邮件、照片、备忘录不应离开设备就能被 AI 处理。这意味着即便在不联网、飞行模式、信号极差的场景下,用户依然能拿到总结、改写、问答等服务。

这种"端侧优先"带来三个直接好处:第一,延迟极低,本地推理的响应时间是网络往返的几十分之一;第二,隐私天然有保障,数据不出设备;第三,在云端算力紧张或服务故障时仍能稳定工作。对于金融、医疗、法律这些对数据合规要求极高的行业,端侧 AI 几乎是把"AI 助手"这件事从"能不能用"变成了"敢不敢用"的关键变量。

系统会按任务复杂度、用户设备性能、隐私要求自动在端侧模型与 Private Cloud Compute 之间路由。例如,"帮我总结这条通知"在端侧完成;"帮我写一份 2000 字的工作总结"则可能路由到 Private Cloud Compute。整个路由过程对用户透明,且 Private Cloud Compute 基于 Apple Silicon 服务器,数据仅用于本次推理,不保留、不用于训练。

~30 亿参数的端侧模型,做到了什么

苹果在 2025 年的技术报告中披露,端侧语言模型约 30 亿参数,通过三项关键工程创新让它在 iPhone 本地高效运行:

1) KV-cache sharing。Transformer 在推理时需要缓存每一层的 Key-Value 矩阵,这通常占显存大头。苹果通过在相邻层之间共享 KV-cache,显著降低了内存占用,让 ~30 亿参数的模型能在 iPhone 的统一内存中跑起来。

2) 2-bit 量化感知训练(QAT)。传统量化(Quantization)是训练完成后才压缩,容易掉点。苹果的 2-bit QAT 把"低精度"这件事放进了训练循环——模型从一开始就被训练成"以 2-bit 精度思考",因此即使权重大幅压缩,精度损失仍可控。

3) Parallel-Track Mixture-of-Experts(PT-MoE)服务器模型。服务器侧不是简单堆参数,而是采用了一种新颖的 PT-MoE 架构,把"轨道并行(Track Parallelism)"和"专家混合"结合,既保证模型容量可扩展,又控制了推理成本。

这三项创新叠加,让 Apple Intelligence 在 A14 及以上芯片的设备上都能本地运行,无需等待云端响应。

训练数据与负责任 AI

苹果明确表示,Apple Intelligence 的基础模型从不使用用户的私人数据或个人交互来训练。训练数据来源包括两类:一是授权数据(licensed data),包括为增强特定功能而精选的内容;二是公开数据,通过 Apple 自家的网络爬虫 AppleBot 抓取。网站主可以通过数据使用控制选项拒绝其内容被用于训练。

苹果同时披露了几项关键的数据清洗规则:过滤掉可识别的个人信息(社保号、信用卡号等);过滤掉脏话与低质量内容;执行去重与质量打分;通过基于模型的分类器筛选高质量文档。这种"在源头控制"的方式,让 Apple Intelligence 的训练语料相比通用网络抓取更干净。

在后训练(Post-Training)阶段,苹果提出了两种新算法:1) 带教师委员会(Teacher Committee)的拒绝采样微调;2) 带镜像下降策略优化与 Leave-One-Out 优势估计器的 RLHF。两种算法叠加,显著提升了模型的指令遵循质量与对话风格可控性。

Foundation Models framework:把端侧模型开放给开发者

WWDC 2025 最具行业影响力的更新,就是 Foundation Models framework。开发者可以用几行 Swift 代码调用端侧模型完成以下任务:

· 从一段长文本中抽取关键信息(发票金额、合同到期日、患者用药名)

· 把用户笔记按主题自动分类、打标签

· 在离线状态下为聊天消息生成智能回复候选

· 把一段会议记录改写成不同语气的纪要

· 在 App 内直接做"语义搜索",而不是依赖云端 Embedding API

对开发者来说,这意味着免费、本地、隐私友好的 AI 能力首次以系统级 API 的形式开放——以前需要调用 OpenAI 或 Anthropic 才能完成的任务,现在直接调 iOS 系统 API 即可,且不产生云端推理费用。

新功能矩阵:Live Translation、视觉智能、Image Playground、Shortcuts

WWDC 2025 同时公布了一批 Apple Intelligence 新功能,覆盖日常使用的多个层面:

· Live Translation:在 Messages、FaceTime、电话通话中实时翻译对方语言,所有处理都在端侧完成,网络只用于极小的模型加载。

· 视觉智能升级:用户可以圈选屏幕上的任意内容,系统识别后直接给出操作建议——例如圈中一张海报自动生成日历事件、圈中一段菜谱自动列出购物清单。

· Image Playground 与 Genmoji:图像生成能力覆盖更多风格与多步编辑场景,支持自定义风格与人物形象。

· Shortcuts 直接调用 Apple Intelligence:用户可以在自动化流程里把 Apple Intelligence 当成一个步骤,触发条件如"收到新邮件自动摘要"或"每天早上整理昨天笔记"。

这些功能覆盖 iPhone、iPad、Mac、Apple Watch 与 Apple Vision Pro 五大设备,真正把 AI 嵌入了操作系统的每个角落。

对企业与开发者的影响

对用户来说,Apple Intelligence 最大的价值不是"又多了一个聊天机器人",而是日常的写作、翻译、整理照片、读 PDF、记会议等动作变得更顺手,且数据始终留在自己手里。

对企业 IT 来说,端侧 AI 改变了合规边界——很多原本需要上传到云端才能处理的文档,现在可以在员工设备本地完成,这对金融、医疗、法律等强监管行业意义重大。在 BYOD(自带设备上班)场景下,公司可以让员工直接调用设备本地 AI 处理敏感数据,而无需担心数据离开设备。

对开发者来说,Foundation Models framework 是一个分水岭事件——以前,接入 AI 能力意味着引入第三方 SDK、增加包大小、增加云端调用费用;现在,iOS 系统级 API 把这些事都免费做了。这会推动一批"原生 AI 应用"的涌现:不联网、不收费、隐私优先的小工具类应用,可能在 2026 年成为新的 App Store 爆款品类。

下一步:更深的端侧、更广的设备

展望下一代,苹果很可能继续把更多生成能力下沉到端侧,并让 Siri 成为系统级的代理入口:听懂用户意图、跨 App 调用能力、直接交付结果,而不仅仅停留在"打开某个 App"。同时,Apple Intelligence 的多语言覆盖将从英语、简体中文等扩展到更多小语种,在新兴市场获得更明显的渗透。

隐私与功能之间,苹果用"端侧优先 + Private Cloud Compute + 系统级 API"这三层架构,找到了一个既不被云端厂商绑定、又能让普通用户用上先进 AI 的中间路径。这条路径会被越来越多手机厂商学习——未来的移动设备,卖的不再只是摄像头与电池,而是"本机能跑多强的模型"。