Apple 的 Foundation Models API 隐藏着三种不同的信任边界

Apple 的通用 Swift 会话 API 可以访问端侧模型、Private Cloud Compute 或其他提供商,但这些路径在隐私、容量和可用性上各不相同。

分享这篇文章

Apple 在 WWDC26 推出的 Foundation Models 框架,把端侧模型、Private Cloud Compute 模型和其他提供商放在一个通用的 Swift 抽象之后。这让更换模型变得容易,却不会让这些路径变得等价。

实际的起点规则是:当端侧模型通过质量门槛时,就让任务留在端侧;当 Private Cloud Compute 更大的上下文或推理带来经测量的改善,且值得承担互联网依赖和配额时,就使用它;只有当另一家提供商在明确不同的信任边界下,其能力、覆盖范围或经济性胜过前两者时,才使用它。

这个决定属于任务层,而不是应用层。一个日记应用可以在本地对条目分类,把较长的规划请求发送到 Private Cloud Compute,并将不支持的语言路由到另一家提供商。像“AI 功能”这样的单一标签,会隐藏决定每条路径能否工作的限制。

同一个会话 API 跨越三种不同的边界

Apple 的 WWDC26 机器学习指南描述了系统模型的原生 Swift API、用于其他提供商的 LanguageModel 协议、访问 Private Cloud Compute 上更大模型的能力,以及单独的 Evaluations 框架。因此,即使后端模型发生变化,结构化生成和工具调用仍可以保持相似的应用形态。

但运营形态并不会保持相同。Apple 的 Private Cloud Compute 会话表示,端侧模型可以离线工作且没有请求限制。服务器路径要求互联网连接,有每位用户的每日限制,并且只对支持 Apple Intelligence 的设备开放。Apple 还表示,开发者必须申请 entitlement,而且该计划面向首次下载量少于两百万次的应用开放。

另一家提供商会带来自己的账户、身份验证、定价、地区可用性、保留条款和故障模式。Apple 的 Foundation Models 概览表示,符合协议的提供商可以支持同一个会话接口,但也警告说,第三方服务器模型通常需要安全处理凭据,并按 token 计费。

路径最适合的起点可能拒绝该路径的限制发布前的最低证据
端侧系统模型简短、有边界的任务;离线使用;应留在设备上的数据设备和模型可用性、上下文、任务质量、防护措施、内存,以及电池或散热行为代表性设备评估、运行时可用性和上下文检查、p50/p95 延迟、故障处理
Private Cloud Compute需要更多上下文或推理,同时仍留在 Apple 记录的机密计算设计内的任务网络访问、entitlement 和应用资格、Apple Intelligence 设备要求、每用户配额、服务可用性单独的质量增益、配额模拟、网络故障回退、当前 entitlement 和隐私审查
其他端侧模型应用可以合法打包或下载的专用或可移植模型模型大小、许可证、设备覆盖、更新路径,以及需要单独维护的运行时确切的模型和运行时版本、设备矩阵、质量和资源测量、回滚方案
其他服务器提供商Apple 的路径无法满足的能力、语言、可用性或经济性身份验证、计费使用量、提供商条款、数据驻留和保留、速率限制、提供商中断任务级质量/成本测试、数据流审查、地区检查、重试和提供商故障行为

这张矩阵是候选清单,不是排名。“端侧优先”只有在本地路径可用且能以可接受的质量完成任务时,才是一种隐私和韧性偏好。当任务不需要最大模型,或用户可能触及服务器限制时,“使用最大的模型”同样不完整。

这些条件已在 2026 年 8 月 26 日根据 Apple 的 WWDC26 材料核查。Apple 将所宣布的能力标记为可能变化,并警告某些服务会因地区、语言和当地法律而不同。把这张表当作评估设计;发布前请核实发布版操作系统、entitlement、设备列表、配额和提供商条款。

上下文是运行时的值,而不是宣传册上的数字

Apple 自己的 WWDC26 材料说明了静态路由规则为何会迅速过时。专门的 Private Cloud Compute 比较给出 4K 的端侧上下文和 32K 的服务器上下文。概览场次的代码示例为 SystemLanguageModel.contextSize 打印 8192,同时介绍 iOS 26.4 中用于检查上下文和计算 token 的 API。

这两个当前的一手页面并不支持在所有操作系统、模型和设备上使用一个永恒不变的端侧数字。安全的实现方式是在运行时从实际模型读取上下文大小,计算指令、提示词、对话记录、工具定义、附件和预期输出,然后为生成和工具结果保留余量。在评估结果中,连同操作系统构建版本和设备类别记录观察到的数值。

32K 的服务器数字也需要同样的纪律。Apple 的会话说明,推理会在单独的对话记录片段中使用额外 token,因此一个名义上放得下的提示词仍可能留下过少的输出预算。路由测试应测量完整交互,而不只是用户可见的文字。

这与本地开放权重部署的容量教训相同。我们的 Qwen 16GB 部署分析说明了为什么模型宣称的上下文和真实内存预算下可用的上下文是两个不同的主张。

计算离开设备后,隐私会发生变化

端侧执行在这项比较中提供了最清晰的物理边界:模型可以在不把提示词发送到服务器的情况下运行。但这并不会自动解决所有隐私问题。应用仍可能记录输入、调用网络工具、同步结果,或通过分析系统暴露敏感文本。应测试整个功能的数据流。

Private Cloud Compute 是一条远程路径,采用不同的安全论证。Apple 表示请求不会被存储,研究人员可以验证已部署的软件。其 2026 年安全更新表示,该系统现在扩展到使用 NVIDIA 硬件的 Google Cloud 基础设施,同时保留 Apple 的 PCC 保护和透明度机制。

独立证据比一概而论的隐私背书更窄。WiSec 2026 分析(英文)逆向分析了客户端接口,并独立对 PCC 模型进行了基准测试,但作者也指出,编译后的二进制文件无法复现,底层模型和查询接口也没有公开。该研究支持这样一个主张:PCC 可以从 Apple 之外接受检查;同时它也说明,远程机密计算不应被描述成与将数据留在用户设备上完全相同。

对于另一家服务器提供商,应准确记录哪些提示词字段跨越边界、处理发生在哪里、保留什么、涉及哪些子处理者,以及身份验证如何处理。不要让通用的 LanguageModelSession 从产品文案或同意设计中抹去这些差异。

功能比模型家族更重要

Apple 的 2025 年模型研究报告将其约 30 亿参数的端侧模型描述为适合摘要、提取、润色、短对话和工具使用等任务,而不是通用世界知识聊天机器人。WWDC26 随后宣布了重建的端侧模型,具有新的模态和更强的工具行为。早期模型的基准或直觉不能决定较新路径是否适合某个特定应用。

使用取自功能真实输入的固定评估集。以虚构的旅行笔记应用为例,其中可以包括短笔记分类、20 页行程摘要、含糊日期、离线使用、读取本地日历的工具调用、不支持的设备、服务器配额即将耗尽,以及提供商中断。让预期行为和不可接受的失败在不同路径之间保持固定。

测量项每条路径都要记录为什么可能改变路径
任务结果通过/失败、量规分数、人工修正、不受支持的主张如果结果无法完成任务,更快或更私密也没有用
结构化输出schema 有效率和语义字段错误有效的 Swift 类型仍可能包含错误的值
工具行为正确工具、参数、被拒调用、重试、副作用即使在同一协议之后,工具可靠性和风险也可能因模型而异
上下文运行时限制、输入 token、推理 token、输出 token、截断决定完整交互能否放下
延迟首个有用结果的时间,以及 p50 和 p95 完成时间区分流畅演示与用户实际遇到的尾部延迟
可用性设备、操作系统构建版本、模型状态、网络状态、entitlement、配额显示谁能使用该路径,以及它多常回退
资源或成本电池/散热观察、计费 token、运营成本让“免费”和“本地”从修辞变成可测量的主张
隐私边界发送的数据字段、目的地、保留依据、用户披露防止实现替换在不知不觉中改变信任模型

AI 评估说明解释了为什么指标必须匹配产品决策。Sentence Transformers 对比测试(中文)则提供了另一个在比较技术上不同的系统前冻结输入和预算的例子。

实践者报告适合发现失败案例,不适合估计发生率。在一则 iOS 开发者讨论(英文)中,开发者描述了实体设备测试、上下文压力、结构化输出问题和云端回退。这些观察不是代表性基准,而是应用团队可以在自己支持的设备上复现的测试样本的良好提示。

回退会改变产品的隐私承诺

Apple 的 PCC 场次建议检查可用性并测试配额状态。这使回退从异常处理程序变成面向用户的行为。应决定:端侧模型不可用、提示词超过运行时预算、PCC 没有连接或达到限制,以及外部提供商拒绝或超时时,会发生什么。

安全的回退并不总是意味着静默地把提示词发送到别处。如果功能承诺在设备上处理,跨越网络边界就需要准确披露,并在适当情况下让用户选择。对于非必要功能,较小的本地结果或清晰的“离线不可用”状态,可能优于无形的升级。

通用协议仍然有价值。它让团队在测试多条路径时保留结构化输出、工具定义和大部分会话代码。工程上的收益是更便宜的实验和更清晰的回退代码,而不是证明每条路径都提供相同的模型质量、隐私、覆盖范围或成本。

因此,Apple 的框架让模型路由更容易实现,恰逢路由决策变得更加重要。通用 API 减少了集成工作,却无法让端侧执行、Private Cloud Compute 和外部提供商在质量、隐私、覆盖范围或成本上等价。

资料来源

  1. Apple WWDC26 machine learning guide
  2. Apple WWDC26: What is new in the Foundation Models framework
  3. Apple WWDC26: Build with the new Apple Foundation Model on Private Cloud Compute
  4. Apple research update on on-device and server foundation models
  5. Apple Security Research: Expanding Private Cloud Compute
  6. Unlocking Apple Private Cloud Compute: independent security and model analysis
  7. Practitioner discussion of Foundation Models deployment constraints