La API Foundation Models de Apple oculta tres límites de confianza distintos
La API de sesión Swift común de Apple puede acceder a modelos en el dispositivo, Private Cloud Compute u otro proveedor, pero esas rutas difieren en privacidad, capacidad y disponibilidad.
El framework Foundation Models de Apple en la WWDC26 coloca un modelo en el dispositivo, un modelo de Private Cloud Compute y otros proveedores detrás de una abstracción Swift común. Eso facilita cambiar de modelo. No hace que las rutas sean equivalentes.
La regla práctica inicial es: mantén una tarea en el dispositivo cuando el modelo local supere su control de calidad; usa Private Cloud Compute cuando su mayor contexto o capacidad de razonamiento produzca una mejora medida que justifique la dependencia de Internet y la cuota; usa otro proveedor solo cuando su capacidad, alcance o economía supere a ambos dentro de un límite de confianza explícitamente distinto.
La decisión pertenece al nivel de la tarea, no al de la aplicación. Una aplicación de diario podría clasificar una entrada localmente, enviar una solicitud de planificación larga a Private Cloud Compute y dirigir un idioma no compatible a otro proveedor. Una etiqueta como “función de IA” oculta las restricciones que determinan si cada ruta funciona.
La misma API de sesión cruza tres límites distintos
La guía de aprendizaje automático de Apple para la WWDC26 describe una API Swift nativa para el modelo del sistema, un protocolo LanguageModel para otros proveedores, acceso a un modelo más grande en Private Cloud Compute y un framework de Evaluations independiente. Por tanto, la generación estructurada y las llamadas a herramientas pueden conservar una forma de aplicación similar aunque cambie el modelo subyacente.
La forma operativa no permanece igual. La sesión de Private Cloud Compute de Apple afirma que el modelo en el dispositivo funciona sin conexión y no tiene límite de solicitudes. La ruta de servidor requiere conexión a Internet, tiene un límite diario por usuario y está restringida a dispositivos compatibles con Apple Intelligence. Apple también dice que los desarrolladores deben solicitar el entitlement y que el programa está disponible para aplicaciones con menos de dos millones de primeras descargas.
Otro proveedor añade su propia cuenta, autenticación, precios, disponibilidad regional, condiciones de retención y modos de fallo. La presentación de Foundation Models de Apple afirma que los proveedores conformes pueden respaldar la misma interfaz de sesión, pero también advierte de que los modelos de servidor de terceros normalmente requieren una gestión segura de credenciales y facturación por token.
| Ruta | Encaje inicial sólido | Restricción que puede descartarla | Evidencia mínima antes de publicar |
|---|---|---|---|
| Modelo de sistema en el dispositivo | Tareas breves y acotadas; uso sin conexión; datos que deben permanecer en el dispositivo | Disponibilidad del dispositivo y del modelo, contexto, calidad de la tarea, salvaguardas, memoria y comportamiento de batería o temperatura | Evaluación en dispositivos representativos, comprobaciones de disponibilidad en tiempo de ejecución y contexto, latencia p50/p95 y gestión de fallos |
| Private Cloud Compute | Tareas que necesitan más contexto o razonamiento y permanecen dentro del diseño de computación confidencial documentado por Apple | Acceso a Internet, entitlement y elegibilidad de la aplicación, requisito de dispositivo Apple Intelligence, cuota por usuario y disponibilidad del servicio | Mejora de calidad independiente, simulación de cuota, fallback ante fallos de red y revisión actual del entitlement y la privacidad |
| Otro modelo local | Un modelo especializado o portátil que la aplicación pueda empaquetar o descargar legalmente | Tamaño del modelo, licencia, cobertura de dispositivos, ruta de actualización y un runtime mantenido por separado | Revisión exacta del modelo y runtime, matriz de dispositivos, mediciones de calidad y recursos y plan de reversión |
| Otro proveedor de servidor | Capacidad, idioma, disponibilidad o economía que las rutas de Apple no satisfacen | Autenticación, uso facturable, condiciones del proveedor, residencia y retención, límites de frecuencia y caída del proveedor | Prueba de calidad/coste a nivel de tarea, revisión del flujo de datos, comprobaciones regionales y comportamiento ante reintentos y fallos del proveedor |
La matriz es una preselección, no una clasificación. “Primero en el dispositivo” es una preferencia de privacidad y resiliencia solo cuando la ruta local está disponible y completa la tarea de forma aceptable. “Usar el modelo más grande” también es incompleto cuando la tarea no lo necesita o los usuarios pueden alcanzar un límite del servidor.
Estas condiciones se comprobaron el 26 de agosto de 2026 frente al material de la WWDC26 de Apple. Apple etiqueta las capacidades anunciadas como sujetas a cambios y advierte de que algunos servicios varían según la región, el idioma y la legislación local. Trata la tabla como un diseño de evaluación; verifica el sistema operativo de lanzamiento, el entitlement, la lista de dispositivos, la cuota y las condiciones del proveedor antes de publicar.
El contexto es un valor de runtime, no un número de folleto
El propio material de Apple para la WWDC26 muestra por qué las reglas de enrutamiento estáticas envejecen mal. La comparación dedicada de Private Cloud Compute describe un contexto de 4K en el dispositivo y uno de 32K en el servidor. El ejemplo de código de la sesión general imprime 8192 para SystemLanguageModel.contextSize, a la vez que describe las API introducidas en iOS 26.4 para inspeccionar el contexto y contar tokens.
Esas dos páginas primarias actuales no respaldan un único número inmutable de contexto en el dispositivo para todos los sistemas operativos, modelos y dispositivos. La implementación segura consiste en leer el tamaño del contexto del modelo real en tiempo de ejecución, contar las instrucciones, el prompt, la transcripción, las definiciones de herramientas, los adjuntos y la salida esperada, y reservar espacio para la generación y los resultados de las herramientas. Registra el valor observado junto con la compilación del sistema operativo y la clase de dispositivo en el resultado de la evaluación.
La cifra de 32K del servidor necesita la misma disciplina. La sesión de Apple dice que el razonamiento utiliza tokens adicionales en un segmento separado de la transcripción, de modo que un prompt que cabe nominalmente puede dejar un presupuesto de salida demasiado pequeño. Una prueba de enrutamiento debe medir la interacción completa, no solo el texto visible para el usuario.
Es la misma lección de capacidad que en el despliegue local de modelos de pesos abiertos. Nuestro análisis del despliegue de Qwen en 16 GB muestra por qué el contexto anunciado por un modelo y el contexto utilizable con un presupuesto de memoria real son afirmaciones distintas.
La privacidad cambia cuando el cálculo sale del dispositivo
La ejecución en el dispositivo proporciona el límite físico más claro de esta comparación: el modelo puede funcionar sin enviar el prompt a un servidor. Eso no resuelve automáticamente todas las cuestiones de privacidad. La aplicación aún puede registrar entradas, llamar a herramientas de red, sincronizar resultados o exponer texto sensible mediante analítica. Prueba el flujo de datos de toda la función.
Private Cloud Compute es una ruta remota con un argumento de seguridad diferente. Apple afirma que las solicitudes no se almacenan y que los investigadores pueden verificar el software desplegado. Su actualización de seguridad de 2026 dice que el sistema se extiende ahora a infraestructura de Google Cloud con hardware de NVIDIA, conservando las protecciones y mecanismos de transparencia de PCC de Apple.
La evidencia independiente es más limitada que un respaldo general de la privacidad. Un análisis de WiSec 2026 (en inglés) sometió a ingeniería inversa las interfaces del cliente y comparó de forma independiente un modelo de PCC, pero sus autores también señalaron que los binarios compilados no eran reproducibles y que los modelos subyacentes y las interfaces de consulta no eran accesibles públicamente. El estudio respalda que PCC puede examinarse desde fuera de Apple; también muestra por qué la computación confidencial remota no debe describirse como idéntica a mantener los datos en el dispositivo del usuario.
Para otro proveedor de servidor, documenta exactamente qué campos del prompt cruzan el límite, dónde se procesa la información, qué se conserva, qué subencargados participan y cómo se gestiona la autenticación. No dejes que una LanguageModelSession común borre esas diferencias de los textos del producto o del diseño del consentimiento.
La función importa más que la familia de modelos
El informe de investigación de modelos de Apple de 2025 describía su modelo en el dispositivo de unos tres mil millones de parámetros como adecuado para tareas como resumir, extraer, refinar, mantener diálogos breves y usar herramientas, no como un chatbot de conocimiento general del mundo. Después, la WWDC26 anunció un modelo en el dispositivo reconstruido, con nuevas modalidades y un comportamiento más sólido con herramientas. Un benchmark o una intuición sobre el modelo anterior no puede decidir si la nueva ruta funciona para una aplicación concreta.
Usa un conjunto de evaluación fijo extraído de las entradas reales de la función. Para una aplicación ficticia de notas de viaje, podría incluir la clasificación de notas breves, el resumen de un itinerario de 20 páginas, fechas ambiguas, uso sin conexión, una llamada a una herramienta que lea un calendario local, un dispositivo no compatible, una cuota de servidor casi agotada y una caída del proveedor. Mantén fijo el comportamiento esperado y los fallos inaceptables en todas las rutas.
| Medición | Registrar para cada ruta | Por qué puede cambiar la ruta |
|---|---|---|
| Resultado de la tarea | Aprobado/fallido, puntuación de rúbrica, corrección humana y afirmaciones no respaldadas | Un resultado más rápido o privado no sirve si falla la tarea |
| Salida estructurada | Tasa de esquemas válidos y errores semánticos de campos | Un tipo Swift válido aún puede contener el valor equivocado |
| Comportamiento de herramientas | Herramienta correcta, argumentos, llamadas denegadas, reintentos y efectos secundarios | La fiabilidad y el riesgo pueden diferir por modelo aunque haya un único protocolo |
| Contexto | Límite de runtime, tokens de entrada, tokens de razonamiento, tokens de salida y truncamiento | Determina si cabe la interacción completa |
| Latencia | Tiempo hasta el primer resultado útil y tiempos de finalización p50 y p95 | Separa una demostración fluida de la latencia de cola que experimentan los usuarios |
| Disponibilidad | Dispositivo, compilación del sistema operativo, estado del modelo, estado de la red, entitlement y cuota | Muestra quién puede usar la ruta y con qué frecuencia hace fallback |
| Recursos o coste | Observación de batería/temperatura, tokens facturables y coste operativo | Hace medibles, en vez de retóricas, las afirmaciones de “gratis” y “local” |
| Límite de privacidad | Campos de datos enviados, destino, base de retención y comunicación al usuario | Evita que un cambio de implementación modifique silenciosamente el modelo de confianza |
El explicador de evaluación de IA explica por qué la métrica debe coincidir con la decisión de producto. El estudio comparativo de Sentence Transformers (en español) ofrece otro ejemplo de congelar las entradas y los presupuestos antes de comparar sistemas técnicamente distintos.
Los informes de profesionales sirven para encontrar casos de fallo, no para estimar su prevalencia. En una discusión de desarrolladores de iOS (en inglés), varios desarrolladores describieron pruebas en dispositivos físicos, presión de contexto, problemas de salida estructurada y fallbacks en la nube. Esas observaciones no constituyen un benchmark representativo. Son buenos indicios para crear pruebas que el equipo de la aplicación pueda reproducir en sus propios dispositivos compatibles.
El fallback cambia la promesa de privacidad del producto
La sesión de PCC de Apple recomienda comprobar la disponibilidad y probar los estados de cuota. Eso convierte el fallback de un gestor de excepciones en un comportamiento visible para el usuario. Decide qué ocurre cuando el modelo local no está disponible, el prompt supera su presupuesto de runtime, PCC no tiene conexión o alcanza su límite y el proveedor externo rechaza la solicitud o agota el tiempo de espera.
Un fallback seguro no siempre significa enviar el prompt a otro lugar en silencio. Si la función prometía procesarse en el dispositivo, cruzar un límite de red necesita una comunicación precisa y, cuando corresponda, una elección del usuario. Para una función no esencial, un resultado local más pequeño o un estado claro de “no disponible sin conexión” puede ser mejor que una escalada invisible.
El protocolo común sigue siendo valioso. Permite que un equipo conserve la salida estructurada, las definiciones de herramientas y buena parte del código de sesión mientras prueba varias rutas. La ganancia de ingeniería es experimentar más barato y tener un código de fallback más claro, no demostrar que todas las rutas ofrecen la misma calidad de modelo, privacidad, alcance o coste.
Por tanto, el framework de Apple ha facilitado la implementación del enrutamiento de modelos justo cuando la decisión de enrutamiento se ha vuelto más importante. La API común reduce el trabajo de integración, pero no puede hacer equivalentes la ejecución en el dispositivo, Private Cloud Compute y un proveedor externo en calidad, privacidad, alcance o coste.
Fuentes
- Apple WWDC26 machine learning guide
- Apple WWDC26: What is new in the Foundation Models framework
- Apple WWDC26: Build with the new Apple Foundation Model on Private Cloud Compute
- Apple research update on on-device and server foundation models
- Apple Security Research: Expanding Private Cloud Compute
- Unlocking Apple Private Cloud Compute: independent security and model analysis
- Practitioner discussion of Foundation Models deployment constraints