La transferencia de caché KV entre modelos es rápida y sorprendentemente específica de cada pareja
Investigadores de NVIDIA informan de una aceleración de 25× a nivel de componente para una asignación de caché KV, mientras que otras parejas de modelos perdieron gran parte de la exactitud de tarea del modelo objetivo.
Investigadores de NVIDIA informan de que un mapeador lineal puede convertir la caché de clave-valor de un modelo de lenguaje al formato que espera un pariente mayor, evitando una segunda pasada por una conversación larga. En su mejor ejemplo de latencia, mapear una caché de 32.768 tokens de Qwen3 14B a Qwen3 32B tardó 278 milisegundos; ejecutar el prellenado del modelo 32B tardó 6.975 milisegundos. Es una diferencia medida de 25,1× a nivel de componente.
No es una aceleración de la aplicación de 25×.
El preprint del 4 de agosto solo probó modelos densos de atención completa en tres familias, con una geometría de clave-valor coincidente. Dos de las seis parejas de menor a mayor perdieron la mayor parte de la exactitud de referencia del objetivo con el método lineal. Incluso dos parejas que parecían satisfactorias en un promedio de cinco benchmarks conservaron solo el 18,2 % y el 36,6 % del resultado GSM8K del objetivo, respectivamente. El experimento de latencia también excluyó una parte del despliegue de extremo a extremo: entregar la caché mapeada al proceso objetivo.
Por tanto, el resultado es específico de cada pareja, no un interruptor de función. Una forma de caché coincidente hace posible el experimento; no predice si la calidad de la tarea sobrevivirá.
La caché ahorra trabajo dentro de un modelo
Un modelo de lenguaje autorregresivo produce texto un token cada vez. Antes de que empiece ese bucle, el modelo procesa los tokens de entrada en una pasada de prellenado. Cada capa de atención escribe tensores de claves y valores que representan el contexto. Durante la decodificación, el modelo lee esos tensores almacenados en lugar de recalcular todos los tokens anteriores en cada paso.
La documentación de caché de Hugging Face describe el caso habitual: cachés dinámicas, de tamaño fijo, cuantizadas o descargadas que pertenecen a un solo modelo. También muestra el almacenamiento en caché de prefijos, donde un modelo precalcula un prompt compartido y lo reutiliza para varias continuaciones.
Cambiar de modelo rompe ese supuesto. Una caché de Qwen3 14B contiene las representaciones internas producidas por Qwen3 14B; Qwen3 32B espera las suyas. Un router siempre puede enviar el texto acumulado al modelo 32B y dejar que haga el prellenado normalmente. La transferencia entre modelos intenta sustituir ese trabajo por una conversión aprendida.
Nuestro explicador de vectores y embeddings desarrolla la idea subyacente: las coordenadas solo son útiles con respecto al sistema de representación que les da significado. El mapeador intenta traducir entre dos sistemas relacionados sin volver a ejecutar el modelo que normalmente produciría las coordenadas del objetivo.
Varios sistemas relacionados usan la palabra «transferencia» para operaciones diferentes:
| Técnica | Qué permanece igual | Qué cambia | Pregunta principal |
|---|---|---|---|
| Almacenamiento de prefijos | Modelo y prefijo | Continuación o solicitud | ¿Se pueden reutilizar tokens iniciales idénticos? |
| Descarga de caché | Modelo y significado de la caché | Ubicación de memoria o precisión | ¿Se puede intercambiar presión de memoria por coste de movimiento? |
| Transmisión de caché KV | Diseño de caché compatible | Componente de servicio o dispositivo | ¿Puede la misma caché llegar al decodificador de forma eficiente? |
| Mapeo entre modelos | Tokens y contexto previsto | Representación del modelo | ¿Puede una caché objetivo aproximada conservar el comportamiento? |
La guía de transmisión de TensorRT-LLM de NVIDIA, por ejemplo, mueve datos de caché de una fase de contexto a una fase de generación y gestiona los diseños en configuraciones paralelas por tensor y por pipeline. Eso es infraestructura de servicio, no una prueba de que la aproximación entre modelos del nuevo artículo esté integrada o preparada para producción.
El mapeador es sencillo; su contrato no
El artículo define una pareja KV coincidente como dos modelos con el mismo número de cabezas KV y la misma dimensión por cabeza. Sus experimentos también se mantienen dentro de una familia de modelos, donde origen y destino comparten tokenizador, y utilizan atención densa completa. La profundidad del modelo y el número total de parámetros pueden diferir.
Para cada capa objetivo y cabeza de atención, el método selecciona las capas de origen cuyas cachés predicen mejor la caché objetivo. Concatena las k características de origen principales y resuelve una regresión ridge separada para claves y valores. La regresión ridge es un ajuste lineal con una pequeña penalización que ayuda a mantener estable numéricamente la solución.
Las claves también contienen embeddings posicionales rotatorios, o RoPE: rotaciones dependientes de la posición que indican a la atención dónde se encuentra un token en la secuencia. El mapeador invierte la rotación de origen, ajusta en ese espacio sin posición y aplica después la rotación objetivo. Los valores no llevan RoPE y se mapean directamente.
Los investigadores ajustaron cada pareja con 500 secuencias FineWeb-Edu de 1.024 tokens. Según la pareja, el mapeador resultante contenía entre 1.010 y 3.360 millones de parámetros y ocupaba entre 4 y 12 GB en la configuración del artículo. Los ajustes tardaron aproximadamente entre 47 y 87 minutos en un nodo con ocho H100. Cada dirección es independiente, así que no se puede suponer que un artefacto de 14B a 32B funcione a la inversa.
Ninguno de esos detalles es un umbral de despliegue. El artículo utilizó un dominio de calibración, eligió k en parte según benchmarks que se comunicaron después, no probó parejas con KV incompatibles y no cubrió transferencias entre familias ni con atención híbrida. Una revisión del modelo también puede cambiar las representaciones que espera el mapeador ajustado aunque el nombre comercial permanezca constante.
Por eso, la unidad correcta de aprobación es una tupla exacta:
revisión de origen → revisión de destino + tokenizador + dirección + artefacto del mapeador + evaluación de carga de trabajo
El promedio de exactitud oculta los fallos decisivos
El artículo informa de la retención bruta como la exactitud de la caché mapeada dividida por la exactitud del prellenado normal del modelo objetivo. También informa de la retención normalizada al suelo, que fija en cero la puntuación de azar de un benchmark. Ese segundo número importa: la retención bruta puede hacer que un resultado cercano o inferior al azar parezca menos grave.
Las seis parejas de menor a mayor no formaron una clase fiable:
| Origen → destino | Promedio de cinco tareas | Promedio normalizado al suelo | Retención GSM8K |
|---|---|---|---|
| Qwen3 14B → 32B | 97,6% | 96,3% | 95,6% |
| Qwen3 8B → 32B | 87,5% | 80,7% | 68,8% |
| Llama 3.1 8B → 70B | 72,8% | 62,9% | 18,2% |
| Ministral 3B → 8B | 76,2% | 65,9% | 36,6% |
| Ministral 3B → 14B | 44,2% | 14,7% | 3,2% |
| Ministral 8B → 14B | 41,6% | 11,1% | 1,6% |
GSM8K fue el benchmark de generación matemática con cadena de pensamiento del estudio; las otras cuatro tareas del promedio eran evaluaciones de estilo clasificatorio. El promedio de cinco tareas de la pareja Llama fue del 72,8 %, pero su puntuación GSM8K mapeada fue 14,78 frente a 81,12 del objetivo. Esto no demuestra que vaya a fallar cualquier carga de razonamiento. Demuestra que un promedio dominado por otras formas de tarea no puede autorizar un mapeador para razonamiento matemático, uso de herramientas, programación o la aplicación que está detrás de un router de producción.
Los dos mapeos lineales de Ministral a 14B fallaron de forma mucho más amplia. Un mapeador no lineal de dos capas ocultas recuperó 24,3 y 36,8 puntos porcentuales de retención HellaSwag para esas parejas, pero también sustituyó la ventaja cerrada y sin gradientes del artículo por un modelo entrenado. «Usar un mapeador mayor» es un sistema nuevo que hay que evaluar, no una reparación automática.
El resultado multivuelta del estudio necesita el mismo límite. Probó Qwen3 14B y 32B en 100 conversaciones de CoQA a lo largo de diez turnos. La deriva fue pequeña en esa única pareja y tarea. El informe de VentureBeat del 21 de agosto llamó útilmente la atención sobre el caso de uso de sesiones largas, pero su formulación más contundente sobre demostrar que el sistema no caería en una cascada de fallos va más allá de ese experimento. Diez turnos en una pareja compatible no pueden garantizar otro modelo, tarea o longitud de sesión.
Recalcula el resultado de 25× alrededor de toda la transferencia
Con 32.768 tokens, el resultado de Qwen3 14B a 32B permite este cálculo local al artículo:
reported avoided prefill = target re-prefill - mapper application
= 6,975 ms - 278 ms
= 6,697 ms
La medición utilizó un nodo con ocho H100 y NVLink, pasadas hacia delante en bfloat16, 50 calentamientos y 30 ensayos cronometrados por celda. El nuevo prellenado ejecutó el cuerpo Transformer objetivo con FlashAttention 2 y excluyó la cabeza del modelo de lenguaje. El tiempo del mapeador incluyó las transferencias entre GPU necesarias para mover la caché de origen al objetivo, pero los autores señalan que un sistema de extremo a extremo también tendría que entregar la caché mapeada al proceso objetivo, algo que no midieron.
Un resultado completo de la transferencia sería, en cambio:
net handoff saving
= normal target prefill
- mapper application
- source/cache transport not already included
- mapped-cache delivery
- amortized artifact loading
- rejected-transfer and fallback penalty
Importa la distribución entre longitudes de contexto y concurrencia, al igual que el coste por transferencia aceptada, incluidos el ajuste del mapeador, el almacenamiento del artefacto, las asignaciones fallidas, la comparación en sombra y el prellenado de respaldo. Un resultado de componente de 25× aún puede ser valioso, pero solo donde ese ahorro sobreviva al contacto con la topología de servicio.
Ese denominador sigue la misma disciplina que nuestra evaluación del coste por tarea aceptada: el trabajo rechazado y los reintentos siguen consumiendo recursos. El análisis de multiplicación de matrices de AlphaEvolve ofrece la lección de sistemas más amplia: la operación mejorada solo importa cuando es lo bastante grande en la carga real como para cambiar el resultado de todo el sistema.
La transferencia de caché KV entre modelos es prometedora precisamente porque el trabajo evitado es concreto. El artículo mapeó una caché objetivo mucho más rápido de lo que la recalculó y conservó el comportamiento en varias parejas. También proporcionó la etiqueta de advertencia: las formas compatibles pueden fallar, los promedios amplios pueden ocultar un colapso de tarea y la latencia publicada no es la latencia de la aplicación. El próximo hito creíble no es un titular de aceleración mayor. Es una integración de producción versionada que publique la aceptación a nivel de tarea, el coste completo de la transferencia y resultados seguros de respaldo para cada dirección.