La transferencia de caché KV entre modelos es rápida y sorprendentemente específica de cada pareja
Investigadores de NVIDIA informan de una aceleración de 25× a nivel de componente para una asignación de caché KV, mientras que otras parejas de modelos perdieron gran parte de la exactitud de tarea del modelo objetivo.