Transfer Cache KV Lintas Model Cepat—dan Mengejutkan: Sangat Spesifik pada Pasangan
Peneliti NVIDIA melaporkan percepatan komponen 25× untuk satu pemetaan cache KV, sementara beberapa pasangan model lain kehilangan sebagian besar akurasi tugas model target.