Transfer Cache KV Lintas Model Cepat—dan Mengejutkan: Sangat Spesifik pada Pasangan

Peneliti NVIDIA melaporkan percepatan komponen 25× untuk satu pemetaan cache KV, sementara beberapa pasangan model lain kehilangan sebagian besar akurasi tugas model target.

Bagikan artikel ini

Peneliti NVIDIA melaporkan bahwa mapper linear dapat mengubah cache key-value sebuah model bahasa ke format yang diharapkan oleh kerabatnya yang lebih besar, sehingga menghindari lintasan kedua pada percakapan panjang. Dalam contoh latensi terbaik mereka, pemetaan cache 32.768 token dari Qwen3 14B ke Qwen3 32B membutuhkan 278 milidetik; menjalankan prefill model 32B membutuhkan 6.975 milidetik. Itu adalah kesenjangan terukur 25,1× pada tingkat komponen.

Itu bukan percepatan aplikasi 25×.

Preprint 4 Agustus hanya menguji model dense dengan full attention dalam tiga keluarga, dengan geometri key-value yang cocok. Dua dari enam pasangan kecil-ke-besar kehilangan sebagian besar akurasi benchmark target ketika menggunakan metode linear. Bahkan dua pasangan yang tampak berhasil pada rata-rata lima benchmark masing-masing hanya mempertahankan 18,2% dan 36,6% hasil GSM8K target. Eksperimen latensi juga mengecualikan satu bagian deployment end-to-end: mengirimkan cache yang telah dipetakan ke proses target.

Karena itu hasilnya spesifik pada pasangan, bukan sakelar fitur. Bentuk cache yang cocok memungkinkan eksperimen; itu tidak memprediksi apakah kualitas tugas akan bertahan.

Cache menghemat pekerjaan di dalam satu model

Model bahasa autoregresif menghasilkan teks satu token setiap kali. Sebelum loop tersebut dimulai, model memproses token input dalam tahap prefill. Setiap lapisan attention menulis tensor key dan value yang merepresentasikan konteks. Selama decode, model membaca tensor tersimpan itu alih-alih menghitung ulang setiap token sebelumnya pada setiap langkah.

Dokumentasi cache Hugging Face menjelaskan kasus biasa: cache dinamis, berukuran tetap, terkuantisasi, atau dioffload yang dimiliki satu model. Dokumentasi itu juga menunjukkan prefix caching, ketika satu model menghitung prompt bersama terlebih dahulu lalu menggunakannya ulang untuk beberapa kelanjutan.

Berpindah model mematahkan asumsi tersebut. Cache Qwen3 14B berisi representasi internal yang dihasilkan Qwen3 14B; Qwen3 32B mengharapkan representasinya sendiri. Router selalu dapat mengirim teks yang telah terkumpul ke model 32B dan membiarkannya melakukan prefill normal. Transfer lintas model mencoba mengganti pekerjaan itu dengan konversi yang dipelajari.

Penjelasan kami tentang vektor dan embedding mengembangkan ide dasarnya: koordinat hanya berguna relatif terhadap sistem representasi yang memberinya makna. Mapper adalah upaya menerjemahkan antara dua sistem yang berkaitan tanpa menjalankan ulang model yang biasanya menghasilkan koordinat target.

Beberapa sistem terkait menggunakan kata “transfer” untuk operasi yang berbeda:

Perbedaan antara prefix caching, offloading, transmisi cache, dan pemetaan lintas model

TeknikYang tetap samaYang berubahPertanyaan utama
Prefix cachingModel dan prefiksKelanjutan atau permintaanDapatkah token awal yang identik digunakan ulang?
Cache offloadingModel dan makna cacheLokasi memori atau presisiDapatkah tekanan memori ditukar dengan biaya pemindahan?
Transmisi cache KVTata letak cache yang kompatibelKomponen serving atau perangkatDapatkah cache yang sama mencapai decoder secara efisien?
Pemetaan lintas modelToken dan konteks yang dimaksudRepresentasi modelDapatkah cache target aproksimatif mempertahankan perilaku?

Panduan transmisi TensorRT-LLM NVIDIA, misalnya, memindahkan data cache dari fase konteks ke fase generasi dan menangani tata letak di konfigurasi tensor-parallel serta pipeline-parallel. Itu adalah infrastruktur serving, bukan bukti bahwa aproksimasi lintas model dari paper baru sudah terintegrasi atau siap produksi.

Mapper-nya sederhana; kontraknya tidak

Paper tersebut mendefinisikan pasangan KV yang cocok sebagai dua model dengan jumlah kepala KV yang sama dan dimensi per kepala yang sama. Eksperimennya juga tetap dalam satu keluarga model, ketika sumber dan target berbagi tokenizer, serta menggunakan full attention dense. Kedalaman model dan jumlah parameter total boleh berbeda.

Untuk setiap layer target dan kepala attention, metode ini memilih layer sumber yang paling baik memprediksi cache target. Metode ini menggabungkan fitur sumber k teratas dan menyelesaikan regresi ridge terpisah untuk key serta value. Regresi ridge adalah fit linear dengan penalti kecil yang membantu menjaga kestabilan numerik solusi.

Key juga memuat rotary position embeddings, atau RoPE: rotasi yang bergantung pada posisi dan memberi tahu attention tempat token berada dalam urutan. Mapper membalik rotasi sumber, melakukan fit di ruang yang bebas posisi tersebut, lalu menerapkan rotasi target setelahnya. Value tidak membawa RoPE dan dipetakan secara langsung.

Peneliti mem-fit setiap pasangan dengan 500 sekuens FineWeb-Edu berisi 1.024 token. Bergantung pada pasangan, mapper yang dihasilkan berisi 1,01 miliar hingga 3,36 miliar parameter dan menempati 4–12 GB dalam konfigurasi paper. Fit memerlukan sekitar 47–87 menit pada satu node berisi delapan H100. Setiap arah terpisah, jadi artefak 14B-ke-32B tidak dapat diasumsikan bekerja secara terbalik.

Tidak satu pun detail itu merupakan ambang deployment. Paper menggunakan satu domain kalibrasi, memilih k sebagian berdasarkan benchmark yang kemudian dilaporkan, tidak menguji pasangan KV yang tidak cocok, serta tidak mencakup transfer lintas keluarga atau hybrid-attention. Revisi model juga dapat mengubah representasi yang diharapkan mapper yang telah di-fit, meskipun nama pemasarannya tetap sama.

Karena itu, unit persetujuan yang benar adalah tuple yang tepat:

revisi sumber → revisi target + tokenizer + arah + artefak mapper + evaluasi workload

Rata-rata akurasi menyembunyikan kegagalan yang menentukan

Paper melaporkan retensi mentah sebagai akurasi cache terpetakan dibagi akurasi prefill normal model target. Paper juga melaporkan retensi yang dinormalisasi terhadap floor, yang menetapkan skor peluang benchmark menjadi nol. Angka kedua penting: retensi mentah dapat membuat hasil yang dekat dengan atau di bawah peluang tampak tidak terlalu parah.

Enam pasangan kecil-ke-besar itu tidak membentuk satu kelas yang andal:

Retensi akurasi yang dilaporkan paper untuk enam pemetaan cache KV lintas model

Sumber → targetRata-rata lima tugasRata-rata dinormalisasi floorRetensi GSM8K
Qwen3 14B → 32B97,6%96,3%95,6%
Qwen3 8B → 32B87,5%80,7%68,8%
Llama 3.1 8B → 70B72,8%62,9%18,2%
Ministral 3B → 8B76,2%65,9%36,6%
Ministral 3B → 14B44,2%14,7%3,2%
Ministral 8B → 14B41,6%11,1%1,6%

GSM8K adalah benchmark generasi matematika chain-of-thought dalam studi tersebut; empat tugas lain dalam rata-rata itu adalah evaluasi bergaya klasifikasi. Rata-rata lima tugas pasangan Llama adalah 72,8%, tetapi skor GSM8K terpetakannya 14,78 dibandingkan 81,12 milik target. Itu tidak membuktikan bahwa setiap workload penalaran akan gagal. Itu membuktikan bahwa rata-rata yang didominasi bentuk tugas lain tidak dapat menjadi dasar menerima mapper untuk penalaran matematika, penggunaan tool, coding, atau aplikasi di balik router produksi.

Dua pemetaan linear Ministral-ke-14B gagal jauh lebih luas. Mapper nonlinier dua hidden layer memulihkan 24,3 dan 36,8 poin persentase retensi HellaSwag untuk pasangan tersebut, tetapi juga mengganti keunggulan closed-form dan bebas-gradien paper dengan model terlatih. “Gunakan mapper yang lebih besar” adalah sistem baru yang harus dievaluasi, bukan perbaikan otomatis.

Hasil multi-turn studi tersebut memerlukan batas yang sama. Studi menguji Qwen3 14B dan 32B pada 100 percakapan CoQA selama sepuluh turn. Drift tetap kecil pada satu pasangan dan tugas tersebut. Laporan VentureBeat 21 Agustus memberi perhatian berguna pada penggunaan sesi panjang, tetapi bahasanya yang lebih kuat tentang pembuktian bahwa sistem tidak akan mengalami kegagalan berantai melampaui eksperimen itu. Sepuluh turn pada satu pasangan yang kompatibel tidak dapat menjamin model, tugas, atau panjang sesi lain.

Hitung ulang hasil 25× di sekitar seluruh handoff

Pada 32.768 token, hasil Qwen3 14B-ke-32B mendukung perhitungan lokal-paper berikut:

reported avoided prefill = target re-prefill - mapper application
                           = 6,975 ms - 278 ms
                           = 6,697 ms

Pengukuran menggunakan satu node delapan H100 dengan NVLink, forward pass bfloat16, 50 warmup, dan 30 uji waktu per sel. Re-prefill menjalankan tubuh transformer target dengan FlashAttention 2 dan mengecualikan language-model head. Waktu mapper mencakup transfer lintas GPU yang diperlukan untuk memindahkan cache sumber ke target, tetapi penulis mengatakan sistem end-to-end juga perlu mengirimkan cache terpetakan ke proses target, dan itu tidak mereka ukur.

Hasil handoff yang lengkap seharusnya justru:

net handoff saving
  = normal target prefill
  - mapper application
  - source/cache transport not already included
  - mapped-cache delivery
  - amortized artifact loading
  - rejected-transfer and fallback penalty

Distribusi menurut panjang konteks dan konkurensi penting, begitu juga biaya per handoff yang diterima, termasuk fitting mapper, penyimpanan artefak, pemetaan yang gagal, perbandingan shadow, dan prefill fallback. Hasil komponen 25× tetap dapat bernilai, tetapi hanya jika penghematan itu bertahan ketika berhadapan dengan topologi serving.

Penyebut itu mengikuti disiplin yang sama seperti evaluasi biaya per tugas yang diterima: pekerjaan yang ditolak dan percobaan ulang tetap mengonsumsi sumber daya. Analisis perkalian matriks AlphaEvolve memberi pelajaran sistem yang lebih luas—operasi yang ditingkatkan hanya penting ketika cukup besar dalam workload nyata untuk mengubah hasil seluruh sistem.

Transfer cache KV lintas model adalah hasil yang menjanjikan justru karena pekerjaan yang dihindari itu konkret. Paper memetakan cache target jauh lebih cepat daripada menghitungnya ulang, dan mempertahankan perilaku pada beberapa pasangan. Paper juga memasok label peringatan: bentuk yang kompatibel dapat gagal, rata-rata luas dapat menyembunyikan keruntuhan tugas, dan latensi yang dipublikasikan bukanlah latensi aplikasi. Tonggak kredibel berikutnya bukan judul percepatan yang lebih besar. Tonggak itu adalah integrasi produksi berversi yang mempublikasikan penerimaan tingkat tugas, biaya handoff lengkap, dan hasil fallback aman untuk setiap arah.

Sumber

  1. Cross-Model KV Cache Transfer in LLM Families preprint
  2. VentureBeat analysis of cross-model KV-cache transfer
  3. Hugging Face Transformers cache strategies
  4. NVIDIA TensorRT-LLM KV-cache transmission guide