Qwen3.8-27B Bisa Berjalan di 16GB, tetapi Pengalaman Model Lengkap Tidak Bisa

Kuantisasi ringkas Qwen3.8-27B dapat berjalan pada GPU 16GB, sementara konteks panjang, visi, konkurensi, dan memori runtime membuat judul tersebut tidak lengkap.

Bagikan artikel ini

Qwen3.8-27B kini bukan hanya persoalan deployment lokal. Cloudflare menambahkan model ini ke Workers AI pada 17 Agustus, sehingga developer mendapat jalur hosted di samping weight Apache-2.0. Keputusan yang berguna sekarang adalah apakah kontrol dan ekonomi yang berpotensi lebih stabil dari inference lokal sepadan dengan biaya hardware dan pemeliharaan, dibandingkan usaha awal dan kapasitas terkelola yang lebih rendah dari jalur hosted.

Gunakan jalur hosted terlebih dahulu ketika permintaan belum pasti, konkurensi bersifat bursty, atau tim tidak dapat mengelola operasi GPU. Uji deployment lokal ketika workload stabil, model terkuantisasi lolos tugas yang representatif, dan mempertahankan eksekusi di infrastruktur tim sepadan dengan biaya hardware dan pemeliharaan. GPU 16GB dapat mendukung pengujian itu, tetapi tidak semua fitur yang diiklankan sekaligus.

Weight, cache konteks, buffer runtime, projector visi opsional, dan state speculative decoding semuanya berebut memori yang sama. File model yang lebih kecil daripada angka yang tercetak pada kotak GPU tetap dapat kehabisan memori—atau melimpahkan pekerjaan ke RAM sistem dan menjadi jauh lebih lambat.

Apa yang berubah karena jalur hosted Cloudflare

Saat diperiksa pada 26 Agustus 2026, Cloudflare mencantumkan @cf/qwen/qwen3.8-27b dengan visi, reasoning, function calling, dan context window 262,144 token. Halaman model dan tabel harga mencantumkan USD 0.45 per juta token input dan USD 3.20 per juta token output. Itu adalah ketentuan provider, bukan janji tentang latensi tugas, uptime, kapasitas efektif, atau harga hasil yang diterima.

Sebagai contoh, batch berisi satu juta token input dan 200,000 token output akan memiliki biaya model yang tercantum sebesar $0.45 + (0.2 × $3.20) = $1.09. Estimasi bulanan yang sebenarnya harus menggunakan campuran prompt workload dan memasukkan retry, token reasoning, tugas yang gagal, storage, gateway, serta layanan lain yang dikonsumsinya. Cloudflare juga mengukur alokasi gratis harian dalam Neurons dan mewajibkan paket Workers berbayar di atas alokasi itu, jadi aritmetika token tidak boleh disamakan dengan kelayakan akun atau prakiraan invoice.

Dokumentasi penggunaan data Cloudflare saat ini menyatakan bahwa konten pelanggan Workers AI tidak digunakan untuk melatih model yang tersedia atau meningkatkan layanan Cloudflare maupun pihak ketiga tanpa persetujuan eksplisit. Dokumen itu juga menyatakan bahwa konten dapat disimpan ketika pelanggan menggabungkan Workers AI dengan layanan storage seperti R2, KV, Durable Objects, atau Vectorize. Batas provider yang terdokumentasi ini lebih spesifik daripada menyebut jalur hosted sebagai “private”, dan tim tetap perlu meninjau perjanjian yang berlaku, jalur logging, konfigurasi storage, wilayah, serta kontrol akses.

Input keputusanJalur lokal 16GBJalur hosted CloudflareBukti yang perlu dikumpulkan
Pengujian berguna pertamaPasang runtime terbaru dan muat kuantisasi yang sesuaiPanggil model ID yang tercantum melalui Workers AIWaktu dari persetujuan hingga hasil yang dapat direproduksi
KapasitasDibatasi oleh weight, cache, buffer, offload, dan konkurensiProvider mengekspos batas konteks native, tetapi batas efektif dan latensi tetap bergantung pada workloadPrompt, output, dan beban pengguna konkuren representatif maksimum
Batas dataInput tetap berada di infrastruktur yang dikonfigurasi tim, kecuali tool atau telemetry mengirimkannya ke tempat lainTunduk pada pemrosesan, perjanjian, pilihan storage, log, dan konfigurasi akun yang didokumentasikan CloudflareCatatan aliran data yang mencakup prompt, output, log, tool, storage, dan operator
Biaya tunaiAmortisasi hardware, listrik, dan operasi, bukan invoice tokenTarif token input dan output yang tercantum plus layanan terkaitBiaya per tugas yang diterima, termasuk retry dan proses yang gagal
Pekerjaan reliabilitasTim memiliki tanggung jawab atas upgrade, monitoring, kapasitas, dan pemulihanProvider memiliki tanggung jawab atas penyajian model; tim tetap memiliki retry aplikasi, fallback, dan monitoring perubahanTingkat kegagalan, waktu pemulihan, catatan versi, dan perilaku fallback

Ini adalah gerbang routing, bukan pemenang universal. Tim juga dapat memulai dengan hosted, mengumpulkan jejak workload yang stabil, lalu menilai kembali eksekusi lokal setelah dapat mengukur memori dan ekonomi berdasarkan bukti.

Bisakah Qwen3.8-27B berjalan pada GPU 16GB?

Ya, dengan kuantisasi agresif seperti IQ4_XS atau varian 3-bit, context window yang sengaja dibatasi, dan runtime terbaru. Partial CPU offload juga dapat membuat file yang lebih besar berjalan, tetapi itu mengubah perhitungan kecepatannya.

Tidak, jika “berjalan” berarti mempertahankan weight berkualitas tinggi, context native lengkap 262,144 token, stack visi, dan beberapa request konkuren seluruhnya di dalam VRAM 16GB. Itu adalah klaim kapasitas yang terpisah.

Model card resmi Qwen menggambarkan model vision-language dense dengan 27 miliar parameter, thinking controls, pelatihan multi-token-prediction, dan context window native 262,144 token. Model card itu mencantumkan Transformers, vLLM, SGLang, dan TokenSpeed sebagai jalur deployment yang didukung. File GGUF yang umum digunakan dengan llama.cpp adalah konversi pihak ketiga yang dipublikasikan Unsloth, bukan distribusi resmi Qwen.

Perbedaan ini penting ketika melakukan troubleshooting: model, konversi, dan runtime adalah tiga komponen yang bergerak, jadi catat revisi persis yang diuji.

File weight hanyalah tagihan memori pertama

Berikut beberapa file dalam repositori GGUF Unsloth saat ini. Ukuran dihitung dari jumlah byte repositori dan ditampilkan dalam gibibyte (GiB), dengan 1 GiB = 1,073,741,824 bytes.

Ukuran file GGUF Qwen3.8-27B saat ini dan panduan deployment praktis
Target deployment Kuant GGUF Ukuran file Pembacaan praktis
16GB, headroom lebih besar UD-Q3_K_XL 12.24 GiB Menyisakan ruang nominal paling besar di sini, dengan tradeoff kuantisasi yang lebih besar untuk diuji pada tugas nyata.
16GB, eksperimen mengutamakan kualitas IQ4_XS 13.27 GiB Menyisakan sekitar 2.73 GiB sebelum cache, buffer, dan alokasi runtime lain.
16GB dengan offload Q4_K_M 15.33 GiB Menyisakan kurang dari 0.7 GiB untuk cache dan overhead runtime jika semua weight berada di GPU.
24GB, titik awal seimbang Q5_K_M 18.41 GiB Memberi lebih banyak ruang untuk cache dan state runtime sambil mempertahankan kuant bit lebih tinggi.
24GB, eksperimen mengutamakan kualitas Q6_K 20.47 GiB Masih hanya menyisakan sekitar 3.5 GiB sebelum runtime lainnya.

Ini adalah ukuran unduhan, bukan total VRAM yang terukur. Runtime dapat merepresentasikan atau men-stage tensor secara berbeda, mengalokasikan scratch buffer, dan menyimpan sebagian data di memori sistem. Jika input gambar diaktifkan, projector multimodal F16 dari repositori yang sama menambah sekitar 0.86 GiB sebelum alokasi pemrosesan gambar.

Kesimpulan penting untuk 16GB bukan “IQ4_XS muat”. Kesimpulannya adalah “IQ4_XS menyisakan anggaran memori yang sempit dan harus diuji dengan konteks, backend, serta workload yang dituju.”

Panjang konteks adalah biaya tersembunyi

KV cache menyimpan tensor key dan value dari token sebelumnya agar model tidak menghitung ulang seluruh percakapan untuk setiap token baru. Prompt dan output yang lebih panjang memerlukan cache yang lebih besar.

Qwen3.8-27B menggunakan arsitektur hybrid: konfigurasi yang dipublikasikan memiliki 64 layer, dengan satu layer full-attention setelah setiap tiga layer linear-attention. Estimasi sederhana untuk bagian full-attention dari cache FP16 adalah:

16 attention layers × 4 KV heads × 256 dimensions × key and value × 2 bytes = 65,536 bytes per token

Itu kira-kira 64 KiB per token sebelum overhead allocator, buffer runtime, dan state yang digunakan layer lain. Mengkuantisasi cache ke 8 atau 4 bit mengurangi komponen ini kira-kira sebanding dengan lebar bit, dengan sedikit overhead format.

Perkiraan ukuran attention KV cache berdasarkan konteks yang dikonfigurasi dan presisi cache
Konteks terkonfigurasi KV attention FP16 KV 8-bit kira-kira KV 4-bit kira-kira
8,192 token 0.5 GiB 0.25 GiB 0.125 GiB
16,384 token 1 GiB 0.5 GiB 0.25 GiB
32,768 token 2 GiB 1 GiB 0.5 GiB
65,536 token 4 GiB 2 GiB 1 GiB
262,144 token 16 GiB 8 GiB 4 GiB

Ini adalah estimasi kapasitas yang transparan, bukan total terukur. Namun, estimasi ini menjelaskan mengapa klaim context window native tidak berubah menjadi janji deployment 16GB: attention cache FP16 yang disederhanakan saja mencapai sekitar 16 GiB pada 262,144 token, sebelum weight model dimuat.

Ini juga menjelaskan mengapa benchmark pada 512 token hanya sedikit memberi tahu kita tentang coding agent yang mengumpulkan puluhan ribu token melalui tool call.

Apa yang dibuktikan hasil kuantisasi awal—dan apa yang tidak

Satu benchmark komunitas pada RTX 5060 Ti 16GB membandingkan GGUF Unsloth dengan tool perplexity llama.cpp pada test set WikiText-2. Benchmark itu mempertahankan konteks pada 512 token dan menggunakan cache KV FP16. Penulis melaporkan perplexity 6.9557 untuk Q8_0, 6.9576 untuk Q4_K_M, 7.0130 untuk IQ4_XS, dan 7.1113 untuk UD-Q3_K_XL; lebih rendah lebih baik dalam pengujian itu. File Q8 sebagian di-offload ke CPU.

Itu adalah bukti berguna tentang bagaimana konversi tertentu ini mempertahankan probabilitas next-token pada satu korpus teks. Itu bukan pengukuran untuk:

  • ketepatan coding, penggunaan tool, pemahaman gambar, atau instruction following;
  • kecepatan pemrosesan prompt, kecepatan generasi, konsumsi daya, atau waktu menyelesaikan tugas;
  • penggunaan memori pada konteks 16K, 32K, atau yang lebih panjang;
  • kualitas pada GPU, driver, backend, atau revisi konversi yang berbeda.

“Persentase kualitas” dari penulis benchmark adalah rasio yang diturunkan dari perplexity, bukan persentase kemampuan yang terlihat manusia dan masih dipertahankan. Selisih kecil Q4_K_M terhadap Q8 patut diharapkan, tetapi tidak membuktikan bahwa setiap workload tidak sensitif terhadap kuantisasi.

Evaluasi independen memberikan sinyal yang berbeda. Artificial Analysis saat ini memberi Qwen3.8-27B Intelligence Index sekitar 52. Metodologi saat ini menggabungkan sembilan evaluasi berbahasa Inggris dan hanya berbasis teks, serta memberi bobot tugas agent lebih besar daripada tugas umum. Ini mendukung anggapan bahwa model tersebut layak diperhatikan, tetapi tetap tidak memprediksi throughput atau acceptance rate di mesin Anda.

Laporan independen VentureBeat menjelaskan kuantisasi Q4_K_M sekitar 17GB yang menjalankan tugas coding, gambar, dan agent pada Apple M5 Max MacBook Pro serta Nvidia DGX Spark. Laporan itu juga mencatat 15–30 token per detik dalam penggunaan LM Studio biasa dan contoh 21 menit dengan 22,000 token reasoning pada pengaturan default xhigh. Observasi tersebut menunjukkan bahwa operasi lokal yang berguna memang nyata dan overhead reasoning dapat mendominasinya; hasilnya tidak bisa langsung dialihkan ke kartu Nvidia 16GB atau runtime lain.

Untuk artikel ini, pengujian GPU 16GB tidak direproduksi secara independen: mesin yang tersedia memiliki GPU Apple M1 Pro, bukan NVIDIA dalam kelas target. Hasil yang spesifik hardware di atas tetap secara eksplisit dilaporkan oleh komunitas.

Konfigurasi awal 16GB yang masuk akal

Mulailah dengan teks saja, konteks 16K, satu request pada satu waktu, dan IQ4_XS atau UD-Q3_K_XL. Jangan mengaktifkan projector visi atau speculative decoding multi-token sampai baseline stabil.

Dengan build llama.cpp terbaru, eksperimen awal dapat terlihat seperti ini:

llama-server \
  -hf unsloth/Qwen3.8-27B-GGUF:IQ4_XS \
  --no-mmproj \
  -c 16384 \
  -ngl all \
  -ctk q8_0 \
  -ctv q8_0 \
  -fa on \
  --jinja

Referensi server llama.cpp mendokumentasikan flag konteks, layer GPU, cache KV, Flash Attention, dan multimodal. Periksa log startup alih-alih menganggap setting yang diminta berhasil: catat total VRAM, berapa layer yang ditempatkan di GPU, alokasi konteks aktual, dan apakah tensor di-offload.

Jika alokasi gagal, kurangi konteks ke 8K sebelum mengubah beberapa variabel sekaligus. Jika masih gagal, pindah ke file 3-bit atau sengaja offload layer dan terima biaya CPU serta bandwidth memori yang dihasilkan. Setelah baseline teks berhasil, uji satu perubahan pada satu waktu: konteks lebih panjang, visi, speculative decoding, atau konkurensi.

Ini adalah baseline yang berorientasi kapasitas, bukan konfigurasi terbaik universal. Dukungan backend dan performa berubah cepat, dan model card sendiri merekomendasikan versi framework terbaru.

Biaya pekerjaan selesai lebih besar daripada yang terlihat dari token per detik

Inference lokal tidak memiliki invoice per token, tetapi bukan berarti gratis. Perbandingan yang berguna dengan API hosted mencakup:

Pengukuran untuk membandingkan inference lokal Qwen3.8-27B dengan API hosted
Ukuran Yang dicatat Mengapa mengubah keputusan
Kualitas tugas Pass rate pada 20–50 tugas representatif, edit manusia, retry Proses gagal yang lebih murah justru menciptakan lebih banyak pekerjaan.
Latensi Waktu pemrosesan prompt, time to first token, kecepatan decode, waktu tugas end-to-end Konteks panjang dapat membuat demo responsif terasa lambat dalam produksi.
Kapasitas Puncak VRAM dan RAM pada konteks normal serta worst-case Mencegah prompt pendek yang berhasil menjadi rencana deployment.
Energi Daya dinding rata-rata × durasi tugas × tarif listrik lokal Mengubah konsumsi daya menjadi biaya per tugas atau bulanan yang dapat dibandingkan.
Operasi Setup, upgrade, job gagal, monitoring, backup, dan waktu insiden Pemeliharaan dapat mendominasi ekonomi tim kecil.
Konkurensi Throughput dan tail latency dengan jumlah pengguna sebenarnya Hasil workstation satu pengguna tidak menentukan ukuran shared service.
Batas data Apa yang meninggalkan mesin, apa yang dicatat, dan siapa yang dapat mengaksesnya Privasi dan kontrol dapat membenarkan operasi lokal meski biaya tunainya bukan yang terendah.

Gunakan prompt, definisi tool, batas output, dan kriteria kelulusan yang sama untuk model lokal dan alternatif hosted. Sertakan mode thinking model dalam pengukuran: Qwen mengaktifkan thinking secara default dan mendukung reasoning effort low, medium, dan xhigh, sehingga panjang output dan perilaku retry dapat mengubah waktu serta energi per tugas selesai secara material.

Untuk perbandingan bulanan kasar, amortisasikan hardware baru selama periode ketika Anda benar-benar berharap menggunakannya, lalu tambahkan listrik dan waktu operator yang terukur. Bandingkan total itu dengan tagihan hosted untuk workload diterima yang sama. Jangan menganggap GPU yang sudah dimiliki sebagai gratis jika menghalangi pekerjaan lain, dan jangan membebankan seluruh harga belinya pada satu eksperimen jika GPU itu melayani beberapa workload.

Setiap perbandingan lokal-versus-hosted berubah makna jika salah satu jalur menerima input yang lebih mudah, konteks lebih pendek, retry lebih sedikit, atau setting reasoning berbeda. Tidak adanya invoice token lokal juga menyembunyikan penggunaan hardware, listrik, waktu operator, dan opportunity cost karena GPU ditempati.

Kartu 16GB adalah platform evaluasi, bukan janji lengkap

GPU 16GB adalah platform evaluasi yang wajar untuk Qwen3.8-27B jika Anda nyaman dengan kuant 3-bit atau 4-bit ringkas, konteks lebih pendek, satu pengguna aktif, dan kemungkinan CPU offload. GPU itu menjadi dasar yang buruk untuk menjanjikan konteks native lengkap model, visi, konkurensi tinggi, dan eksekusi yang konsisten sepenuhnya berada di GPU.

Kartu 24GB memberi deployment lebih banyak ruang dan akses ke kuant bit lebih tinggi, tetapi tidak menghapus kebutuhan untuk menganggarkan cache atau melakukan benchmark pada tugas nyata. VRAM lebih besar memperbaiki konfigurasi yang layak; itu tidak mengubah skor model agregat menjadi jaminan level layanan.

Jika tujuannya adalah coding offline, workflow dokumen terkontrol, atau tugas volume tinggi yang stabil dan dilalui model terkuantisasi dengan andal, deployment lokal mungkin menarik. Jika permintaan belum pasti atau kapasitas terkelola dan pemeliharaan penyajian model minimal lebih penting, jalur hosted adalah baseline yang lebih cepat—tetapi harga token yang tercantum baru bermakna setelah tim mengukur pekerjaan yang diterima.

Analisis pemilihan model Hugging Face menjelaskan mengapa popularitas tidak dapat menggantikan lisensi, provenance, kompatibilitas, dan kecocokan tugas. Analisis stable-versus-nightly llama.cpp kami menambahkan perbedaan versi serving, sementara penjelasan AI evaluation menghubungkan benchmark dengan pilihan produk yang dapat didukungnya (bahasa Inggris).

Untuk Qwen3.8-27B, bukti berguna berikutnya bukan screenshot lain tentang “muat di 16GB” atau harga provider yang disalin ke spreadsheet. Bukti itu adalah satu workload yang dijalankan melalui kedua jalur, dengan konteks, cache, offload, reasoning, latensi, kegagalan, penanganan data, usaha operator, dan biaya per tugas diterima dipublikasikan bersama.

Sumber

  1. Qwen3.8-27B official model card
  2. Qwen3.8-27B model configuration
  3. Unsloth Qwen3.8-27B GGUF files
  4. Community Qwen3.8-27B quantization benchmark
  5. Artificial Analysis evaluation of Qwen3.8-27B
  6. Artificial Analysis intelligence benchmarking methodology
  7. llama.cpp server documentation
  8. Cloudflare Workers AI Qwen3.8-27B release
  9. Cloudflare Workers AI Qwen3.8-27B model page
  10. Cloudflare Workers AI pricing
  11. Cloudflare Workers AI data usage
  12. VentureBeat Qwen3.8-27B local deployment report