Gemini 3.7 Flash Naik Dua Kali Lipat, tetapi Penalaran Lebih Tinggi Tetap Bisa Lebih Murah

Harga Gemini 3.7 Flash naik pada Januari 2027, sedangkan tingkat penalaran termurah tetap bergantung pada penerimaan, retry, latensi, dan biaya fallback.

Bagikan artikel ini

Google telah membuat Gemini 3.7 Flash tersedia secara umum dengan tiga tingkat penalaran—low, medium, dan high—yang menukar penggunaan token dan latensi dengan perilaku penalaran yang berbeda. Google juga telah menetapkan jadwal harga untuk model tersebut. Tarif API global standar adalah 0.75perjutatokeninputdan0.75 per juta token input dan 3.75 per juta token output hingga 31 Desember 2026, lalu menjadi dua kali lipat pada 1 Januari.

Itu tetap tidak membuat low menjadi pilihan murah atau high menjadi pilihan mahal. Perbandingan yang berguna adalah total pengeluaran dibagi tugas yang diterima, setelah menghitung percobaan yang ditolak, retry, pekerjaan fallback, dan waktu yang berlalu. Tingkat yang biayanya lebih tinggi per panggilan dapat berbiaya lebih rendah per hasil yang dapat digunakan jika lebih sering melewati tes penerimaan eksternal yang sama.

Kalkulator di bawah ini menerapkan dua periode harga yang dipublikasikan Google pada pengukuran dari workload pembaca. Angka default-nya fiktif dan tidak mewakili benchmark Gemini.

Harga berlipat ganda; keputusan tidak menjadi lebih sederhana

Panduan developer Gemini 3.7 Flash dari Google mencantumkan gemini-3.7-flash sebagai model yang siap produksi dengan context window satu juta token, output maksimum 64.000 token, dan medium sebagai tingkat penalaran default. Google mendeskripsikan low sebagai pengaturan yang berorientasi pada latensi, medium sebagai default umum, dan high sebagai opsi untuk penalaran yang lebih sulit serta penggunaan tool dengan konsumsi dan biaya token yang lebih besar.

Deskripsi tersebut adalah hipotesis awal, bukan policy routing. “Sulit” bukan field API, dan jawaban yang terdengar yakin belum tentu diterima. Tim tetap harus mendefinisikan keberhasilan di luar model—misalnya tes lulus, skema yang diwajibkan tervalidasi, sitasi mendukung setiap klaim material, atau jawaban cocok dengan referensi yang disetujui manusia.

Rate card Google Cloud membuat perubahan biaya bertanggal untuk layanan global standar menjadi eksplisit:

Periode hargaInput per 1 juta tokenOutput teks dan penalaran per 1 juta token
Hingga 31 Desember 2026$0.75$3.75
Mulai 1 Januari 2027$1.50$7.50

Halaman yang sama mencantumkan tarif terpisah untuk non-global, input yang di-cache, prioritas, dan layanan flex/batch. Kalkulator sengaja mengecualikan varian tersebut agar tidak diam-diam mencampur layanan yang berbeda. Kalkulator juga memperlakukan token output dan token penalaran yang ditagihkan sebagai satu kesatuan, sesuai kategori harga Google.

Biaya per tugas yang diterima mengubah pemenang yang tampak

Jalankan satu set tugas beku pada setiap tingkat penalaran, lalu masukkan rata-rata agregat atau rata-rata per percobaan. “Percobaan” mencakup retry; “tugas yang diterima” hanya menghitung hasil yang melewati aturan yang ditulis sebelum pengujian. Biaya fallback dapat mewakili panggilan model lain, jalur pemulihan deterministik, atau biaya perbaikan yang diestimasi secara terpisah, tetapi definisi yang sama harus digunakan untuk ketiga tingkat.

Kalkulator beban kerja

Bandingkan tingkat penalaran berdasarkan pekerjaan yang diterima

Ganti nilai bawaan fiktif dengan pengukuran dari set tugas beku yang sama. Token keluaran harus mencakup token penalaran yang ditagihkan. Latensi diperlakukan sebagai waktu berlalu serial; kalkulator tidak memodelkan konkurensi.

Rendah penalaran
Sedang penalaran
Tinggi penalaran

Menampilkan contoh fiktif. Masukkan data beban kerja terukur Anda sebelum membuat keputusan deployment.

Harga global standar Gemini 3.7 Flash, diverifikasi 24 Agustus 2026. Tarif saat ini berakhir 31 Desember 2026.
PenalaranDiterima / percobaanBeban penolakanAPI saat ini / diterimaAPI Jan. / diterimaAPI saat ini + fallback / diterimaMenit serial / diterima
Rendah78 / 10028.2%US$0,00673US$0,01346US$0,020830.32
Sedang88 / 10013.6%US$0,0081US$0,01619US$0,014910.51
Tinggi93 / 1007.5%US$0,01129US$0,02258US$0,015050.86

Termasuk: tarif global standar untuk masukan dan keluaran teks. Tidak termasuk: masukan cache, wilayah non-global, layanan prioritas atau flex/batch, alat, penyimpanan, jaringan, pajak, waktu staf, dan diskon khusus penyedia.

Perhitungan statisnya adalah:

API cost per attempt =
  (input tokens × input rate + output-and-reasoning tokens × output rate)
  / 1,000,000

API cost per accepted task =
  (API cost per attempt × all attempts) / accepted tasks

Effective cost per accepted task =
  (total API cost + rejected attempts × fallback cost) / accepted tasks

Serial minutes per accepted task =
  (minutes per attempt × all attempts) / accepted tasks

Untuk default fiktif tersebut, low menghasilkan 78 tugas yang diterima dari 100 percobaan, medium menghasilkan 88, dan high menghasilkan 93. Biaya API saat ini saja per tugas yang diterima kira-kira 0.00673,0.00673, 0.00810, dan 0.01129.Setelahbiayafallbackfiktif0.01129. Setelah biaya fallback fiktif 0.05 dibebankan pada setiap percobaan yang ditolak, totalnya menjadi sekitar 0.02083,0.02083, 0.01491, dan $0.01505. Dalam workload rekaan ini, medium menang tipis pada biaya efektif meskipun low memiliki tagihan token terkecil dan high menerima pekerjaan paling banyak.

Hasil itu bukan saran untuk memilih medium. Hasil itu menunjukkan mengapa harga token, tingkat penerimaan, dan biaya pemulihan harus berada dalam perhitungan yang sama.

Benchmark independen membantu memilih tes, bukan pemenang

Artificial Analysis menguji ketiga tingkat penalaran dan melaporkan skor indeks kecerdasan, waktu per tugas, kecepatan output, serta biaya per tugas yang berbeda. Pengaturan high mencetak skor di atas medium dan low dalam suite tersebut, sementara medium menggunakan lebih sedikit uang per tugas indeks daripada high pada tarif pengantar.

Hasil itu merupakan bukti berguna bahwa kontrol tersebut mengubah perilaku yang dapat diamati. Hasil itu tidak menyediakan tingkat penerimaan atau jumlah token untuk produk pembaca. Artificial Analysis menggunakan campuran benchmark, bobot, harness, dan grader miliknya sendiri. Workflow jawaban dukungan, agent perbaikan kode, extractor dokumen, dan sistem inspeksi multimodal dapat membalik urutannya karena cara mereka gagal berbeda.

Model card Gemini 3.7 Flash dari Google menetapkan batas yang serupa. Model card itu menyajikan evaluasi di bidang penalaran, coding, penggunaan tool agentik, tugas multimodal, performa multibahasa, dan konteks panjang, sambil mengidentifikasi model tersebut cocok untuk beberapa use case luas. Tabel benchmark mendukung rencana pengujian; tabel itu tidak menetapkan fitness produksi untuk workload yang belum diuji.

Tingkat penalaran mengubah kualitas sekaligus tagihan

Dalam perbandingan pertama, ubah hanya thinking_level. Pertahankan ID model yang persis, prompt, fixture, definisi tool, konteks, output maksimum, aturan retry, region, konkurensi, timeout, dan grader penerimaan. Catat penggunaan yang dilaporkan API alih-alih mengestimasi semua tingkat dengan tokenizer generik.

Gunakan tugas yang diambil dari pekerjaan nyata, termasuk kasus biasa dan kegagalan mahal. Jalankan tingkat-tingkat tersebut dalam urutan acak atau bergantian agar perlambatan provider yang singkat tidak hanya memengaruhi satu kandidat. Publikasikan jumlah mentah yang diterima dan dicoba ketika sampel kecil; persentase tanpa denominator menyembunyikan ketidakpastian.

Latensi memerlukan disiplin yang sama. Kalkulator melaporkan menit serial per tugas yang diterima karena angka itu dapat diaudit dari lima input. Kalkulator tidak memprediksi sistem konkuren. Lacak setidaknya latensi median dan tail secara terpisah, karena satu tingkat penalaran dapat terlihat efisien secara rata-rata tetapi melewati deadline p95 produk.

Analisis biaya Grok 4.6 menjelaskan masalah denominator yang sama di antara model. Penjelasan evaluasi AI umum membahas mengapa metrik keberhasilan yang dipilih membentuk produk.

Titik impas harus bertahan saat tagihan datang

Untuk setiap tingkat penalaran, pertahankan empat kolom keputusan terpisah:

  • Biaya API per tugas yang diterima;
  • biaya efektif setelah fallback yang didefinisikan;
  • tugas yang diterima per menit yang berlalu; dan
  • menit review atau perbaikan manusia per tugas yang diterima.

Lalu pilih tingkat yang memenuhi gate kualitas dan latensi produk dengan biaya relevan terendah. Jika tidak ada tingkat yang melewati gate, jawabannya tidak otomatis “gunakan high”. Prompt, tool, dekomposisi tugas, model, atau fallback mungkin perlu diubah.

Hitung ulang sebelum 1 Januari 2027. Biaya API saja akan berlipat ganda berdasarkan jadwal global standar yang saat ini didokumentasikan, tetapi biaya efektif dapat naik kurang dari 100% ketika biaya fallback atau staf mendominasi. Sebaliknya, workflow dengan biaya pemulihan yang dapat diabaikan akan merasakan hampir seluruh perubahan tarif.

Jangan gunakan kalkulator sederhana ini untuk meramalkan invoice sampai token cache, mode layanan, region, tool, biaya jaringan, rate limit, error, diskon, pajak, dan konkurensi ditambahkan dari deployment nyata. Google juga dapat mengubah harga atau ketersediaan. Simpan URL rate card dan timestamp verifikasi bersama setiap keputusan.

Perubahan Januari adalah tenggat yang berguna karena mencegah harga promosi menjadi asumsi arsitektur yang tidak disadari. Hasil yang bertahan lama bukan tingkat penalaran favorit, melainkan workload beku, aturan lulus eksternal, serta bukti penagihan dan kegagalan yang cukup untuk menjalankan ulang keputusan ketika model atau harga berubah.

Sumber

  1. Google AI for Developers: What’s new in Gemini 3.7 Flash
  2. Google Cloud Agent Platform pricing
  3. Google DeepMind Gemini 3.7 Flash model card
  4. Artificial Analysis: Gemini 3.7 Flash on the intelligence versus time frontier