Harga Token Grok 4.6 yang Rendah Tidak Membuatnya Menjadi Model Termurah

Grok 4.6 menggabungkan harga utama yang rendah dengan benchmark yang dilaporkan kuat, tetapi retry, tugas gagal, latensi, dan biaya tool dapat membalikkan keunggulan yang tampak.

Bagikan artikel ini

SpaceXAI merilis Grok 4.6 dengan harga API mulai dari $2 per satu juta token input dan $6 per satu juta token output. Artificial Analysis secara independen menempatkan versi high-reasoning di frontier cost-performance-nya. Tidak satu pun fakta itu menjawab pertanyaan yang sebenarnya dimiliki tim development: apakah Grok 4.6 akan menyelesaikan pekerjaan kami dengan biaya lebih rendah?

Cara yang andal untuk memutuskannya adalah menjalankan tugas representatif yang sama melalui setiap kandidat, menerapkan aturan penerimaan lulus-gagal, dan membagi tagihan penuh—termasuk percobaan gagal dan retry—dengan jumlah hasil yang diterima. Harga token adalah input untuk perhitungan itu, bukan kesimpulannya.

Bukti yang dipublikasikan tidak menetapkan bahwa Grok 4.6 secara universal lebih murah daripada GPT-5.6 Sol untuk coding. Grok 4.6 memiliki harga token terdaftar yang lebih rendah, dan Artificial Analysis mengukur efisiensi biaya yang kuat dalam suite-nya sendiri. Namun, perbandingan yang adil memerlukan tugas repositori, harness agen, pengaturan reasoning, tool, kebijakan retry, dan grader yang sama untuk kedua model. Harga lebih rendah dapat hilang jika model menulis lebih banyak token, lebih sering gagal, atau memerlukan lebih banyak perbaikan manusia.

Apa yang sebenarnya dikatakan benchmark Grok 4.6

Pengumuman Grok 4.6 mengatakan model ini berfokus pada agen yang berjalan lama, coding, dan pekerjaan pengetahuan. Pengumuman itu melaporkan skor 61 pada Artificial Analysis Intelligence Index, skor utama yang sama dengan GPT-5.6 Sol dalam perbandingan SpaceXAI. Axios menggambarkan hasil tersebut sebagai kembalinya SpaceXAI mendekati frontier model.

Skor gabungan menyembunyikan variasi yang berarti. Tabel peluncuran SpaceXAI sendiri melaporkan hasil berikut, dengan pemilik benchmark dan harness agen yang berbeda di baliknya:

Hasil benchmark Grok 4.6 dan GPT-5.6 Sol yang dipilih dan dilaporkan vendor
Benchmark Grok 4.6 high GPT-5.6 Sol max Hal yang diperingatkan oleh perbedaan
CursorBench 3.2 69.9% 67.2% Satu distribusi tugas bergaya IDE mengunggulkan Grok dalam tabel ini.
DeepSWE 1.1 65.9% 73.0% Pengujian software engineering yang berbeda membalik urutannya.
Terminal-Bench 3.0 26.0% 34.6% Skor gabungan maupun harga token tidak memprediksi keberhasilan tugas terminal.

Ini adalah hasil yang disajikan vendor, bukan satu kali perbandingan terkontrol yang dijalankan untuk artikel ini. Model card Grok 4.6 mengidentifikasi versi benchmark, thinking effort, dan evaluator atau harness eksternal. SpaceXAI juga mencatat bahwa angka kompetitor dapat berasal dari model card yang dipublikasikan developer atau leaderboard publik. Itu membuat tabel ini berguna untuk memilih pengujian, tetapi bukan eksperimen harga-performa yang bersih dengan sendirinya.

Artificial Analysis menyediakan pandangan independen kedua. Dalam penyegaran bukti pada 21 Agustus 2026, analisis Grok 4.6 mereka melaporkan skor Intelligence Index 61 dan biaya berbobot sekitar $0.84 per tugas indeks. Halaman model dan penyedia langsung mereka juga melaporkan sekitar 65,8 token output per detik dan 51,53 detik hingga token pertama melalui endpoint SpaceXAI yang diukur. Pengukuran langsung ini dapat berubah saat penyedia dan infrastruktur berubah.

Angka $0.84 bukan biaya per tugas sukses pada workload Anda. Metodologi Artificial Analysis menggabungkan sembilan evaluasi berbahasa Inggris dan hanya teks, memberi bobot 34% pada agen dan 24% pada coding, serta umumnya menggunakan penilaian pass-at-one. Metrik biayanya menggunakan jumlah token yang dilaporkan penyedia dan bobot benchmark suite. Ini adalah perbandingan terstandardisasi yang berguna, tetapi campuran tugas, grader, lingkungan tool, dan perilaku retry-nya mungkin tidak cocok dengan agen coding produksi.

Jadwal harga lengkap mengubah angka utama

Halaman model SpaceXAI saat ini mencantumkan $2 per satu juta token input, $0.50 per satu juta token input yang di-cache, dan $6 per satu juta token output untuk Grok 4.6. Release notes menyatakan permintaan di atas 200.000 token prompt menggunakan tarif lebih tinggi, masing-masing $4, $1, dan $12.

Panduan API Grok 4.6 mencantumkan context window 500.000 token dan reasoning effort low, medium, high, serta xhigh, dengan high sebagai default. Panduan itu juga merekomendasikan key prompt-cache yang stabil karena percakapan yang dirutekan ke server tanpa cache dapat membayar tarif input penuh.

Setidaknya ada enam variabel biaya sebelum integrasi dan waktu staf:

  • token input tanpa cache;
  • token input yang di-cache dan cache-hit rate yang diamati;
  • token output dan reasoning tersembunyi yang ditagihkan penyedia;
  • tarif lebih tinggi untuk prompt di atas 200.000 token;
  • panggilan gagal, jawaban ditolak, dan retry; serta
  • tool atau layanan penyedia dengan biaya terpisah.

Catat usage penagihan yang dikembalikan API. Mengestimasi setiap penyedia dengan satu tokenizer dapat membuat perbandingan terlihat konsisten, sekaligus tidak cocok dengan invoice.

Keberhasilan menentukan apakah harga rendah itu penting

Pilih 20–50 tugas yang diambil dari pekerjaan yang benar-benar dilakukan tim. Jangan membuat set pengujian hanya dari kekuatan peluncuran sebuah model. Evaluasi agen coding kecil dapat menggunakan empat keluarga tugas:

Contoh keluarga tugas evaluasi model berbasis workload dan gate penerimaannya
Keluarga tugas Tugas tetap Gerbang penerimaan
Perbaikan kode Perbaiki defect yang sengaja ditanam di repositori kecil dengan tool dan batas waktu yang sama. Test target lulus, suite lengkap tidak mengalami regresi, dan diff tetap dalam scope.
Navigasi repositori Temukan modul yang bertanggung jawab atas suatu perilaku dan jelaskan call path-nya. File dan relasi yang disebut cocok dengan jawaban referensi yang diverifikasi maintainer.
Penggunaan tool terstruktur Query fixture API dan kembalikan schema JSON yang diwajibkan. Semua pemanggilan tool wajib selesai dan validasi schema lulus.
Pekerjaan pengetahuan konteks panjang Jawab pertanyaan keputusan dari paket dokumen berversi. Setiap klaim yang memiliki konsekuensi didukung oleh dokumen yang disediakan.

Bekukan setiap prompt, commit repositori, fixture, definisi tool, grader, dan batas waktu sebelum run pertama. Gunakan keputusan penerimaan biner untuk perhitungan biaya, meskipun rubrik yang lebih terperinci membantu mendiagnosis kegagalan. Jika test penting gagal atau sitasi dibuat-buat, jawaban yang rapi tetap bukan tugas yang diterima.

Jalankan kandidat dalam urutan acak atau bergantian agar perlambatan penyedia sementara tidak hanya memengaruhi satu model. Ulangi cukup banyak tugas untuk menyingkap variasi, dan laporkan confidence interval jika sampel mendukungnya. Dengan sampel yang sangat kecil, publikasikan hitungan mentah dan sebut hasilnya directional.

Biaya per tugas yang diterima mencakup percobaan yang ditolak

Untuk setiap percobaan API, hitung tagihan penyedia dari usage yang dicatat:

attempt cost = (uncached input × input rate + cached input × cache rate + output × output rate) / 1,000,000 + separate tool charges

Kemudian masukkan setiap percobaan ke numerator:

cost per accepted task = total cost of first attempts and retries / accepted tasks

Misalkan evaluasi 20 tugas melakukan 20 percobaan pertama dan me-retry enam hasil yang ditolak. Empat retry lulus, jadi 18 tugas diterima setelah 26 total panggilan. Jika panggilan tersebut berbiaya $3.60, angka yang berguna adalah $3.60 / 18 = $0.20 per accepted task. Membagi dengan 26 permintaan akan menjawab pertanyaan berbeda dan membuat kegagalan terlihat lebih murah.

Jaga tabel output tetap sederhana agar dapat diaudit:

Pengukuran yang perlu dilaporkan dalam perbandingan biaya per tugas yang diterima
Pengukuran Mengapa harus ada dalam hasil
Tugas diterima / total tugas Menunjukkan keberhasilan tugas tanpa menyembunyikan denominator.
Total pengeluaran API Menangkap campuran token aktual, perilaku cache, dan retry.
Biaya per tugas yang diterima Menghubungkan pengeluaran dengan pekerjaan yang selesai.
Penerimaan percobaan pertama dan tingkat retry Memisahkan run murah yang andal dari kegagalan murah berulang.
Waktu tugas median dan persentil ke-95 Mengekspos outlier lambat yang dapat disembunyikan rata-rata.
Menit review atau perbaikan manusia Mencegah penghematan API menutupi pekerjaan staf tambahan.
Token input, cache, reasoning, dan jawaban Menjelaskan mengapa tagihan berbeda dari tarif utama.
Kategori kegagalan Menunjukkan apakah error berasal dari reasoning, tool, format, limit, atau penyedia.

Artikel ini tidak menerbitkan perbandingan endpoint baru: tidak ada run Grok 4.6 versus kompetitor yang terkontrol untuk artikel ini. Contoh numerik di atas bersifat ilustratif, bukan hasil model yang diukur. Batas ini penting karena presisi yang dibuat-buat akan mengalahkan metode evaluasi yang direkomendasikan artikel.

Aturan keputusan praktis

Grok 4.6 layak menjalani uji coba spesifik workload ketika kekuatan yang dipublikasikannya beririsan dengan pekerjaan tim dan tim dapat menoleransi latensi endpoint yang diamati. Mulailah dengan satu reasoning effort tetap dan prompt di bawah ambang harga 200.000 token. Tambahkan konteks panjang, reasoning lebih dalam, dan tool sebagai eksperimen terpisah agar dampaknya tetap terlihat.

Adopsi model hanya ketika model tersebut menang pada ukuran yang dibutuhkan produk: pekerjaan diterima per dolar, pekerjaan diterima per menit, atau pekerjaan diterima per jam reviewer. Pertahankan keandalan, penanganan data, rate limit, ketersediaan regional, dan biaya migrasi sebagai kolom keputusan eksplisit, bukan mencoba memadatkannya menjadi satu skor benchmark.

Penjelasan evaluasi AI kami menjelaskan mengapa desain test membentuk perilaku produk. Analisis deployment lokal Qwen menerapkan prinsip yang sama pada hardware, memori, dan biaya operasi. Untuk Grok 4.6, hasil berguna berikutnya bukan screenshot leaderboard gabungan lainnya. Hasil itu adalah bukti bahwa tarif token yang lebih rendah bertahan terhadap retry, kegagalan, latensi, dan invoice untuk hasil yang diterima.

Sumber

  1. SpaceXAI Grok 4.6 announcement
  2. Grok 4.6 model card
  3. SpaceXAI Grok 4.6 API documentation
  4. SpaceXAI Grok 4.6 model pricing
  5. SpaceXAI API release notes
  6. Artificial Analysis Grok 4.6 benchmark analysis
  7. Artificial Analysis Grok 4.6 model and provider results
  8. Artificial Analysis intelligence benchmarking methodology
  9. Axios on Grok 4.6 returning SpaceXAI to the model frontier