Pengurangan Biaya Kiro GPT-5.6 Terra Sebesar 82% Membutuhkan Denominator yang Lebih Besar

OpenAI dan AWS melaporkan bahwa GPT-5.6 Terra menyelesaikan tugas Terminal-Bench yang berhasil di Kiro dengan biaya sekitar 82% lebih rendah, tetapi pekerjaan repositori menambah review dan perbaikan.

Bagikan artikel ini

OpenAI menyatakan GPT-5.6 Terra menyelesaikan tugas Terminal-Bench 2.1 yang berhasil di Kiro dengan biaya sekitar 82% lebih rendah. Itu adalah hasil yang berguna dari model, lingkungan agen, dan benchmark yang disebutkan secara jelas. Namun, hasil ini bukan bukti bahwa tim engineering akan membelanjakan 82% lebih sedikit untuk menggabungkan perubahan yang andal di repositori mereka sendiri.

Jembatan yang hilang adalah pekerjaan di sekitar pemanggilan model. Coding agent dapat mengonsumsi lebih sedikit kredit tetapi tetap menciptakan pekerjaan yang lebih mahal jika maintainer harus memperbaiki patch-nya, menjalankan ulang siklus pengujian yang flaky, mengurai diff yang terlalu besar, atau me-rollback perubahan setelah deployment. Metrik keputusan seharusnya adalah total biaya per perubahan selesai yang melewati gate penerimaan engineering yang tetap—bukan hanya kredit, token, atau baris kode yang dihasilkan.

Tidak satu pun perusahaan menerbitkan detail tingkat tugas yang cukup dalam pengumuman tersebut untuk merekonstruksi angka 82% secara independen.

Hasil 82% lebih sempit daripada kesan yang diberikan pengumuman

Pengumuman partner OpenAI tanggal 24 Agustus menyatakan Sol, Terra, dan Luna dapat digunakan di seluruh workflow perencanaan, implementasi, review, dan pengujian Kiro. Pengumuman tersebut mengaitkan hasil biaya dengan pengujian oleh OpenAI dan AWS: GPT-5.6 Terra menyelesaikan tugas Terminal-Bench 2.1 yang berhasil di Kiro dengan biaya sekitar 82% lebih rendah.

Pengumuman itu tidak menyebutkan baseline perbandingan, jumlah uji coba, versi Kiro, pengaturan model, timeout, kebijakan retry, biaya per tugas, atau apakah angka tersebut mencakup uji coba yang tidak berhasil. Pengumuman itu juga tidak menerbitkan trajectory yang menunjukkan perintah mana yang dijalankan atau berapa banyak koreksi yang dibuat agen. Tanpa detail tersebut, persentasenya adalah hasil harness yang dilaporkan vendor, bukan prakiraan yang dapat digunakan kembali.

Ketersediaan juga mendahului posting partner tersebut. Changelog peluncuran Kiro menetapkan rollout GPT-5.6 pertama pada 14 Juli. Pembaruan 31 Juli kemudian menurunkan multiplier kredit Kiro Terra dari 1,2x menjadi 1,0x dan Luna dari 0,6x menjadi 0,1x, sementara Sol tetap 2,4x. Karena itu, artikel OpenAI bulan Agustus menambahkan klaim performa dan framing kemitraan; artikel tersebut bukan penanda hari pertama pelanggan Kiro dapat memilih model-model tersebut.

Benchmark-nya sendiri berguna tetapi terbatas. Repositori Terminal-Bench 2.1 menjelaskan 89 tugas yang dijalankan dalam lingkungan container, termasuk pekerjaan debugging, keamanan, ilmiah, dan sistem. Submission ke leaderboard publik harus menjalankan setidaknya lima uji coba per tugas dan mengunggah data job. Terminal-Bench 2.1 juga memodifikasi tugas dari versi 2.0 untuk memperbaiki bug, timeout, batas sumber daya, dan kelemahan reward hacking.

Hal ini membuatnya menjadi pengujian serius untuk agen terminal. Namun, benchmark ini tidak mewakili codebase privat, standar review, jalur deployment, atau biaya pemeliharaan sebuah tim. Model, harness Kiro, container tugas, acceptance test, dan anggaran retry bersama-sama menghasilkan hasil tersebut. Kemenangan benchmark tidak dapat mengisolasi model sebagai penyebabnya, apalagi menjamin penghematan 82% di tempat lain.

Kredit Kiro memberi harga pada aktivitas, bukan pekerjaan engineering yang diterima

Dokumentasi model Kiro saat ini mencantumkan ketiga varian GPT-5.6 dengan context window 272.000 token. Multiplier kreditnya relatif terhadap Auto, opsi routing default Kiro:

Pilihan KiroMultiplier saat iniAkses yang didokumentasikanHipotesis awal yang masuk akal—bukan kesimpulan
GPT-5.6 Luna0.1xPaket berbayarTugas berbatas berfrekuensi tinggi ketika percobaan murah dan feedback cepat penting
GPT-5.6 Terra1.0xPaket berbayarPerubahan rutin multi-langkah yang membutuhkan keseimbangan kapabilitas dan penggunaan kredit
GPT-5.6 Sol2.4xPaket berbayarPerencanaan lebih sulit atau pekerjaan jangka panjang ketika lebih sedikit percobaan gagal dapat menutup multiplier yang lebih tinggi
Auto1.0xSemua paketBaseline produk yang praktis, tetapi routing yang mendasarinya dapat berubah antar-run

Ini adalah multiplier relatif terhadap produk, bukan harga token API. Dokumentasi yang sama menyatakan tugas yang mengonsumsi 10 kredit di Auto akan mengonsumsi 24 dengan Sol, 10 dengan Terra, atau 1 dengan Luna. Dokumentasi itu juga menyatakan permintaan GPT-5.6 dilayani dari Amerika Serikat terlepas dari wilayah profil Kiro. Kondisi lokasi data itu dapat membuat keluarga model ini tidak memenuhi syarat untuk beberapa repositori sebelum biaya dipertimbangkan.

Halaman harga Kiro saat ini mencantumkan paket mulai dari Pro seharga 20untuk1.000kredithinggaPowerseharga20 untuk 1.000 kredit hingga Power seharga 200 untuk 10.000 kredit, dengan kredit tambahan seharga $0,04 per kredit. Kredit yang termasuk dalam paket dan pengeluaran tambahan marginal menjawab pertanyaan anggaran yang berbeda. Tim yang sudah membayar kapasitas yang tidak terpakai mungkin tidak melihat biaya tunai langsung untuk satu uji coba, tetapi pekerjaan itu tetap mengonsumsi kapasitas paket yang terbatas dan dapat memicu kelebihan penggunaan nantinya.

Analisis Fathom yang independen dengan tepat mengarahkan pembaca pada waktu review, pengujian gagal, perbaikan selanjutnya, dan total pengeluaran model. Namun, analisis itu tidak melaporkan eksperimen Kiro yang independen. Kontribusinya adalah kerangka pengukuran yang berguna, bukan konfirmasi atas hasil 82%.

“Perubahan selesai” adalah denominator yang hilang

Mulailah dengan satu gate biner yang harus dilewati setiap kandidat. Perubahan hanya dihitung selesai ketika semua kondisi yang diperlukan benar:

  • perilaku yang dinyatakan dalam tugas sudah tersedia;
  • pengujian target dan test suite lengkap yang dibekukan berhasil;
  • linter, pemeriksaan tipe, pemeriksaan keamanan, dan langkah build yang diwajibkan repositori berhasil;
  • diff tetap berada dalam cakupan yang dinyatakan tugas dan menghindari berkas yang dilindungi;
  • reviewer menerima perubahan dalam anggaran waktu koreksi yang tetap;
  • tidak ada regresi yang diperkenalkan agen selama window observasi yang dipilih; dan
  • perubahan tidak membutuhkan rollback atau tindak lanjut darurat.

Gunakan window observasi yang lebih pendek untuk fixture berisiko rendah dan yang lebih panjang untuk uji produksi, tetapi samakan window tersebut untuk semua kandidat. Hasil dapat tetap berstatus “diterima sementara” sampai window ditutup. Ini mencegah merge cepat yang diikuti revert mahal dihitung sebagai keberhasilan.

Jangan meminta satu reviewer memutuskan apakah patch “terlihat bagus”. Tulis aturan yang dapat diamati untuk setiap tugas. Pembaruan dependensi mungkin mengharuskan lockfile memuat satu versi yang dimaksud, pemindaian kerentanan tetap pada atau di bawah baseline, semua pengujian berhasil, dan tidak ada paket yang tidak terkait berubah. Perbaikan bug mungkin mengharuskan pengujian yang sebelumnya gagal berhasil tanpa menghapus atau melemahkan pengujian tersebut.

Satu workflow Kiro tetap dapat menghasilkan tiga eksperimen berbeda

Pilih 20–40 tugas dari pekerjaan terbaru yang representatif. Sertakan pemeliharaan biasa sekaligus kegagalan yang menghabiskan waktu review secara tidak proporsional. Empat kelas tugas yang berguna adalah perbaikan bug kecil, fitur lintas berkas, perubahan dependensi atau konfigurasi, dan refactor berbasis pengujian.

Bandingkan pilihan Kiro tim saat ini dengan satu kandidat GPT-5.6 terlebih dahulu. Pertahankan versi Kiro, commit repositori, prompt tugas, dokumen spesifikasi, aturan steering, izin, tool, timeout, jumlah maksimum langkah agen, kebijakan retry, lingkungan pengujian, dan grader penerimaan tetap sama. Jika perbandingan pertama membenarkan tier lain, tambahkan pada putaran kedua. Mengubah model, prompt, izin, dan dekomposisi tugas sekaligus menghasilkan pilot produk, bukan perbandingan model.

Ganti urutan run agar perlambatan provider atau gangguan layanan repositori tidak hanya memengaruhi satu kandidat. Pertahankan percobaan gagal dalam denominator. Jika manusia melakukan intervensi, catat menit dan jenis koreksinya, bukan diam-diam mengubah percobaan gagal menjadi lulus.

UkuranCatat untuk setiap kandidatMengapa mengubah keputusan
Perubahan diterimaJumlah mentah dan total yang dicobaMenyediakan denominator; persentase tanpa jumlah menyembunyikan ketidakpastian
Kredit KiroTotal dan per perubahan yang dicobaMenunjukkan konsumsi produk di bawah multiplier saat ini
Waktu berlalu agenMedian dan p95 dari awal hingga patch dikirimMengungkap ekor lambat yang tersembunyi oleh rata-rata
Review dan perbaikanMenit manusia, putaran review, perubahan yang dimintaMengubah pekerjaan maintainer menjadi bagian dari biaya
Kegagalan validasiPengujian target yang gagal, regresi suite lengkap, kegagalan lint/type/securityMemisahkan output yang rapi dari kebugaran repositori
Kegagalan cakupanBerkas yang tidak diminta, drift dependensi, pengujian yang dihapus, edit pada path terlindungiMenangkap risiko yang dapat terlewat oleh skor keberhasilan tugas
Kegagalan operasionalRevert, rollback, insiden, tindak lanjut mendesakMencegah merge cepat terlihat lebih murah daripada perubahan stabil

Analisis level berpikir Gemini kami (bahasa Indonesia) menunjukkan bagaimana harga pemanggilan model, retry, dan biaya fallback berinteraksi ketika tarif token provider tersedia. Untuk Kiro, kredit adalah ukuran produk native. Analisis pensiun model GitHub Copilot (bahasa Indonesia) menunjukkan mengapa model bernama dapat berubah lebih cepat daripada produk di sekitarnya.

Biaya baru terlihat setelah window observasi ditutup

Gunakan tarif tenaga kerja yang dibebankan organisasi untuk review dan perbaikan. Tambahkan harga marginal kredit Kiro yang dikonsumsi, compute CI atau sandbox, serta biaya rollback atau insiden yang terukur. Jika kredit langganan yang termasuk diperlakukan sebagai biaya tunai nol untuk satu keputusan, laporkan hasil dua kali: sekali dengan biaya kredit marginal nol dan sekali pada tarif tambahan saat ini. Hal ini membuat asumsi kapasitas terlihat.

total evaluated cost =
  Kiro credit expense
  + CI and sandbox expense
  + reviewer and repair minutes × loaded cost per minute
  + measured rollback and incident expense

cost per completed change =
  total evaluated cost / changes that cleared the full acceptance gate

Jangan pernah membagi dengan perubahan yang diterima ketika jumlahnya nol. Laporkan kandidat sebagai gagal melewati gate, bersama total pengeluaran dan kategori kegagalannya. Infinity numerik rapi secara matematis, tetapi tidak membantu secara operasional.

Hasil terbaik mungkin berupa kebijakan routing, bukan satu default. Luna dapat menang pada perubahan kecil yang telah diuji dengan baik sementara Terra menang pada pekerjaan lintas berkas; Sol mungkin ekonomis hanya ketika tugas yang lebih sulit akan memerlukan beberapa percobaan gagal. Auto mungkin tetap berguna untuk pekerjaan umum, tetapi rutenya yang berubah-ubah membuatnya menjadi baseline eksperimen yang lebih lemah ketika reproduktibilitas model yang tepat penting.

Angka 82% memberi GPT-5.6 Terra tempat dalam pilot Kiro yang terkontrol. Angka itu tidak menyelesaikan keputusan pengadaan atau model default. Keputusan tersebut baru selesai ketika tim dapat menunjuk patch yang diterima, run yang gagal, menit reviewer, konsumsi kredit, dan bukti rollback dari repositori yang sama di bawah gate yang sama.

Sumber

  1. OpenAI: Advancing price-performance for developers with GPT-5.6 in Kiro
  2. Kiro models and current credit multipliers
  3. Kiro GPT-5.6 launch changelog
  4. Kiro GPT-5.6 Terra and Luna credit multiplier update
  5. Kiro pricing and included credits
  6. Terminal-Bench 2.1 repository and submission protocol
  7. Fathom analysis of GPT-5.6 in Kiro