Evaluasi Agent Google Kini GA. Skor Offline dan Live Tetap Membutuhkan Version Control

Google kini menghubungkan pengujian agent dan monitor produksi. Pelajari versi, sampel, judge, trace, biaya, dan kontrol yang harus tetap terlihat sebelum membandingkan skor.

Bagikan artikel ini

Google telah membuat Agent dan Model Evaluations di Gemini Enterprise Agent Platform tersedia secara umum (GA). Tim kini dapat menggunakan kembali metrik terdaftar di antara eksperimen offline dan monitor online, memeriksa trace di balik kegagalan, membuat kasus sintetis, mensimulasikan pengguna dan lingkungan tool, serta memantau skor produksi yang disampel untuk mendeteksi drift.

Mesin bersama itu menghapus banyak pekerjaan plumbing evaluasi. Namun, mesin tersebut tidak dengan sendirinya membuat dua skor dapat dibandingkan. Suite offline dan traffic live dapat menggunakan metrik dengan nama yang sama sambil menguji revisi agent, populasi kasus, field trace, model judge, atau aturan sampling yang berbeda. Grafik yang menurun bisa mencerminkan produk, evaluator, atau campuran traffic.

Apa yang kini tersedia secara umum dari Google

Pengumuman Google pada 31 Juli menjelaskan lebih dari 20 metrik bawaan yang mencakup keberhasilan tugas, penggunaan tool, kualitas trajectory, grounding, safety, dan tugas bahasa berbasis referensi. Tim juga dapat mendaftarkan metrik Python dan judge large language model kustom. Eksperimen sisi server menyimpan artefak di Cloud Storage, sedangkan monitor online dapat menilai trace produksi yang dikumpulkan dan mengirim peringatan drift.

Dokumentasi evaluasi agent saat ini, yang diperbarui pada 26 Agustus, membagi proses menjadi cases, inference, traces, scoring, analysis, dan optimization. Dokumentasi ini mendukung pengembangan lokal serta penilaian agent yang telah di-deploy. Lifecycle tersebut lebih luas daripada benchmark model karena trace dapat mencakup pemilihan tool, argumen, event antara, dan state multi-turn, bukan hanya jawaban akhir.

Satu batas interface masih mudah terlewat. Panduan GenAI Client Google masih memberi label Preview pada interface yang direkomendasikan dan memberlakukannya dengan ketentuan pre-GA. Service overview memberi label GA pada modul lama vertexai.evaluation.EvalTask dan mempertahankannya untuk kompatibilitas, tetapi mengatakan modul itu tidak mendukung metode baru seperti adaptive rubric. Evaluation service dapat berstatus GA sementara client tepat yang dipilih tim belum berstatus GA.

Panduan implementasi independen AgentPedia sampai pada kesimpulan operasional yang sama: pin SDK dan sembunyikan pemanggilan yang bergantung pada Preview di balik adapter yang dapat diganti. Keputusan rilis harus mencatat status lifecycle interface yang benar-benar digunakan, bukan mewarisi status terluas dari headline peluncuran.

Skor yang dapat dibandingkan membutuhkan measurement bundle berversi

Dokumentasi Metric Registry Google mengatakan definisi yang terdaftar dapat diterapkan secara konsisten pada assessment offline dan monitor berkelanjutan. Itu adalah pusat yang stabil dalam loop. Measurement di sekitarnya tetap membutuhkan catatannya sendiri.

Komponen measurementCatat di seluruh batas offline-ke-live
Sistem yang diujiPin revisi agent, model, instruksi, corpus retrieval, dan skema tool secara offline. Catat revisi deployment yang tepat dan alokasi traffic secara online. Perubahan sistem dapat menggeser skor meski metrik tidak berubah.
KasusBeri nama revisi dataset offline, status held-out, sumber skenario, dan hasil yang diharapkan. Untuk produksi, catat filter trace, cohort, bahasa, jalur tool, region, dan jendela waktu. Suite tetap dan populasi pengguna yang berubah menjawab pertanyaan berbeda.
MetrikGunakan resource registry dan revisi definisi yang sama di kedua tempat. Kriteria yang diedit dapat terlihat seperti drift produk.
JudgePin ID model judge, parameter, prompt atau revisi rubric, dan kebijakan retry untuk jendela perbandingan. Pembaruan judge dapat mengubah verdict tanpa perubahan pada agent.
BuktiTentukan event trace yang diperlukan, aturan redaksi, kebijakan field yang hilang, dan lokasi artefak. Pastikan produksi mengekspos field teramati yang sama; judge tidak dapat menilai aksi tool yang dihilangkan oleh trace live.
Sampling dan ringkasanCatat pengulangan offline, seed, aturan run tidak valid, slice, dan statistik. Pasangkan dengan persentase sampling live, maksimum sampel, jadwal, trace tidak valid, slice, dan statistik. Rata-rata sampel dapat berubah karena volume atau komposisi berubah.

Tabel ini merupakan rekomendasi publikasi, bukan klaim bahwa Agent Platform otomatis menangkap setiap field. Registry Google menyediakan resource metrik yang dapat digunakan kembali. Tim tetap bertanggung jawab menghubungkan resource tersebut dengan revisi aplikasi, data, telemetri, dan analisis yang immutable.

Identifier praktis dapat berupa hash dari bundle tersebut, bukan label yang ditulis tangan seperti quality-v3. Simpan field yang mudah dibaca di sampingnya. Ketika model judge atau rubric berubah, beri skor pada calibration set bersama dan sampel trace produksi terbaru dengan kedua versi. Gabungkan grafik hanya jika overlap menunjukkan bahwa perubahan skor telah dipahami; jika tidak, mulai seri baru dan beri anotasi pada perubahan.

Adaptive rubric meningkatkan kecocokan, tetapi menambah artefak yang dihasilkan

Adaptive rubric meminta judge model membuat kriteria lulus/gagal spesifik kasus dari kasus evaluasi, instruksi developer, dan deklarasi tool, lalu menilai trace yang dihasilkan. Untuk agent refund, satu kasus mungkin mengharuskan pemeriksaan status pengiriman sebelum pembatalan, paling banyak melakukan satu mutasi, dan melaporkan hasil tool yang sebenarnya. Skor “helpfulness” generik akan melewatkan batas state dan otorisasi tersebut.

Spesifisitas tambahan hanya berguna jika kriteria yang dihasilkan diperiksa. Rubric dapat menuntut perilaku yang tidak pernah diminta tugas, memberi penghargaan pada penjelasan panjang alih-alih hasil tool yang benar, atau menghilangkan invariant otorisasi yang penting. Perlakukan grup rubric yang dihasilkan sebagai bagian dari bukti: beri versi, ambil sampel untuk tinjauan manusia, dan uji apakah judge dapat membedakan fixture yang diketahui lulus, gagal, dan ambigu.

Penelitian sebelum rilis Google menunjukkan mengapa kalibrasi penting. Studi MT-Bench dan Chatbot Arena yang telah melalui peer review menemukan bahwa judge language model yang kuat dapat mendekati preferensi manusia dalam konteks chat assistant-nya, tetapi juga mendokumentasikan bias posisi, verbosity, self-enhancement, dan reasoning. Hasil tersebut tidak mengukur rater terkelola Google saat ini. Hasil itu menetapkan poin yang lebih sempit: kesepakatan harus diuji untuk judge, tugas, label, dan kondisi yang benar-benar digunakan tim.

Gunakan pemeriksaan programatik ketika properti yang diharapkan bersifat pasti: nama tool yang diizinkan, field JSON wajib, total aritmetika, batas izin, state transaksi, atau side effect yang dilarang. Gunakan judge language model untuk properti semantik yang memerlukan interpretasi. Tidak satu pun skor boleh mengesampingkan invariant safety deterministik yang gagal.

Penjelasan evaluasi AI umum kami membahas aturan yang lebih luas bahwa metrik membentuk keputusan produk. Analisis HarnessRisk (bahasa Indonesia) memperluas cakupan ke konfigurasi, instalasi kapabilitas, state persisten, kontrol aksi, dan pemulihan—area yang tidak dapat disertifikasi oleh skor kualitas respons.

Simulasi memperluas cakupan; produksi menyediakan distribusi yang berbeda

Agent Platform dapat membuat kasus, mensimulasikan pengguna multi-turn, dan mencegat pemanggilan tool dengan data, error, atau latensi yang dikendalikan. Fitur-fitur itu membuat jalur langka dan berbahaya lebih mudah diuji tanpa merusak backend nyata. Fitur tersebut dapat menunjukkan bahwa agent menangani timeout sintetis, penolakan izin, atau hasil malformed dalam kondisi yang ditentukan.

Simulator tidak menetapkan prevalensi kegagalan tersebut di produksi, fidelitas side effect layanan nyata, atau perilaku pengguna yang tidak diwakili simulator. Kasus yang dihasilkan juga dapat mengulang asumsi dari instruksi agent dan skema tool yang digunakan untuk membuatnya. Pertahankan kasus sintetis, held-out yang ditulis manusia, dan kasus turunan produksi sebagai slice terpisah, bukan mencampurnya menjadi satu pass rate.

Dokumentasi online-monitor Google memungkinkan operator memfilter trace, menetapkan persentase sampling, dan membatasi jumlah sampel per run. Itu mengendalikan biaya, tetapi menjadikan aturan sampling sebagai bagian dari hasil. Monitor yang dibatasi pada trace lambat, panjang, atau bertoken tinggi berguna untuk diagnosis; skornya bukan estimasi seluruh traffic kecuali analisis memperhitungkan pemilihan tersebut.

Jembatan paling bersih adalah perbandingan shadow. Sebelum peluncuran, jalankan kandidat rilis pada suite held-out. Setelah peluncuran, kirim sampel kecil trace yang memenuhi syarat dan telah ditinjau melalui bundle metrik identik sambil mempertahankan baseline acak. Jika skor live berubah, uraikan berdasarkan revisi agent, jalur tool, bahasa, cohort, dan kelengkapan trace sebelum menyebutnya drift produk.

Biaya, telemetri, dan kontrol keamanan termasuk dalam hasil

Dua halaman Google saat ini tidak sepakat tentang biaya metrik komputasi. Tulisan peluncuran mengatakan metrik berbasis kode dan komputasi tidak menambah biaya. Halaman pricing Agent Platform khusus mencantumkan biaya berbasis karakter untuk metrik komputasi dan menagih metrik berbasis model secara terpisah melalui autorater yang mendasarinya. Perlakukan halaman pricing dan akun billing sebagai otoritas untuk budgeting, lalu beri timestamp pada tarif yang digunakan dalam perhitungan biaya per trace yang dievaluasi.

Pengumuman juga mengatakan dataset dan trace tetap berada di project pelanggan. Pernyataan itu tidak boleh diperluas menjadi jaminan bahwa setiap kontrol yang diinginkan tersedia. Tabel dukungan keamanan enterprise Google saat ini menandai evaluasi Agent sebagai mendukung HIPAA, tetapi mencantumkan VPC Service Controls, customer-managed encryption keys, data residency at rest, Access Transparency, dan Access Approval sebagai tidak didukung untuk service tersebut. Dukungan produk dapat berubah, jadi verifikasi tabel, region, model target, jalur Cloud Trace, dan konfigurasi Cloud Storage untuk deployment yang tepat.

Trace evaluasi dapat berisi prompt, respons, definisi tool, argumen, identifier sesi, dan contoh kegagalan. Karena itu, monitor produksi memerlukan allowlist field yang telah ditinjau, redaksi sebelum ekspor, aturan akses dan retensi, perilaku penghapusan, serta kebijakan eksplisit untuk data teregulasi atau yang dibatasi kontrak. Persentase sampling yang lebih tinggi tidak otomatis lebih baik jika menyalin lebih banyak konten sensitif ke jalur bukti yang kontrolnya lebih lemah.

Satu keluarga produk tidak membuat skor offline dan live identik

Rilis GA Google membuat eksperimen, trace, metrik yang dapat digunakan kembali, dan monitor online lebih mudah dioperasikan bersama. Manfaat yang kredibel adalah kesinambungan bukti, bukan kesinambungan nama metrik.

Skor live tetap bergantung pada trace yang disampel, field yang bertahan setelah logging dan redaksi, versi judge dan rubric yang berjalan, serta kemiripan pengguna produksi dengan kasus offline. Ketika salah satu hal itu berubah, angkanya dapat bergerak meski agent tidak berubah—atau tetap datar sementara slice kegagalan penting memburuk.

Produk ini menutup celah operasional. Produk ini tidak menghapus pekerjaan analitis yang diperlukan untuk menentukan apakah perubahan yang diamati berasal dari agent, evaluator, atau traffic.

Sumber

  1. Google announcement: Agent and Model Evaluations are generally available
  2. Google Cloud agent evaluation overview
  3. Google Cloud metric registry documentation
  4. Google Cloud continuous online evaluation documentation
  5. Google Cloud GenAI Client agent evaluation documentation
  6. Google Cloud Gen AI evaluation service overview
  7. Gemini Enterprise Agent Platform pricing
  8. Google Cloud Agent Platform enterprise security support table
  9. AgentPedia independent implementation guide to Gemini agent evaluations
  10. NeurIPS paper: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena