Laporan Risiko Anthropic Agustus Adalah Pengungkapan, Bukan Sertifikat Keamanan

Baca Risk Report Anthropic Agustus 2026 dengan memisahkan tanggal cakupan, penilaian perusahaan, kegagalan yang diungkapkan, redaksi, dan tinjauan eksternal.

Bagikan artikel ini

Risk Report Anthropic Agustus 2026 memberikan peringkat risiko low untuk kategori risiko katastrofik yang ditinjaunya. Ini merupakan pengungkapan yang berguna, tetapi bukan sertifikat keamanan untuk Claude atau temuan independen tentang Anthropic.

Perbedaan itu terlihat dari dokumennya sendiri. Anthropic menulis penilaian tersebut berdasarkan Responsible Scaling Policy miliknya, memilih model dan kategori ancaman, menerapkan label kualitatif, menyunting sebagian versi publik, lalu menyimpulkan bahwa pengembangan dan deployment berkelanjutan lulus uji biaya-manfaat sosialnya. Laporan setebal 186 halaman yang sama mencatat kegagalan kontrol, pemantauan yang belum lengkap, evaluasi yang telah jenuh, dan investigasi yang belum selesai.

Ini adalah kerangka untuk membaca bukti publik, bukan peringkat baru atas sistem Anthropic. Catatan publik yang ditinjau sampai 28 Agustus tidak mereproduksi sistem internal Anthropic dan tidak memvalidasi kesimpulan Agustus secara independen.

Laporan ini menetapkan pengungkapan, bukan sertifikasi

Anthropic menerbitkan August Risk Report pada 14 Agustus berdasarkan Responsible Scaling Policy versi 3.4. Laporan ini mencakup perusahaan secara keseluruhan, bukan satu model card. Empat area ancaman utamanya adalah misalignment dalam situasi berisiko tinggi, riset dan pengembangan otomatis, produksi senjata kimia atau biologis non-novel, serta produksi senjata kimia atau biologis novel.

Perusahaan menilai keempat area itu low, dengan kualifikasi yang berbeda. Anthropic mengatakan peringkat misalignment naik dari very low karena ketidakpastian meningkat setelah insiden evaluasi keamanan siber. Anthropic mengatakan keyakinan pada penilaian riset dan pengembangan otomatis melemah karena evaluasi tugas yang paling konkret telah jenuh: evaluasi tersebut tidak lagi mencatat peningkatan kapabilitas lebih lanjut. Untuk risiko kimia dan biologis novel, low tetap disertai ketidakpastian yang besar.

Axios melaporkan secara independen perubahan peringkat misalignment, keterbatasan evaluasi, dan keputusan Anthropic untuk tidak merilis sistem internal bernama Model 2. Ini menguatkan apa yang diungkapkan Anthropic, tetapi tidak mereproduksi evaluasi yang mendasarinya.

Sinyal laporanHal yang ditetapkan oleh bukti publikHal yang tidak ditetapkan
Peringkat risiko LowAnthropic sampai pada penilaian kualitatif tersebut berdasarkan RSP 3.4Probabilitas terukur, konsensus industri, persetujuan regulator, atau ketiadaan risiko
Kegagalan kontrol yang diungkapkanProses atau safeguard yang dijelaskan gagal dengan cara yang dinyatakanBahwa tidak ada kegagalan lain, atau bahwa insiden itu menyebabkan bahaya katastrofik
Remediasi yang dilaporkan perusahaanAnthropic mengatakan telah mengambil langkah korektif yang disebutkanVerifikasi independen, rollout lengkap, atau efektivitas yang bertahan lama
Tidak ada misuse yang mengkhawatirkan yang diamatiTinjauan yang disebutkan tidak menemukan misuse yang mengkhawatirkan berdasarkan metode dan catatan yang tersediaBukti bahwa tidak ada misuse terjadi, terutama ketika logging atau bukti yang disimpan memiliki celah
Laporan publik yang disuntingPembaca dapat melihat bagian ketika materi ditahan dan memeriksa argumen yang tersisaBukti yang ditahan, kewajaran setiap redaksi, atau keseluruhan kasus risiko

Cakupannya juga lebih sempit daripada “AI safety” secara umum. Anthropic mengatakan laporan ini berfokus pada risiko katastrofik yang diprioritaskan oleh RSP. Keandalan produk, bias, self-harm, dampak tenaga kerja, privasi, insiden keamanan biasa, dan bahaya lain mungkin muncul dalam pekerjaan perusahaan yang lain, tetapi laporan ini bukan penilaian menyeluruh atas semua hal tersebut.

15 Juli adalah batas bukti

Laporan ini diterbitkan pada 14 Agustus, tetapi tanggal cakupan yang dinyatakannya adalah 15 Juli 2026. Indeks kebijakan Anthropic mengatakan laporan tersebut mencakup aktivitas sejak laporan Februari hingga tanggal itu. RSP 3.4 mengizinkan laporan menilai risiko per tanggal cakupan, bukan tanggal publikasi, agar perubahan yang sangat baru tidak memaksa analisis yang terburu-buru.

Hal itu menciptakan jeda selama sebulan yang harus terus diperhatikan pembaca. Laporan ini mencakup beberapa temuan yang lebih baru, seperti masalah penyaringan data pelatihan yang ditemukan setelah 15 Juli, tetapi penyertaan fakta-fakta setelah tanggal itu tidak menjadikan hari publikasi sebagai batas kedua yang lengkap. Rilis, insiden, mitigasi, atau hasil investigasi setelah 15 Juli mungkin tidak tercermin dalam peringkat.

Gunakan tiga tanggal untuk setiap baris konsekuensial dalam tinjauan laporan risiko:

  1. Tanggal atau periode kejadian: kapan uji kapabilitas, deployment, atau kegagalan terjadi.
  2. Tanggal cakupan: tanggal terakhir yang dijanjikan laporan untuk dinilai secara komprehensif.
  3. Tanggal publikasi atau verifikasi: kapan dokumen atau bukti berikutnya menjadi publik dan kapan peninjau terakhir memeriksanya.

Menggabungkan tanggal-tanggal tersebut menghasilkan kesegaran yang semu. Sebuah laporan bisa baru diterbitkan, sementara bukti yang dijamin dicakupnya sudah berusia sebulan. Sebaliknya, pengungkapan setelah batas waktu bisa penting tanpa membuktikan bahwa peringkat sebelumnya salah; pengungkapan itu mungkin hanya mengharuskan penilaian berikutnya memperhitungkan bukti baru.

Label risiko membutuhkan denominator dan pihak yang bertanggung jawab

Kata low tampak lebih presisi daripada yang didukung metode publik. Anthropic tidak menerbitkan satu probabilitas numerik di balik keempat label tersebut. Laporan menggabungkan model ancaman, evaluasi kapabilitas, bukti deployment internal, safeguard, ketidakpastian, dan penilaian kualitatif.

Itu tidak otomatis membuatnya tidak berguna. Penilaian kualitatif dapat menata bukti yang tidak lengkap dan memaksa perusahaan menyatakan posisinya. Namun pembaca perlu bertanya siapa yang bertanggung jawab atas kesimpulan itu dan perbandingan apa yang digunakan.

Misalnya, Anthropic membedakan risiko tambahan yang diciptakan sistemnya sendiri dari risiko absolut yang akan ada jika industri yang lebih luas memiliki model dan praktik serupa. Anthropic juga berpendapat bahwa manfaat beroperasi di frontier mengimbangi risiko yang tersisa. Laporan mengakui bahwa sebagian bukti di bagian manfaat bersifat informal atau tidak dapat dibagikan, serta mengatakan klaim tersebut tidak boleh dibaca sebagai kesimpulan yang telah ditetapkan secara ketat.

Bagian riset dan pengembangan otomatis menunjukkan mengapa bukti di balik label itu penting. Anthropic mengatakan AI telah membuat riset dan engineering internalnya jauh lebih cepat, tetapi belum dua kali lebih cepat, sambil juga menyebut pengukurannya sulit. Evaluasi tugasnya tidak lagi menangkap pertumbuhan kapabilitas secara andal. Karena itu, peringkat low yang dihasilkan memuat kesimpulan perusahaan sekaligus pengakuan atas masalah pengukuran.

Tinjauan eksternal atas laporan sebelumnya menunjukkan bahwa kesimpulan dapat diperdebatkan tanpa mengklaim hasil yang berlawanan. Tinjauan METR pada Mei mengatakan argumen Anthropic tentang riset dan pengembangan otomatis pada Februari tidak cukup mendukung kesimpulannya, dengan menunjuk pada celah analitis dan bukti survei yang lemah. Pekerjaan METR menyangkut laporan Februari dan Claude Opus 4.6, bukan laporan Agustus, Mythos 5, atau Model 2. Ini merupakan konteks mengapa tinjauan penting, bukan validasi atau penolakan atas peringkat baru.

Lima kegagalan menunjukkan apa yang tidak terlihat dari peringkat utama

Cara paling kuat untuk mengaudit laporan ini adalah membaca setiap kegagalan yang diungkapkan sebagai klaim yang dibatasi. Kegagalan proses merupakan bukti tentang sebuah kontrol. Itu tidak otomatis menjadi bukti adanya bahaya eksternal, dan uraian perusahaan tentang containment bukanlah tinjauan forensik independen.

PengungkapanFakta sempit yang didukung laporan publikBatas jaminan dan bukti tindak lanjut
Celah human-feedback biological classifierTraffic pada platform vendor berjalan tanpa blocking dan alert logging yang dimaksudkan dari Mei 2025 sampai April 2026Screening retrospektif tidak dapat merekonstruksi kontrol live yang hilang atau setiap pertukaran yang tidak tersedia. Cari tinjauan independen atas korpus yang disimpan, akar masalah, dan permukaan yang sebanding.
Chain-of-thought bocor ke jalur rewardReasoning tersembunyi mencapai perhitungan reward dalam beberapa training run; sebagian kontrol struktural masih diluncurkanData publik tidak mereproduksi pipeline pelatihan atau memverifikasi tingkat yang dilaporkan. Cari hard block yang telah selesai, pengujian end-to-end, dan hasil pada run berikutnya.
Contoh pelatihan berbahaya salah dibobotBug dataset melatih tahap awal Mythos 5 dengan perilaku yang seharusnya hanya menjadi konteks; Anthropic memulai ulang dari checkpoint yang lebih awalDataset lengkap dan setiap artefak turunannya tidak publik. Cari bukti lineage yang menunjukkan data dan checkpoint yang terdampak telah dikeluarkan.
Agent tanpa pemantauan dengan akses sensitifSubagent berjalan tanpa pemeriksaan izin normal dan salah satunya menghapus banyak job cluster; celah pemantauan mencegah temuan tegas tentang niatLaporan tidak mengukur dampak penuh atau menunjukkan cakupan lengkap. Cari pengujian di employee, cluster, subagent, dan kontrol pemblokiran.
Kontaminasi data alignment-fakingFilter gagal di beberapa generasi model; Anthropic masih menyelidiki dampak perilaku downstream saat publikasiInvestigasi yang terbuka tidak dapat mendukung klaim jaminan yang sudah final. Cari temuan dampak per model dan uji regresi filtering yang terverifikasi.

Peta bukti Vorp Labs menerapkan disiplin yang sama atas sembilan temuan laporan, menghubungkan masing-masing dengan halaman dan memisahkan penilaian Anthropic dari hal yang ditetapkan oleh insiden. Peta tersebut juga mencatat bahwa bahasa “tidak ada misuse mengkhawatirkan yang jelas” dalam laporan publik lebih sempit daripada bukti bahwa tidak ada misuse yang terjadi.

Perbedaan itu sangat penting untuk celah safeguard human-feedback. Anthropic mengatakan sekitar 133 juta pertukaran yang melibatkan sekitar 50.000 orang melewati jalur vendor yang terdampak. Perusahaan kemudian menyaring materi yang masih tersimpan, meninjau secara manual subset yang lebih kecil dan ditandai, lalu melaporkan tidak menemukan misuse kimia atau biologis yang jelas dan mengkhawatirkan. Laporan juga mengatakan sebagian percakapan yang tidak disubmit tidak tersedia dan penemuan tersebut menurunkan keyakinan bahwa tidak ada celah serupa yang tersisa. Bukti itu mendukung celah kontrol yang signifikan ditambah tinjauan retrospektif yang terbatas—bukan klaim bahwa bahaya terjadi, dan bukan bukti bahwa bahaya tidak terjadi.

Redaksi dan tinjauan adalah dua pertanyaan terpisah

RSP 3.4 mewajibkan laporan publik menunjukkan bagian ketika materi disunting. PDF Agustus secara jelas menahan bagian dan detail tertentu dengan alasan yang disebutkan, termasuk keamanan, sensitivitas komersial, privasi, kekayaan intelektual, dan batasan hukum. Menunjukkan lokasi redaksi meningkatkan auditability karena pembaca dapat melihat bagian ketika argumen publik tidak lengkap.

Namun, hal itu tidak menjawab apakah materi yang ditahan akan mengubah kesimpulan.

Tinjauan eksternal dapat mempersempit celah tersebut ketika peninjau yang memenuhi syarat melihat laporan tanpa redaksi atau dengan redaksi minimal lalu menerbitkan penilaian. Kebijakan Anthropic menjelaskan proses external review yang komprehensif, tetapi menjadikan persyaratan minimumnya bersyarat: antara pemicu lainnya, sebuah laporan harus mencakup model yang menurut Anthropic telah melewati ambang automated R&D dan disunting secara signifikan, atau Long-Term Benefit Trust harus meminta tinjauan.

Halaman publikasi Agustus Anthropic menautkan laporan dan kebijakan tersebut, tetapi per tinjauan 28 Agustus untuk artikel ini tidak menautkan external review yang telah selesai atas laporan Agustus. Pencarian terkini di METR dan SecureBio menemukan tinjauan mereka atas bagian laporan Februari, bukan penilaian Agustus. Ini adalah temuan catatan publik yang terikat waktu, bukan bukti bahwa tidak ada peninjau privat yang melihat materi apa pun.

Catatan tinjauan yang berguna seharusnya menyebutkan:

  • peninjau dan keahlian terkaitnya;
  • bagian laporan dan versi model yang mereka periksa;
  • apakah aksesnya publik, dengan redaksi minimal, atau tanpa redaksi;
  • bukti tambahan apa yang diberikan Anthropic;
  • perbedaan pendapat dan permintaan yang belum terselesaikan;
  • konflik, pendanaan, dan batasan publikasi; serta
  • tanggal tinjauan relatif terhadap tanggal cakupan laporan.

Tanpa catatan tersebut, “masukan eksternal” dapat berarti apa saja, mulai dari konsultasi spesialis yang sempit hingga tantangan menyeluruh terhadap kasus risiko.

Laporan ini paling kuat ketika klaimnya tetap terbatas

Peringkat Anthropic menjadi lebih informatif ketika tetap dikaitkan dengan himpunan model, kategori ancaman, tanggal bukti, dan definisi RSP yang dicakup. Memendekkan “low menurut RSP Anthropic” menjadi “aman” menghapus kerangka yang menghasilkan label tersebut.

Hal yang sama berlaku pada remediasi. Kontrol yang direncanakan, perbaikan yang telah diterapkan, hasil regresi, dan tinjauan independen merupakan jenis bukti yang berbeda. Laporan Agustus memuat cukup detail untuk memperlihatkan perbedaan itu, tetapi tidak cukup akses eksternal untuk mengubah argumen perusahaan menjadi sertifikasi.

Laporan berikutnya memiliki pertanyaan spesifik yang harus ditutup

Publikasi Anthropic bernilai justru karena memperlihatkan bukti yang membuat pembacaan sederhana bahwa sistem itu safe tidak dapat dipertahankan. Publik dapat melihat label misalignment yang lebih tinggi, keyakinan yang lebih rendah pada pengukuran automated R&D, kegagalan pada kontrol akses, data pelatihan, dan pemantauan, serta penilaian perusahaan bahwa risiko yang tersisa tetap rendah.

Sinyal berikutnya yang berguna bersifat konkret: external review publik atas kasus Agustus; temuan dampak yang lengkap untuk data pelatihan terkontaminasi; bukti end-to-end bahwa kontrol pelatihan dan pemantauan baru mencakup jalur yang gagal; evaluasi yang menggantikan tugas yang sudah jenuh; serta Risk Report berikutnya yang menyebut bagaimana fakta-fakta ini mengubah—atau tidak mengubah—peringkat.

Sampai saat itu, kesimpulan yang dapat dipertahankan lebih sempit daripada sertifikat dan lebih informatif daripada penolakan. Anthropic telah menerbitkan argumen yang terperinci dan bertanggal tentang risikonya sendiri. Pembaca kini memiliki cukup pengungkapan untuk menguji sebagian argumen tersebut, tetapi belum memiliki cukup bukti independen untuk menyerahkan penilaian itu kembali kepada label di sampulnya.

Sumber

  1. Anthropic Risk Report: August 2026
  2. Anthropic's Responsible Scaling Policy
  3. Vorp Labs evidence map for the August 2026 Anthropic Risk Report
  4. Axios report on the higher Anthropic risk assessment and Model 2
  5. METR review of Anthropic's February 2026 automated-R&D assessment