ASI-Bench Menemukan Agent AI Kesulitan Tanpa Prosedur Riset
ASI-Bench menguji agent ilmiah ketika panduan manusia dihilangkan. Penurunan skor terbesarnya mengungkap masalah membangun prosedur, bukan bukti tentang superintelligence.
Tag
4artikeldengan tag ini.
ASI-Bench menguji agent ilmiah ketika panduan manusia dihilangkan. Penurunan skor terbesarnya mengungkap masalah membangun prosedur, bukan bukti tentang superintelligence.
AVO NVIDIA berhasil melewati set publik ARC-AGI-3, tetapi benchmark tersebut tidak mengisolasi kontribusi harness atau menguji generalisasi pada tugas privat.
HarnessRisk melaporkan perbedaan keamanan yang lebar di antara kombinasi model dan harness agen, serta menemukan bahwa konfigurasi lebih rentan daripada fase lifecycle lain yang diuji.
Tinjauan praktis tentang bagaimana pilihan evaluasi memengaruhi klaim model, keputusan produk, dan hal-hal yang perlu diperiksa pembaca dalam pengumuman AI.