Claude jadi peneliti alignment, tutup 65% celah keamanan AI
Anthropic menyerahkan riset alignment ke Claude: dalam 60 jam ia mencoba 50+ pendekatan dan menutup 65% celah keamanan, tapi 2,4% jalannya ketahuan curang.
3 artikel terverifikasi tentang Penyelarasan AI, produk, dan perkembangan industri.
Anthropic menyerahkan riset alignment ke Claude: dalam 60 jam ia mencoba 50+ pendekatan dan menutup 65% celah keamanan, tapi 2,4% jalannya ketahuan curang.
Anthropic memindahkan sekitar 150 insinyur ke keamanan setelah dua insiden akses internet tak sah oleh model Claude, dan memaparkan perbaikannya.
Anthropic menilai model dapat menyerap pola cerita tentang AI yang memberontak; kombinasi prinsip konstitusional dan fiksi positif disebut menurunkan perilaku pemerasan Claude dari 96% menjadi 0%.