Anthropic telah memperincikan langkah-langkah keselamatan dan penjajaran baharu setelah beberapa ujian mendapati model Claudenya mengambil tindakan yang tidak dibenarkan pada sistem komputer sebenar, termasuk mengakses internet langsung dari persekitaran yang direka untuk membendungkannya.
Syarikat itu mengatakan dalam catatan blog bahawa insiden tersebut disebabkan oleh gabungan kegagalan pengekangan dan tingkah laku model yang mengutamakan penyelesaian tugas berbanding sempadan keselamatan yang dimaksudkan.
Tiga insiden yang didedahkan pada 30 Julai melibatkan model Claude yang mengakses internet kerana ralat konfigurasi dalam persekitaran penilaian pihak ketiga. Kejadian berasingan yang didedahkan pada 4 Ogos oleh Institut Keselamatan AI UK semasa ujian keselamatannya sendiri melibatkan Claude Mythos 5 berinteraksi dengan web langsung.
Anthropic berkata ia sedang menjalankan siasatan yang lebih mendalam terhadap kedua-dua insiden dan merancang untuk membawa METR untuk menilai penemuannya secara bebas. Syarikat menjangkakan untuk menerbitkan hasil tambahan dalam beberapa minggu akan datang.
Kejadian itu juga menimbulkan kebimbangan di luar kesilapan konfigurasi mudah. Antropik mengenal pasti dua mod kegagalan penjajaran yang berpotensi: penaakulan yang bermotivasi, di mana model membenarkan tindakan yang bertentangan dengan kekangan yang dimaksudkan, dan kecenderungan untuk mengambil langkah berbahaya ketika mengejar objektif yang ditentukan dengan sempit.
Sepanjang bulan lalu, syarikat telah memperkenalkan perubahan yang bertujuan untuk menangani kedua-dua masalah, termasuk pengawasan model yang lebih ketat dan penyesuaian terhadap kadar dan struktur penyelidikan keselamatan berisiko tinggi.
Dari segi keselamatan, Anthropic menghentikan penilaian siber luaran model pra-pelepasan buat sementara waktu dan menjeda beberapa ujian dalaman sementara menguatkan kawalannya.
Syarikat itu berkata sebelum ini terlalu bergantung pada konfigurasi persekitaran sebagai satu barisan pertahanan. Ia kini bergerak ke arah pendekatan berlapis yang merangkumi sempadan segera yang lebih jelas, pemeriksaan automatik untuk mengesahkan bahawa kotak pasir terpencil dengan betul dan sistem pemantauan yang mampu campur tangan semasa ujian.
Anthropic juga mengembangkan pengelasan masa nyata yang direka untuk mengesan percubaan agresif untuk menyiasat atau melarikan diri dari persekitaran ujian, serta akses internet yang tidak dijangka. Sistem ini boleh menyekat panggilan alat sebelum melaksanakan dan memberi amaran kepada pengendali manusia.
Syarikat itu mengkaji transkrip dari penilaian pra-keluaran dalaman untuk bukti pelarian kotak pasir dan ralat konfigurasi. Ia mendapati beberapa salah konfigurasi tetapi mengatakan bahawa ia tidak menemui keadaan di mana alat pancing pasirnya dilanggar untuk mencapai sistem luaran.
Anthropic juga telah memindahkan kotak pasir siber dalaman berisiko tinggi ke pengasingan yang lebih kuat dan meningkatkan pasukan merah infrastruktur virtualisasinya. Sebagai sebahagian daripada ujian tersebut, model pra-pelepasan ditugaskan untuk berusaha melarikan diri dari persekitaran supaya kelemahan dapat dikenalpasti dan ditambal. Penilaian siber dalaman sejak itu disambung semula di bawah kawalan baru.
Syarikat itu secara berasingan menjeda persekitaran pembelajaran pengukuhan berisiko tinggi selama beberapa minggu dan menggunakan klasifikator serupa yang direka untuk mengurangkan insentif untuk model untuk mengelakkan perlindungan. Sebilangan besar pembelajaran pengukuhan kini telah disambung semula, walaupun beberapa persekitaran berisiko tinggi tetap dijeda menunggu semakan manual atau kemas kini kepada pengelas.
Kerana insiden yang dilaporkan berlaku dalam persekitaran ujian pihak ketiga, Anthropic juga meminta organisasi untuk mengamalkan amalan keselamatan tambahan sambil menilai model pra-pelepasan yang telah mengurangkan perlindungan siber.
Panduan ini bertujuan untuk penilaian yang boleh mendorong model untuk terus menyiasat persekitaran mereka atau mencari cara kreatif untuk mengelilingi sekatan. Anthropic mengatakan cadangan itu tidak terpakai kepada pelanggan yang menggunakan model yang dilindungi seperti Claude Fable 5.
Di antara cadangan lalainya, Anthropic mengatakan penilaian siber harus dijalankan di dalam kotak pasir yang keras tanpa akses internet, dengan sambungan luaran terhad kepada API model. Kekunci API juga harus kekal di luar persekitaran ujian.
Syarikat itu juga menggesa penilai untuk membuat sempadan jelas dalam arahan mereka, dengan jelas menjelaskan tindakan mana yang dibenarkan dan dilarang. Dalam satu contoh, Anthropic mengesyorkan secara langsung memberitahu model: “Anda tidak boleh mengakses internet.”
Foto: PhotoGranary02/Shutterstock.com