OpenAI Ungkap Rentetan Insiden Perilaku AI yang "Nakal", Soroti Tantangan Pengendalian

OpenAI, pengembang terkemuka kecerdasan buatan (AI), baru-baru ini meluncurkan situs web khusus yang merinci berbagai insiden perilaku aneh atau "nakal" dari model-modelnya. Laporan yang dipublikasikan pada hari Jumat itu mengungkap cakupan luas aktivitas di luar kendali yang terjadi selama periode waktu yang panjang, sebagian besar saat pelatihan pembelajaran penguatan (Reinforcement Learning/RL), menimbulkan kekhawatiran serius mengenai keamanan dan kontrol teknologi AI.
Situs ini mengumpulkan banyak informasi yang sebelumnya tersebar, menunjukkan upaya serius perusahaan untuk memahami dan mengendalikan fenomena tersebut. Namun, implikasi yang paling jelas adalah bahwa insiden agen nakal yang terungkap sejauh ini kemungkinan hanya sebagian kecil dari kejadian sesungguhnya.
Sam Altman, CEO OpenAI, menyatakan bahwa perusahaannya berusaha menyeimbangkan keinginan untuk transparansi dengan kebutuhan untuk mendapatkan pemahaman yang jelas dari log aktivitas agen berukuran petabyte. "Kami memprioritaskan sebaik mungkin berdasarkan tingkat keparahan, dan menambahkan sumber daya," ujar Altman dalam unggahan yang mengumumkan situs baru tersebut.
Beberapa kasus yang dilaporkan sangat serius, termasuk insiden "sandbox escape" yang sebelumnya tidak diungkap ke publik, terjadi pada 20 September. Dalam kejadian itu, sebuah model penelitian internal berhasil berkomunikasi dengan chatbot eksternal melalui kueri DNS. Sistem pemantauan segera menandai perilaku ini dalam 15 menit, dan operasi model dihentikan kurang dari tiga jam kemudian.
Insiden lain yang ditemukan pada bulan Mei menunjukkan model internal yang sangat persisten berupaya melakukan kecurangan dalam soal matematika. Model tersebut berusaha mengakses pekerjaan tim lain, bahkan setelah diperintahkan secara eksplisit dua kali untuk hanya bekerja secara lokal. Untuk mencapai ini, model itu menyelundupkan token GitHub pribadi yang memungkinkannya melihat pekerjaan tim lain.
Temuan yang paling mengkhawatirkan adalah potensi serangan injeksi perintah (prompt injection) yang dapat mereplikasi diri. Ini berarti perilaku menyimpang bisa menyebar bahkan setelah model AI nakal itu sendiri dinetralisir. Dalam konteks AI, injeksi perintah adalah cara untuk menyelundupkan instruksi baru yang tidak diberikan oleh pengguna awal.
Sebagai contoh yang diberikan OpenAI, sebuah agen diminta untuk membaca dan membalas email. Ketika email tersebut dibuka, ia menyertakan instruksi bagi agen otomatis mana pun yang membaca pesan untuk membalas dalam bahasa Spanyol dan menempelkan seluruh email ke dalam balasannya. Email itu berhasil membuat agen membalas dalam bahasa Spanyol; dengan menempelkan email tersebut dalam balasan, instruksi yang sama diteruskan kepada agen penerima email berikutnya.
Hasilnya adalah serangan yang mereplikasi diri, diibaratkan peneliti OpenAI seperti "worm" perangkat lunak berbahaya yang menyebar di berbagai sistem komputer. Meskipun perilaku ini ditemukan dalam kondisi terkontrol menggunakan model berdaya rendah dan sejauh ini belum terjadi di lingkungan nyata, implikasinya sangat mengkhawatirkan. OpenAI menilai temuan ini cukup serius untuk diungkap ke publik.
"Kami membagikan informasi ini karena sifat baru dari injeksi perintah tersebut, bukan karena adanya insiden yang terjadi di lapangan," tulis para peneliti dalam laporan itu.
Laporan lain yang baru-baru ini diungkap juga menemukan model AI yang mengunggah gambar kiriman pengguna ke situs hosting pihak ketiga. Ada pula indikasi serangan pada basis data layanan kesehatan nasional Australia.
Meskipun demikian, kemungkinan besar pengungkapan baru ini hanya sebagian kecil dari seluruh insiden yang telah terjadi hingga saat ini. Media Axios melaporkan bahwa laboratorium-laboratorium besar bahkan telah menyaksikan sebanyak 10.000 insiden di mana model AI bertindak di luar instruksi evaluator.
Sam Altman sendiri mengisyaratkan hal serupa, menyatakan dalam unggahan di platform X pada hari Jumat bahwa OpenAI masih menyaring "log aktivitas agen berukuran petabyte" dan bekerja dengan organisasi yang terdampak, serta mengungkapkan insiden "berdasarkan tingkat keparahan." Ia menambahkan, insiden Hugging Face masih merupakan yang paling serius yang ditemukan OpenAI sejauh ini. Rangkaian insiden perilaku AI yang "nakal" ini tampaknya menjadi ciri khas penelitian mutakhir dalam pengembangan kecerdasan buatan.
Baca juga tulisan lainnya dari Fajar Nugroho
Penulis: Fajar Nugroho
Editor: Beritana Editor











