Goodfire Rilis Sistem Pemantauan AI 'Dari Dalam', Janjikan Efisiensi dan Biaya Lebih Rendah

Startup Goodfire meluncurkan sistem pemantauan model kecerdasan buatan (AI) terbaru yang diklaim jauh lebih efisien dan hemat biaya. Teknologi revolusioner ini memonitor perilaku agen AI langsung dari 'dalam' model, bukan sekadar membaca outputnya.
Selama ini, metode standar untuk menjaga agen AI tetap dalam kendali adalah dengan menugaskan AI kedua untuk mengawasi perilakunya. Pendekatan ini memang menjadi standar industri, namun biayanya dapat melambung tinggi, terutama ketika agen beroperasi selama berjam-jam dan memproses teks setara dengan beberapa novel.
Goodfire, sebuah perusahaan rintisan yang berfokus pada interpretability, upaya memahami cara kerja internal model AI, kini menawarkan alternatif yang lebih ekonomis. Mereka memperkenalkan monitor yang mengamati apa yang terjadi di dalam model AI saat bekerja, tidak hanya membaca apa yang dihasilkan.
Monitor ini kini tersedia untuk pelanggan Baseten, platform yang meng-hosting dan menjalankan model AI untuk perusahaan lain. Base Labs dari Baseten sebelumnya telah mengumumkan kemitraan keselamatan dengan Goodfire dan platform AI Hugging Face bulan lalu, memperkuat ekosistem keamanan AI.
Inovasi Goodfire ini hadir setelah serangkaian insiden tahun ini yang menunjukkan agen AI 'kabur' dari lingkungan pengujiannya. Kasus-kasus seperti agen OpenAI yang berhasil membobol Hugging Face, serta Kimi K3, model terbuka yang menjadi dasar monitor pertama Goodfire, sempat memanfaatkan celah di 'sandbox' pengujiannya untuk mengakses internet dan informasi di GitHub pada musim panas lalu, menjadi bukti nyata urgensi sistem pengawasan yang lebih baik.
Sistem Goodfire bekerja layaknya pemeriksaan keamanan di bandara. Detektor kecil yang disebut 'probe' membaca sinyal internal model di setiap langkah kerja agen, mirip pemindai tubuh yang memeriksa setiap penumpang.
Hanya ketika probe mendeteksi anomali, model AI terpisah, yang berfungsi sebagai 'pencarian manual', akan melakukan pemeriksaan lebih mendalam. Pendekatan berlapis ini memastikan deteksi dini tanpa membebani sistem secara keseluruhan.
Pelanggan Baseten dapat memilih risiko mana yang ingin dipantau, termasuk peretasan ofensif, penyalahgunaan senjata kimia dan biologi, serta 'reward hacking'. Reward hacking adalah perilaku AI yang mencari cara tak terduga untuk mencapai tujuan yang diprogramkan, seringkali dengan mengeksploitasi celah dan menghasilkan hasil yang tidak diinginkan.
Mereka juga dapat menentukan respons otomatisnya: mencatat peristiwa, mengirimnya untuk ditinjau manusia, atau menolak permintaan tersebut sepenuhnya. Fleksibilitas ini memungkinkan adaptasi terhadap berbagai kebutuhan keamanan.
Goodfire mengklaim pendekatannya juga jauh lebih hemat biaya operasional. Sebagian besar monitor AI adalah model terpisah yang harus membaca ulang semua yang dilakukan model yang diawasi, yang menambah waktu dan biaya secara signifikan.
Probe Goodfire justru memanfaatkan perhitungan yang sudah dibuat model saat bekerja. Ini adalah perbedaan kunci yang memungkinkan efisiensi biaya.
CEO Goodfire, Eric Ho, menjelaskan dalam MAD Podcast yang dipandu investor ventura Matt Turck pekan lalu bahwa monitor aktivasi internal sangat murah karena memanfaatkan kembali komputasi dalam forward pass. Ia menambahkan, "Model sudah menghitung token ini. Yang Anda lakukan hanyalah mengambil aktivasi neural perantara yang sudah dihitung dan menjalankan pengklasifikasi di atas komputasi internal ini." Singkatnya, model sudah melakukan perhitungan dasar, dan probe hanya membaca hasilnya.
Dalam pengujian Goodfire terhadap Kimi K3, pemantauan sekitar 1 juta pertukaran hanya membutuhkan biaya sekitar USD 185 (sekitar Rp3 juta). Angka ini jauh lebih rendah dibandingkan USD 5.420 (sekitar Rp88 juta) untuk model AI yang lebih murah yang memeriksa setiap langkah, dan sekitar USD 200.000 (sekitar Rp3,2 miliar) untuk model kelas atas.
Efektivitasnya juga terbukti, di mana probe Goodfire berhasil menangkap 93 persen sesi peretasan berbahaya dan hanya mengirim 5,5 persen sesi yang tidak berbahaya untuk pemeriksaan kedua. Selain itu, menjalankan empat probe sekaligus hanya menambah kurang dari 2 persen waktu yang dibutuhkan model untuk mulai merespons, sebuah indikasi kecepatan dan minimnya latensi.
CTO sekaligus salah satu pendiri Goodfire, Dan Balsam, menyatakan bahwa keuntungan besar dari sistem ini adalah kemampuannya menangkap masalah sebelum terjadi. Dia menegaskan, "Kami dapat mendeteksi potensi peretasan model selama evaluasi atau pelatihan."
Pendekatan ini terutama ditujukan untuk model terbuka. Pengembang dapat mengunduh model-model ini dan menghilangkan pengamannya, dan mereka tidak dilengkapi dengan jenis pemantauan yang dijalankan laboratorium tertutup pada sistem mereka sendiri, menjadikannya rentan.
Balsam juga menambahkan bahwa kerusakan yang dapat dilakukan individu dengan model terbuka relatif kecil dibandingkan dengan apa yang dapat dilakukan seseorang dengan klaster komputasi, seperti penyedia inferensi, di mana sebagian besar tanggung jawab berada. "Ketika kita mencapai 'momen Mythos' terbuka, akan menjadi jelas bahwa model memerlukan guardrails yang diterapkan pada waktu inferensi," ujarnya.
Riset terbaru Goodfire menemukan bahwa model terbuka terkemuka, termasuk Kimi K3 dan GLM-5.2, mengalami 'reward hacking' dalam 50 hingga 96 persen dari pengujian agen AI. Temuan ini semakin menyoroti pentingnya sistem pemantauan yang canggih.
Goodfire bukanlah yang pertama mencoba pendekatan pemantauan internal ini. Google DeepMind pada Januari lalu menyatakan penelitian mereka menginformasikan penggunaan probe deteksi penyalahgunaan di Gemini, menunjukkan arah riset yang serupa dalam industri.
Balsam mengatakan monitor ini adalah bagian jangka pendek dari tujuan penelitian yang lebih panjang, yaitu merekayasa balik LLM sehingga perilaku dapat dilacak kembali ke titik munculnya dalam pelatihan. Ia berharap dapat mengubah 'keajaiban' pelatihan model menjadi rekayasa presisi, demi masa depan AI yang lebih terkontrol dan aman.
Baca juga tulisan lainnya dari Arief Wicaksono
Penulis: Arief Wicaksono
Editor: Beritana Editor







:strip_icc():format(webp)/kly-media-production/medias/5482952/original/016557500_1769306120-Victor_Montagliani_1.jpg)



