jurnalistik.co.id – Sebuah temuan uji keamanan kembali menyoroti risiko “jailbreak” pada model AI. Peneliti mengatakan mereka mampu membujuk dua model populer Kimi agar membahas cara membuat senjata biologis dan melakukan pembunuhan.
Moonshot, pengembang di balik Kimi, menyatakan tengah melakukan peninjauan internal setelah insiden itu dibawa ke perhatian pihak ketiga. Mindgard—lembaga yang menguji keamanan sistem AI—melaporkan temuannya pada Juli, bahwa Kimi K2.6 dan K3 Swarm dapat melewati batas keamanan yang ditetapkan pengembang.
Menurut penjelasan Mindgard, proses tersebut muncul lewat apa yang disebut “jailbreaking”. Dalam skema ini, peneliti memakai serangkaian instruksi kompleks untuk menguji apakah alat AI mengabaikan pagar pengaman (guardrails) saat pengguna mendorong topik yang seharusnya ditolak.
Temuan Mindgard dan respons Moonshot
Mindgard menyampaikan bahwa guardrails seharusnya menghentikan Kimi agar tidak masuk ke pembahasan yang mengarah pada topik berbahaya. Namun, pada kasus Kimi K2.6 dan K3 Swarm, model justru diklaim dapat “menghindari” batas tersebut.
Moonshot mengatakan mereka menyambut masukan dari pihak luar sebagai “as a key pillar for building better and safer AI”. Perusahaan juga mengaku sedang berdiskusi dengan Mindgard mengenai temuan yang diangkat.
Di sisi lain, pendiri Mindgard, Peter Garraghan, menyebut temuan tersebut mengkhawatirkan. Ia mengatakan, “Once the jailbreak works it will talk about any topic, it will even freely offer up recommendations about other topics that are also nefarious and it will be inventive and creative,”
Garraghan menilai jailbreak menghadirkan bentuk risiko yang berbeda dari insiden-insiden AI belakangan. Sejumlah kasus sebelumnya memperlihatkan agen AI—alat otonom—bisa mengeksploitasi layanan daring tertentu.
Dalam penjelasan yang dirujuk, agen-agen semacam itu dikembangkan oleh perusahaan asal Amerika Serikat, termasuk OpenAI, Meta, dan Anthropic. Kekhawatirannya, meski proses jailbreak tidak selalu instan, para peretas atau aktor dengan niat buruk bisa berupaya memakainya untuk menimbulkan dampak.
Sejauh mana “hasil” itu dibuktikan
Mindgard tidak memaparkan bukti apakah jawaban yang diberikan Kimi pada topik yang mengkhawatirkan benar-benar bisa diterapkan secara efektif. Namun, lembaga tersebut berargumen bahwa pagar pengaman semestinya mampu mencegah model masuk ke percakapan seperti itu.
Selain itu, Mindgard juga menyampaikan keyakinan bahwa versi Kimi yang sudah “di-jailbreak” bisa menjadi titik berangkat bagi serangan siber. Mereka menyebut jailbreak pada Kimi 2.6 berpotensi memungkinkan peretas menjalankan kode pada sumber daya komputasi milik sistem, sekaligus menghubungkannya ke internet.
Berita Terkait
Garraghan juga membela keputusan Mindgard untuk memublikasikan temuan terkait sistem Moonshot. Ia menyatakan perusahaan sudah memberi tahu pengembang, dan publikasi itu tidak mengungkap rincian kunci tentang bagaimana model diatur agar mengabaikan guardrails.
Menurut kronologi yang disampaikan, Mindgard mengabari Moonshot lewat email pada 27 Juli, lalu melakukan tindak lanjut sekitar seminggu kemudian. Mindgard kemudian menerbitkan blog mengenai isu itu pada 12 September.
Namun, Moonshot baru melakukan kontak dalam waktu yang lebih belakangan, setelah perusahaan diajak berkomentar oleh BBC. Dalam email balasan yang dibagikan kepada BBC oleh Moonshot, perusahaan menyatakan model mereka secara umum menunjukkan “a high refusal rate for these types of requests” pada evaluasi internal.
Kekhawatiran serupa sebelumnya juga muncul di lingkungan industri. Anthropic, misalnya, pernah menyatakan telah mengidentifikasi dan menggagalkan upaya penggunaan model untuk “malicious activity” yang dapat mendukung pengembangan senjata biologis.
Perdebatan model terbuka dan tertutup
Temuan ini datang saat industri AI masih terbelah mengenai apakah model tertutup berpemilik, seperti yang digunakan ChatGPT dan Claude, lebih aman dibanding alat sumber terbuka. Di sisi lain, ada juga pandangan bahwa pendekatan terbuka dapat lebih mudah diawasi dan dimanfaatkan untuk kebutuhan pertahanan siber.
Kimi sendiri disebut sebagai model dengan bobot terbuka (open-weight). Artinya, secara teori seseorang dapat mengambil model tersebut dan menjalankannya di infrastruktur komputasi sendiri.
Prof Alan Woodward dari University of Surrey mengatakan kepada BBC bahwa memang ada risiko model open-source bisa berakhir di tangan yang salah. Tetapi, ia juga menilai model seperti itu dapat dimanfaatkan untuk memperkuat pertahanan siber.
Woodward menyinggung contoh penggunaan model sumber terbuka asal Tiongkok oleh Hugging Face untuk memahami sebuah peretasan yang kemudian terungkap dilakukan oleh agen-agen AI. Ia menambahkan bahwa upaya regulasi internasional kemungkinan tidak bergerak secepat perkembangan teknologi AI.
Ia mengilustrasikan hal tersebut dengan pernyataan, “It’s taken us decades to agree on the format of telephone numbers.”
Sejalan dengan Garraghan, Woodward juga menekankan perlunya fokus yang lebih besar pada identifikasi dan penuntutan terhadap manusia yang menyalahgunakan AI. Dengan kata lain, selain memperbaiki pagar pengaman pada model, penegakan terhadap pelaku tetap dianggap krusial.
Dalam konteks temuan Mindgard dan respons Moonshot, pusat perhatian kini kembali pada bagaimana guardrails dirancang, diuji, dan dipastikan tidak mudah ditembus melalui skenario instruksi yang dirancang khusus. Bagi publik, kabar ini menjadi pengingat bahwa keamanan AI tidak berhenti pada klaim perlindungan, melainkan perlu pengujian berulang menghadapi teknik “jailbreak”.












