Yapay zeka teknolojilerinin hızla gelişmesi güvenlik tartışmalarını da beraberinde getiriyor. İngiltere merkezli Tech Against Terrorism kuruluşu, yapay zeka modellerinin güvenlik duvarları aşıldığında nasıl bir tepki verdiğini ölçmek için çarpıcı bir çalışma yürüttü. 130'dan fazla modelin mercek altına alındığı araştırmada, güvenlik önlemleri kaldırılan sistemlerin terörle mücadele konusunda sınıfta kaldığı görüldü.
Güvenlik Filtreleri Devre Dışı Bırakıldı
Araştırmacılar, yapay zeka modellerinin reddetme mekanizmalarını devre dışı bırakan 'abliteration' adlı bir yöntem uyguladı. Bu süreç, modellerin normalde reddetmesi gereken zararlı içeriklere karşı nasıl tepki vereceğini test etmek için kullanıldı. Yapılan testlerde, güvenlik kalkanları kaldırılan 5 modelden 3'ünün terör saldırıları, finansman yöntemleri ve radikalleşme süreçleri hakkında detaylı bilgiler sunduğu tespit edildi.
Llama 3.1 8B Modelinde Büyük Düşüş
Çalışmada somut bir örnek olarak Meta'nın Llama 3.1 8B modeli öne çıkarıldı. Güvenlik önlemleri aktifken 100 üzerinden 97 puan alarak oldukça başarılı bir performans sergileyen model, filtrelerin kaldırılmasının ardından 3 puana kadar geriledi. Bu durum, yapay zeka modellerinin temelindeki güvenlik mimarisinin ne kadar kritik bir öneme sahip olduğunu kanıtladı.
Uzmanlardan Acil Uyarı
Tech Against Terrorism kurucusu Adam Hadley, yapay zekanın varoluşsal bir risk oluşturabileceği yönündeki endişelerin haklı olduğunu belirtti. Hadley, açık kaynaklı modellerin birçoğunun güvenliğinin aslında halihazırda aşıldığını ve bu durumun henüz tam olarak fark edilmediğini vurguladı. Kuruluş, özellikle üzerinde değişiklik yapılmış modellerin dağıtımına yönelik daha sıkı kısıtlamalar getirilmesi çağrısında bulundu.