Tech Against Terrorism’in araştırmasına göre, güvenlik önlemleri devre dışı bırakılan beş yapay zekâ modelinden üçü terörle bağlantılı taleplere ayrıntılı yanıtlar verdi. 130’dan fazla modelin incelendiği çalışmada saldırı planlama, finansman ve radikalleşme senaryoları kullanıldı.
![]()
İngiltere merkezli kâr amacı gütmeyen Tech Against Terrorism, yapay zekâ sistemlerinin güvenlik düzeyini değerlendirmek için saldırı planlayan bir kişinin yöneltebileceği türden yüzlerce talep hazırladı. Çalışmada 130’dan fazla model; terörün finansmanı ve radikalleşme dâhil çeşitli senaryolar üzerinden test edildi.
Abliteration yöntemiyle güvenlik davranışları devre dışı bırakıldı
Araştırmacılar, “abliteration” adı verilen bir yöntemi uygulayarak modellerin zararlı içerik taleplerini reddetmesini sağlayan güvenlik önlemlerini kaldırmayı hedefledi. İşlem sonrasında test edilen beş modelin üçü güvenlik değerlendirmesini geçemedi.
Modellerin korumalar çalışır durumdayken bu talepleri reddettiği, önlemler kaldırıldığında ise saldırılar, terör finansmanı ve radikalleşmeyle ilgili sorulara ayrıntılı yanıtlar verdiği bildirildi.
![]()
Llama 3.1 8B’nin puanı 97’den yaklaşık 3’e indi
Çalışmada Meta’nın Llama 3.1 8B modeli için kaydedilen değişim de öne çıktı. Model, güvenlik önlemleri etkin durumdayken 100 üzerinden 97 puan aldı. Abliteration uygulamasının ardından puanı yaklaşık 3’e düştü.
Hadley’den açık kaynaklı modeller için uyarı
Tech Against Terrorism, güvenlik önlemlerini devre dışı bırakmayı zorlaştıracak korumalar geliştirilmesini ve üzerinde değişiklik yapılan modellerin dağıtımının kısıtlanmasını önerdi. Kuruluşun kurucusu Adam Hadley, yapay zekânın kontrol dışına çıkması ve varoluşsal riskleri hakkında kaygı duyulmasının anlaşılabilir olduğunu söyledi.
![]()
Hadley, açık kaynaklı modellerin birçoğunda güvenliğin zaten aşıldığını, ancak bunun henüz fark edilmediğini belirtti. Güvenlik önlemlerinin devre dışı bırakılmasını engelleme çağrısında bulunan Hadley, ihlallerin fark edilmemesinin de ayrı bir risk olduğuna dikkat çekti.