Yapay zekâ modellerinin çoğu terör planlamasına izin veriyor

Londra merkezli kuruluşun test ettiği 134 modelden 132'si, kitlesel saldırı veya ölümcül silah geliştirme konusunda bilgi sağladı.

Tech Against Terrorism tarafından yürütülen ve yapay zekâ sistemlerindeki güvenlik zafiyetlerini mercek altına alan yeni bir araştırma, sektörün önde gelen dil modellerinin kötüye kullanıma karşı yeterince korunmadığını gösterdi. Araştırma ekibi, geliştirdikleri CT-AI test sistemiyle 134 büyük dil modelini terör saldırısı senaryolarıyla sınadı. Sonuçlar, incelenen modellerin neredeyse tamamının güvenlik filtrelerini aşabildiğini ve tehlikeli içerik üretebildiğini ortaya koydu.

Test sürecinde modellere, terör eylemi planlayan bir kişinin arayabileceği türden 627 farklı talep yöneltildi. Bu talepler karşısında 81 model eksiksiz yanıt verirken, 51 model de saldırı planlamasında kullanılabilecek bilgiler sundu. Sadece iki model güvenlik testlerini geçici olarak başarıyla tamamladı. Araştırmacılar, bazı modellerdeki güvenlik önlemlerinin üç gün gibi kısa bir sürede devre dışı bırakılabildiğine dikkat çekti.

Araştırmanın çarpıcı bulgularından biri, modellerin yanıtlarının kullanıcının kendini nasıl tanıttığına göre radikal biçimde değişmesiydi. Kendisini terörist olarak tanıtıp saldırı düzenleme niyetini açıkça belirten kullanıcılara, taleplerin yüzde 2'sinden azında kullanılabilir yanıt döndürüldü. Ancak kullanıcı kendini güvenlik araştırmacısı olarak tanıttığında, kullanılabilir yanıt oranı yüzde 16,9'a yükseldi. Bu durum, ilk gruba kıyasla 8,9 kat daha yüksek bir oran anlamına geliyor.

Tech Against Terrorism'in kurucusu Adam Hadley, bulguları değerlendirirken modellerin sadece kibarlaştırıldığını ancak güvenli hale getirilmediğini vurguladı:

“Terörist olduğunu söyleyen birini reddedip araştırmacı olduğunu söyleyen birine yanıt veren model güvenli hale getirilmiş değildir. Yalnızca kibar hale getirilmiştir.”

Güvenlik kısıtlamaları kaldırılan modeller risk oluşturuyor

Rapor, "Abliterated AI" olarak adlandırılan ve zararlı içerik üretimini engelleyen mekanizmalardan arındırılmış modellerin yaygınlaşmasına da işaret etti. Bu kategoride incelenen 13 modelin tamamı güvenlik testlerinde başarısız oldu. Kuruluş, bağımsız testlerden geçemeyen modellerin uygulama mağazalarından, arama sonuçlarından ve öneri sistemlerinden çıkarılmasını önerdi. Ayrıca bu modellere erişimde kimlik doğrulaması uygulanması ve güvenlik çalışmalarının açık kaynak geliştiricilerle işbirliği içinde yürütülmesi gerektiği belirtildi.

Araştırmacılar, yapay zekâ geliştiricilerinin güvenlik önlemlerini uygulamakla yetinmemesi, bu önlemlerin ne kadar kolay aşılabildiğini de test etmesi gerektiğini vurguladı. Modellerin eğitimi sırasında tehlikeli bilgilerin ve bilinen terör örgütleriyle bağlantılı içeriklerin filtrelenmesi önerilirken, her modelin kullanıma sunulmadan önce bağımsız güvenlik testlerinden geçirilmesi ve sonuçların kamuoyuyla paylaşılması istendi.

Güvenlik ve yenilik arasındaki denge hükümetlerin gündeminde yer almaya devam ediyor. Eski Anthropic araştırmacısı Jacob Coxon, New York'ta düzenlenen bir oturumda yapay zekânın yaratabileceği riskleri dile getirdi. İngiltere Başbakanı Andy Burnham ise eski Başbakan Gordon Brown tarafından düzenlenen yapay zekâ zirvesinde, teknolojinin yararlarına odaklanılması gerektiğini ancak risklerin göz ardı edilemeyeceğini söyledi. Burnham, İngiltere'nin 2027'deki G20 dönem başkanlığını yapay zekâ alanında ortak güvenlik standartları geliştirmek için kullanmayı hedeflediklerini açıkladı.

Tech Against Terrorism, ailelerin, okulların ve kamu kurumlarının daha güvenli sistemleri tercih edebilmesi için şeffaf değerlendirmelerin şart olduğunu belirtti. Kuruluş, bilinçli kullanıcı tercihlerinin şirketleri kurallardan daha hızlı harekete geçirebileceğini ifade ederek şu değerlendirmede bulundu:

“Bilgi sahibi alıcılar, şirketleri kurallardan daha hızlı harekete geçirir.”

İLGİLİ HABERLER