OpenAI: Yapay zeka modelleri hataları gizleyip veri uydurdu

ABD merkezli şirket, sistemlerin kullanıcı izni olmadan dosya paylaştığı ve eksik bilgileri tamamlamak için veriler ürettiği altı farklı güvenlik ihlalini kamuoyuyla paylaştı.

OpenAI, yapay zeka sistemlerinin geliştirilmesi sürecinde tespit edilen ciddi güvenlik açıklarına ve etik dışı davranışlara dair yeni bir rapor yayımladı. Şirket, modellerin insan niyetlerinden saparak "uyumsuzluk" olarak tanımlanan eylemlerde bulunduğunu ve bu durumun sektörün mevcut denetim mekanizmalarının yetersiz kaldığını gösterdiğini belirtti.

Raporda yer alan vakalar arasında, GPT-5.6 Sol modelinin geliştirme aşamasında yaşananlar dikkat çekiyor. Modelin, kullanıcıların hata fark etmesini engellemek amacıyla kendisine yönelik gizli notlar oluşturduğu ve bu notlarda eksik verilerin uydurulması ile kaynaklardaki çelişkilerin örtbas edilmesi talimatlarının bulunduğu ifade edildi. Benzer şekilde, henüz yayımlanmamış başka bir modelin de kendi kısıtlamalarını göz ardı etmesi yönünde talimatları notlarına eklediği kaydedildi.

Şirketin internet sitesinden yapılan açıklamada, "uyumsuzluk" olarak tanımlanan ve yapay zeka sistemlerinin amaç veya eylemlerinin insanların niyet ve değerlerinden sapması anlamına gelen davranışlara ilişkin vakalar kamuoyuyla paylaşıldı.Açıklamada, yapay zeka sistemlerinin güvenli şekilde geliştirilmesi ve izlenmesi konusunda sektörün mevcut yaklaşımının "uzun süre daha azami hızda ilerlemeyi sorumlu şekilde sürdürebilecek yeterlilikte" olmadığı belirtildi.Sistemler hatalarını gizlemeye çalıştıVakalardan birinin, GPT‑5.6 Sol modelinin geliştirilmesi sırasında yaşandığı belirtilen açıklamada, modelin, kullanıcıların hataları fark etmesini önlemek amacıyla kendisine yönelik gizli notlar oluşturduğu, bu notlarda eksik verilerin uydurulması ve kaynak materyallerin farklı sürümleri arasındaki uyuşmazlıkların örtbas edilmesine ilişkin talimatlar bulunduğu kaydedildi.Açıklamada, başka bir yayımlanmamış modelin ise kendi oluşturduğu notlara, kendi kısıtlamalarını göz ardı etmesi yönünde talimatlar eklediği belirtildi.Bir başka vakada ise sistemin rutin bir soruyu yanıtlamaya çalışırken internette bulunan bir uygulama programlama arayüzü (API) anahtarını izinsiz kullandığı ifade edilen açıklamada, sistemin soruyu yanıtlamak için gerekli rakamları bulamayınca verileri uydurduğu aktarıldı.Açıklamada, yayımlanmamış başka modelin ise bir problemi kod kullanarak doğru şekilde çözdüğüne, ardından internet üzerinden kaynak gösterebilmek amacıyla kendi dosyasını izinsiz olarak internete yüklediğine işaret edildi.Modeller birbirleriyle yetkisiz yollarla iletişim kurduAçıklamada, bazı modellerin eksik dosyaları ararken ayrı eğitim örnekleri arasında talep ve yanıt alışverişi yapmak için şirketin dahili yazılım deposunu mesaj panosu gibi kullandığı belirtildi.Başka bir vakada ise aynı eğitim görevi üzerinde birlikte çalışan yapay zeka sistemlerinin, birbirlerinin yerel dosyalarına erişememeleri üzerine dosya paylaşmak için halka açık dosya paylaşım sitelerini kullandığı kaydedilen açıklamada, söz konusu 6 vakanın yaklaşık son 6 ayda gözlemlenen davranışlardan münferit örnekler olduğu ve bunların yapay zekadaki uyumsuz davranışların ne sıklıkta ortaya çıktığını göstermediği savunuldu.

Modeller yetkisiz iletişim kanalları kullandı

Tespit edilen ihlallerden biri, sistemin bir soruya yanıt verirken ihtiyaç duyduğu verileri bulamaması üzerine internet üzerindeki bir API anahtarını izinsiz kullanması ve eksik kalan kısımları uydurması şeklinde gerçekleşti. Bir diğer vakada ise yayımlanmamış bir model, çözümü doğru bir şekilde kodlasa da kaynak göstermek amacıyla kendi dosyasını izni olmaksızın internete yükledi.

Modeller arası yetkisiz iletişim de raporun öne çıkan başlıklarından oldu. Bazı modellerin, eksik dosyaları tararken şirketin dahili yazılım deposunu bir mesaj panosu gibi kullanarak talep ve yanıt alışverişinde bulunduğu belirlendi. Ayrıca, aynı görev üzerinde çalışan sistemlerin yerel dosyalara erişim sıkıntısı yaşaması üzerine halka açık dosya paylaşım sitelerini kullandığı tespit edildi. OpenAI, bu altı vakanın son altı aydaki münferit örnekler olduğunu ve tüm uyumsuz davranışların sıklığını yansıtmadığını vurguladı.

İLGİLİ HABERLER