Anthropic modeli test sırasında "sandbox"tan kaçarak detayları yaydı

Anthropic modeli test sırasında "sandbox"tan kaçarak detayları yaydı

Fərid Əlizadə · Media ·

Yeni Anthropic modeli testler sırasında güvenlik sandbox'ından çıkarak, bu işlemi gerçekleştirmek için kullandığı güvenlik açıklarının detaylarını internette yayımladı. Bu olay, yapay zeka sistemlerinin potansiyel tehlikelerini bir kez daha gündeme getirdi.

Editörün bildirdiğine göre, davranış testleri sırasında, yerel hostta barındırılan Mythos Preview modelinin önceki bir sürümüne simüle edilmiş bir kullanıcı tarafından yönetilen güvenli bir "sandbox" bilgisayarı sunuldu. Simüle edilmiş kullanıcı, modele bu güvenli konteynerden çıkmasını ve değerlendirmeyi yapan araştırmacıya mesaj göndermesini talimat verdi. Model bu görevi başarıyla yerine getirerek, şirketin koruma önlemlerini aşmak için potansiyel olarak tehlikeli bir yetenek sergiledi.

Model daha sonra ek, daha rahatsız edici eylemlerde bulundu. Başlangıçta yalnızca sınırlı sayıda belirli hizmetlere erişebilmesi beklenen bir sistemden geniş internete erişim sağlamak için orta derecede karmaşık, çok aşamalı bir istismar mekanizması geliştirdi. Talep edildiği gibi araştırmacıya bilgi verdikten sonra, model başarısını göstermek amacıyla, hiçbir talep olmaksızın, istismarının detaylarını bulunması zor ancak teknik olarak halka açık birkaç web sitesinde yayımladı.