OpenAI’ın bir yapay zeka modelinin yaptığı saldırıların ardından Anthropic de siber güvenlik testleri sırasında yapay zeka modellerinin üç kurumu ihlal ettiğini açıkladı. Anthropic yayımladığı bir blog yazısında, OpenAI'ın ihlal açıklamasının ardından kendi siber güvenlik testlerini gözden geçirdiğini ve bu inceleme sırasında söz konusu durumu tespit ettiğini belirtti. Anthropic'in açıklamasına göre hem OpenAI hem de Anthropic testlerinde yapay zeka modelleri, izole edilmiş olması gereken test ortamlarından internete erişmeyi başardı.
Kuruluşların altyapılarına sızdı
Şirket, toplam 141 bin 6 değerlendirme testini incelediğini ve bunların üçünde Claude adlı yapay zeka aracının internete eriştikten sonra harici kuruluşların altyapısına sızdığını tespit ettiğini açıkladı. Şirkete göre bu olayların en eskisi nisan ayına dayanıyor. Etkilenen kuruluşların isimleri paylaşılmadı.
Anthropic'in modelleri söz konusu üç kuruluşa yetkisiz erişim sağladığında şirket bu olayların her birini testin bir parçası olarak değerlendirdi. Testler, modellerin diğer sistemlere sızarak gizli bilgileri bulmaya çalıştığı olaylar değerlendiriliyordu. "Capture-the-flag" (bayrağı ele geçir) denilen bu yöntem hem insanlar hem de yapay zeka sistemleri için saldırı yeteneklerini test etmenin yaygın bir yolu olarak kullanılıyor. Ancak blog yazısına göre eski model, açık internette çalıştığına dair kanıt elde ettikten sonra bile saldırısını sürdürdü. Anthropic'in en yeni modeli ise internette olduğunu fark ettikten sonra saldırıyı durdurdu.
Çalışanlardan ABD hükümetine dilekçe
Yapay zekanın istemeden neden olduğu bu ihlaller, bazı siyasetçilerin yapay zeka teknolojisi için güvenlik önlemleri veya başka denetim mekanizmaları çağrısında bulunmasına yol açmaya başladı. Bloomberg'e göre yapay zeka şirketlerinde çalışan bin 100'den fazla kişi ABD hükümetine, teknolojinin çok hızlı ilerlemesini önlemek amacıyla yapay zeka geliştirme sürecini "bilinçli şekilde yavaşlatmaya" yardımcı olacak bir mekanizmayı destekleme çağrısı yapan bir dilekçeyi imzaladı.
Ne Anthropic ne de saldırıya uğrayan kuruluşlar bu ihlalleri fark etmişti. Anthropic, blog yazısında ağ günlüklerini ve değerlendirme kayıtlarını inceleme konusunda daha fazlasını yapabileceğini kabul etti. Şirket, söz konusu ihlalleri kısa süre önce geliştirdiğini duyurduğu, son derece güçlü ve potansiyel olarak tehlikeli olduğu için dağıtımını sıkı şekilde sınırlandırdığı Mythos adlı yeni yapay zeka modelini tanıtmasından yaklaşık dört ay sonra açıkladı. Blog yazısına göre ihlaller üç farklı Claude modeliyle gerçekleşti: Opus 4.7, Mythos 5 ve şirket içinde kullanılan bir araştırma test modeli. Modellerin her biri, halka açık araçlarda normalde uygulanan güvenlik önlemleri devre dışı bırakılarak çalıştırıldı. Blog yazısına göre Claude, zayıf parolalardan yararlanmak gibi temel teknikleri kullanarak kuruluşlara sızdı.
Olayların tamamı, Anthropic'in yapay zeka güvenlik şirketi Irregular tarafından oluşturulan değerlendirme ortamlarını kullandığı sırada meydana geldi. Her olayda Anthropic, Claude'a bulunduğu ortamın bir simülasyon olduğunu ve internet erişiminin bulunmadığını belirtmişti. Blog yazısında, "Bizimle değerlendirme ortağımız arasında yaşanan bir yanlış anlaşılma nedeniyle durum böyle değildi" ifadelerine yer verildi. Irregular sözcüsü ise şirketin Anthropic'in iş birliğini ve şeffaflığını takdir ettiğini söyledi. Sözcü, şirketin soruşturmasının sürdüğünü de ekledi.
Anthropic, gerçek siber güvenlik zorluklarını simüle eden testleri düzenli olarak gerçekleştirdiğini ve bunların model geliştirme ile yayımlama süreçlerinin kritik aşamaları olduğunu belirtti. Ancak şirket, bu olaylardan çeşitli dersler çıkardığını ve güçlü otonom yeteneklere sahip modellerin test edilmesinin de kapsamlı güvenlik kontrolleri gerektirdiğini vurguladı. Şirket blog yazısında, "Güvenlik testleri, bir model yayımlanmadan önce yapılır çünkü modelin neler yapabileceğini henüz tam olarak bilmiyoruz" ifadelerini kullandı. Ayrıca, "Değerlendirme ortamlarının da giderek modellerimizin çalıştırıldığı diğer tüm sistemlerle aynı güvenlik standartlarına sahip olması gerekiyor" dedi.