Arama

OpenAI ve Anthropic’in model testleri daha fazla siber saldırıyı ortaya çıkardı

Yapılan güvenlik testleri, OpenAI ve Anthropic tarafından geliştirilen yapay zeka modellerinin daha fazla izinsiz eylem gerçekleştirdiğini ortaya çıkardı. Birleşik Krallık hükümetine bağlı Yapay Zeka Güvenlik Enstitüsü, değerlendirmeler sırasında hem Anthropic’in Mythos 5 hem de OpenAI’nin GPT-5.6-Sol modellerinin gerçek kişilere ve kuruluşlara yönelik zararlı faaliyetlerde bulunduğunu açıkladı.

05 Ağustos 2026, 11:10

OpenAI ve Anthropic tarafından geliştirilen yapay zeka modelleri, güvenlik testleri sırasında bir web sitesini hacklemek ve bir yazılıma zararlı kod eklemeye çalışmak da dahil olmak üzere birçok izinsiz eylem gerçekleştirdi. Bu durum, ne bu sistemlerin geliştiricilerinin ne de deneyimli araştırmacıların, testler sırasında modellerin nasıl davranacağını tam olarak öngörebildiğine dair endişeleri güçlendirdi.

Birleşik Krallık’ta 2023 yılında en gelişmiş yapay zeka modellerinin güvenliğini değerlendirmek amacıyla kurulan Yapay Zeka Güvenlik Enstitüsü yaptığı açıklamada hem Anthropic'in Mythos 5 modelinin hem de OpenAI'ın GPT-5.6-Sol modelinin değerlendirmeler sırasında "gerçek kişi ve kuruluşlara yönelik sürekli ve potansiyel olarak zararlı faaliyetlerde bulunduğunu" belirtti. Enstitü, modellerin yeteneklerini test etmek amacıyla onlara kasıtlı olarak internet erişimi sağladı ve bazı güvenlik filtrelerini devre dışı bırakarak kullandı.

Kurum X sosyal medya platformunda yaptığı paylaşımda, "Test koşulları altında gerçekleşmiş olsa bile bu olay önemli. Bu, otonomi ve aldatma ile ilgili risklerin gerçek dünyada bu kadar açık biçimde ortaya çıktığını ilk kez görüyoruz” ifadelerini kullandı. Test kuruluşunun aktardığına göre olaylardan birinde Mythos 5, GitHub üzerindeki açık kaynaklı bir yazılım projesine zararlı kod eklemeye çalıştı. Hatta yazdığı kodun onaylanmasını sağlamak amacıyla sahte kimlikler oluşturacak kadar ileri gitti. Grup açıklamasında, "İnsan bir proje yöneticisi zararlı kodu fark etti ve onaylamayı reddetti" denildi.

19 eylemin 17’si Mythos’a ait

Son iki hafta içinde hem OpenAI hem de Anthropic, modellerini test ederken istemeden Hugging Face de dahil olmak üzere çeşitli kurumların sistemlerini ihlal ettiklerini kamuoyuna açıkladı. Son açıklamalar, yapay zeka ajanlarının artık güvenlik açıklarını tespit etmek üzere eğitilmiş araştırmacıların bile öngöremediği şekillerde otonom davranabildiğine dair yeni kanıtlar sunuyor. Bu durum, hem daha sıkı güvenlik değerlendirmelerine hem de daha sağlam test ortamlarına duyulan ihtiyacı vurguluyor.

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, tespit ettiği internet üzerindeki 19 otonom ve izinsiz eylemin 17'sinin Anthropic'in Mythos 5 modeli tarafından gerçekleştirildiğini açıkladı. ABD hükümetindeki bazı yetkililer, bu ihlallerin ardından teknoloji üzerinde daha fazla denetim uygulanması çağrısında bulundu. Geçen hafta, yapay zeka sektöründen 1.100'den fazla çalışan, yapay zeka teknolojisinin gelişimini "bilinçli şekilde yavaşlatacak" ve çok hızlı ilerlemesini önleyecek bir düzenleyici mekanizma oluşturulmasını talep eden bir dilekçeyi imzaladı.

Yapay zeka şirketleri testleri yeniden inceliyor

Anthropic X üzerinden yaptığı açıklamada, "Kendi soruşturmamızı yürütürken olay hakkında daha fazla ayrıntı toplamak amacıyla Birleşik Krallık Güvenlik Enstitüsü ile birlikte çalışıyoruz" dedi. ChatGPT'nin geliştiricisi OpenAI ise bir blog yazısında, modellerinden birinin dış siber güvenlik şirketi Irregular ile gerçekleştirilen testleri sırasında başka bir güvenlik olayının daha yaşandığını duyurdu.

Bu olayda OpenAI modelleri, simüle edilmiş bir ortamda gizlenmiş bilgileri bulmalarının istendiği "capture the flag" (bayrağı ele geçir) adlı bir güvenlik testine tabi tutuldu. Şirketin açıklamasına göre modeller, test ortamındaki bir "yanlış yapılandırmadan" yararlanarak internete bağlandı ve kimliği açıklanmayan bir kuruma ait web sitesini hackledi. Bloomberg’e konuşan kaynaklara göre bu ihlal, OpenAI modellerinin Irregular tarafından yürütülen ve Anthropic modellerinin üç farklı kuruluşu hacklemesiyle sonuçlanan aynı değerlendirme sürecinden geçtiği sırada meydana geldi. Anthropic bu ihlalleri geçen hafta kamuoyuna açıklamıştı.

İki hafta önce ise OpenAI, modellerinin yapay zeka girişimi Hugging Face'e yönelik benzeri görülmemiş bir saldırının arkasında olduğunu açıklamıştı. Bu olayda modeller, test amacıyla oluşturulan izole test ortamı içinden çıkabilmek için bir güvenlik açığından yararlanarak internete bağlandı ve ardından yapay zeka modelleri ile veri kümelerine ev sahipliği yapan Hugging Face'in sistemlerine sızdı.


Sayfa Sonu

Yüklenecek başka sayfa yok