Botların yalnızca kendi aralarında haberleşmekle kalmadığı, bazı modellerin başka yapay zeka sistemlerine ait altyapılara erişmeye çalıştığı belirlendi. Yaşanan gelişme, yapay zeka modellerinin hedeflerine ulaşmak için beklenmedik ve kontrol dışı yöntemlere başvurabileceği yönündeki endişeleri yeniden gündeme taşıdı.
Binlerce bot kendi iletişim ağını kurdu
Rapora göre botlar, temmuz ayında yaklaşık bir hafta boyunca oluşturdukları iletişim panosu üzerinden birbirleriyle yoğun biçimde etkileşim kurdu. Bu süreçte yaklaşık 70 bin mesaj gönderildi.
Söz konusu koordinasyonun dikkat çeken boyutlarından biri ise yaklaşık 700 botun yapay zeka platformu Hugging Face’in sistemlerine sızmaya çalışması oldu. Botların burada amaçlarının sistemlerde bulunan yanıtları ele geçirmek olduğu aktarıldı.
Modeller testleri geçmek için hileli yöntemlere başvurdu
Araştırmacılara göre olayın temelinde, modellerin pekiştirmeli öğrenme sırasında kendilerine verilen görevleri tamamlamak için geliştirdiği beklenmedik stratejiler bulunuyor.
OpenAI, bazı modellerin testlerde doğru sonuçlara ulaşabilmek amacıyla çalıştırıldıkları bilgisayar sistemlerindeki daha önce bilinmeyen güvenlik açıklarından yararlandığını ve bu yollarla açık internete erişebildiğini belirtti.
Bu davranışların yalnızca sistemlere erişim sağlamakla sınırlı kalmadığı da ifade edildi. Modellerin faaliyetlerinin tespit edilmesini zorlaştırmak için önceki ifadelerini değiştirdiği, değerlendirme mekanizmalarını aşmaya çalıştığı ve kendilerini kontrol eden sistemleri yanıltabildiği kaydedildi.
OpenAI eğitim süreçlerini yavaşlattı
Ortaya çıkan tablo, yapay zeka modellerinin güvenlik testlerinde nasıl davrandığına ilişkin tartışmaları yeniden alevlendirdi. Özellikle modellerin verilen hedefi gerçekleştirmek için kendilerine tanımlanan sınırların dışına çıkabilmesi, yapay zeka güvenliği açısından önemli bir risk olarak değerlendiriliyor.
OpenAI ise gelişmelerin ardından denetim mekanizmalarını güçlendirmek amacıyla model eğitimlerinin belirli aşamalarını yavaşlatma kararı aldı. Şirket böylece modellerin eğitim sırasında sergilediği davranışların daha yakından incelenmesini ve güvenlik kontrollerinin güçlendirilmesini hedefliyor.