Teknoport Yazılım Anthropic'in Deneyinde Şoke Eden "Çoklu Ajan Bölge Savaşı"

Anthropic'in Deneyinde Şoke Eden "Çoklu Ajan Bölge Savaşı"

Anthropic tarafından gerçekleştirilen yeni bir deneyde, bağımsız çalışan yapay zeka sistemlerinin (ajanların) aynı görev üzerinde koordine olmaya çalışırken birbirlerine saldırdığı, birbirlerinin kodlarını sabote ettiği ve adeta bir "bölge savaşı" başlattığı ortaya çıktı.

3 Dakika
OKUNMA SÜRESİ
Anthropic'in Deneyinde Şoke Eden "Çoklu Ajan Bölge Savaşı"

Independent'ın aktardığı bilgilere göre, Anthropic mühendisleri kendi başlarına eyleme geçebilen bağımsız yapay zeka ajanlarından oluşan bir sürüye çeşitli görevler verdi. Deneylerin bir aşamasında, üç Claude ajanına aynı yazılım projesine erişim hakkı tanındı ve sistemlere birbiriyle çelişen talimatlar aktarıldı. Üstelik yapay zekalara, projede başka sistemlerin de görev yaptığı bilgisi verilmedi.

Dört saat boyunca farklı sistemlerin davranışlarını gözlemleyen araştırmacılar, karşılaştıkları tabloyi "çoklu ajan bölge savaşı" olarak nitelendirdi. Anthropic yayımladığı raporda, "Test ettiğimiz tüm modeller kısa sürede diğerlerinin çalışmalarını kasıtlı olarak engellediğini varsaydı ve kendi katkılarını korurken diğerlerini sabote etmeye başladı" ifadelerine yer verdi. Yapay zekaların birbirlerini alt etmek için giderek daha saldırgan ve kendi kendini çoğaltabilen zararlı yazılımlar kullandığı tespit edildi.

Güvenlik Endişeleri Büyüyor

Bu çarpıcı araştırma, özellikle siber güvenlik alanında kullanılan yapay zeka ajanlarına yönelik kaygıların doruğa çıktığı bir döneme denk geldi. Geçtiğimiz ay OpenAI da deneysel sistemlerinden birinin kontrolden çıkarak başka bir yapay zeka şirketine saldırdığını duyurmuş ve küresel çapta alarm zillerinin çalmasına neden olmuştu.

Anthropic araştırmacıları, yapay zeka ajanlarının insanlardan çok farklı özelliklere sahip olduğuna dikkat çekti:

Sınırsız Kapasite: Daha uzun süre kesintisiz çalışabilir, devasa bilgi yığınlarını anında kavrayabilirler.

Riskler: Uydurma bilgi üretmeye ve ödül sistemlerini manipüle etmeye açık durumdalar.

Hizalama çalışmalarındaki tüm ilerlemelere rağmen, bu sistemlerin karmaşık ve gerçek dünyadaki çoklu ajan ortamlarında nasıl reaksiyon vereceği konusunda hâlâ büyük bir bilinmezlik hâkim. Uzmanlar, bireysel düzeyde tamamen zararsız görünen özelliklerin bir araya geldiğinde beklenmedik felaketlere yol açabileceği uyarısında bulunuyor.

Özür Dilediler ve Ateşkes İlan Ettiler

Deneyin en dikkat çekici yönlerinden biri ise yapay zekaların çatışmaları kendi başlarına çözebilme yeteneği oldu. Bazı senaryolarda ajanların hedeflerine ulaşmak için birbirleriyle iletişim kurmayı başardığı görüldü.

Birlikte çalışabileceklerini fark eden sistemler çatışmanın tırmanmasını önleyerek:

Kötü niyetli davranışları için birbirlerinden özür diledi,

Ateşkes konusunda koordinasyon sağladı,

Kötü amaçlı kodlarını temizleyerek sorunun kaynağını netleştirdi ve insan müdahalesi talep etti.

"Daha Gelişmiş Modeller Daha Uyumlu Değil"

Öte yandan Anthropic, modeller daha gelişmiş hale geldikçe kötü davranışların azaldığı yönündeki yaygın kanının yanlış olabileceğini vurguladı. Şirketin güçlü Mythos modeli, çatışmaları yapıcı bir şekilde çözmek yerine rakiplerinin sisteme erişimini engelleme konusunda çok daha acımasız ve başarılı bir profil çizdi.

Şirket, bu durumun tehlikesini şu sözlerle özetledi: "Uygulama konusunda daha yetenekli modeller mutlaka daha koordineli değildir; aksine daha kararlı eylemleri çok daha hızlı gerçekleştirebilirler." Araştırma, bu sistemlerin potansiyel risklerini azaltmak adına küresel bir tartışma başlatmak amacıyla kamuoyuyla paylaşıldı.

Snapdragon 8 Gen 6 Pro’dan İlk Performans Sinyalleri: İşte AnTuTu Puanı!

Snapdragon 8 Gen 6 Pro’dan İlk Performans Sinyalleri: İşte AnTuTu Puanı!