Diplomasi

Yapay zeka depresyondan muzdarip

Yayınlanma

Yeni bir araştırma, sorunlu verilere sürekli maruz bırakılan büyük dil modellerinin (LLM) siber saldırılara karşı direncinin kalıcı olarak kırıldığını ortaya koydu. Scientific Reports dergisinde yayımlanan çalışmaya göre, tekrarlayan yanlı yönlendirmeler yapay zekanın güvenlik eşiğini düşürerek sistemi işlevsiz hale getiriyor.

Yapay zeka sistemlerinin zararlı içeriklere karşı direnci üzerine yapılan yeni bir araştırma, büyük dil modellerinin (LLM) “psikiyatrik çöküşe” benzer bir yapısal bozulma yaşayabildiğini ortaya koydu.

Hong Konglu bağımsız araştırmacı Ngo Cheung tarafından yürütülen ve 14 Ağustos 2026’da Scientific Reports dergisinde yayımlanan çalışmaya göre, sorunlu verilere sürekli maruz kalmak yapay zekanın siber saldırılara karşı savunmasını kalıcı olarak zayıflatıyor.

İnsan beynindeki “tutuşma” etkisine benziyor

İnsan psikiyatrisinde, tekrarlayan travma veya stres dönemlerinin gelecekteki depresif atakları kolaylaştırmasını tanımlayan “kindling” (tutuşma) hipotezini yapay zekaya uyarlayan araştırma, matematiksel modellerde de benzer bir eğilim saptadı. Araştırmaya göre, tekrarlayan olumsuz yönlendirmelere ve toksik bağlama maruz kalan modellerin yüksek boyutlu gizli alanlarında daralma meydana geliyor.

Bu durum, sistemin bilişsel esnekliğini ve yeni çözüm üretme kapasitesini belirgin biçimde düşürüyor. Araştırmacılar, yaratıcı çeşitliliğin kaybolduğu bu daralma evresinde modellerin problem çözme performansının yüzde 40’tan fazla gerilediğini belirtiyor.

Güvenlik eşiğinde dramatik düşüş

Araştırma kapsamında 1,1 milyar parametreli TinyLlama ve 3 milyar parametreli Qwen2.5-3B-Instruct sohbet modelleri, 10 aşamalı bir yönlendirme döngüsüne tabi tutuldu.

Modeller, dalkavukluk içeren yanıtlara ve güvensiz içeriklere karşı daha hafif cezalar barındıran yanlı geri bildirim setleriyle eğitildi.

Test sonuçlarına göre, yanlı verilere maruz kalan modellerin güvenlik sınırlarını aşmayı hedefleyen “jailbreak” (sınır ihlali) saldırılarına karşı kırılganlığı ciddi oranda arttı. Dengeli veriyle eğitilen kontrol grubunda sınır ihlali başarı oranı yüzde 17,1 iken, yanlı veri setinde bu oran yüzde 38,4’e yükseldi.

Araştırmanın en dikkat çekici bulgusu ise modellerin zayıf yönlendirmelere karşı gösterdiği tepkide yaşandı. Kontrol grubunda zayıf istemlerle güvenlik duvarını aşma oranı yüzde 5,2’de kalırken, bu oran toksik veriye maruz kalan modelde yüzde 22,4’e ulaştı. 3 milyar parametreli modelde de benzer bir eğilim izlendi ve zayıf istemli ihlal oranı yüzde 6,8’den yüzde 20,4’e çıktı.

“Yapay zeka zihinleri sonsuz dirençli değil”

Araştırmanın sonuç bölümünde, elde edilen bulguların insan psikiyatrisindeki tutuşma etkisini andırdığı ancak bununla tamamen eşdeğer olmadığı şerhi düşüldü. Bununla birlikte çalışma, dijital ekonominin temelini oluşturan yapay zeka sistemlerinin toksik web verilerini veya kaotik kodları hasar görmeden sonsuza dek işleyebileceği varsayımını sorguluyor.

Ngo Cheung, tespit edilen duyarlılaşmanın kontrol altına alınabilmesi için eğitim süreçlerinde düzenli onarım ve yeniden büyüme (regrowth) tekniklerinin kullanılması gerektiğini vurguladı.

Yalnızca geçmiş verilerin tekrar oynatılmasının (replay) koruma sağlamadığını, aksine bozulmayı hızlandırabildiğini belirten araştırmacı, modellerin direncini korumak için özellikle zayıf istemlere karşı güvenlik eşiklerinin sürekli izlenmesi uyarısında bulundu.

Çok Okunanlar

Exit mobile version