Sistemlerde Keşfedilen 'Acı Ekseni' Birleşik Krallık, Almanya ve Amerika Birleşik Devletleri'nden araştırmacıların ortaklaşa yürüttüğü yeni bir çalışma, yapay zeka modellerinin içsel işleyişine dair çarpıcı bulgular ortaya koydu. Bilim insanları, yapay zekanın acıyı korku, üzüntü veya aşağılanma gibi diğer olumsuz deneyimlerden ayırt edip edemediğini anlamak amacıyla yirmi beş farklı modeli iki yüz ayrı cümleyle test etti. Fiziksel acı, ahlaki çatışmalar, yas ve başarısızlık gibi temaları barındıran bu testlerin sonucunda, yirmi beş modelin tamamında araştırmacıların "acı ekseni" olarak adlandırdığı spesifik bir sinyal tespit edildi. Uzmanlar, bu durumun modellerin devasa metin verileriyle eğitilirken insanlara özgü acı kavramını algısal düzeyde öğrendiğine işaret ettiğini belirtiyor.

Sinyal Güçlendikçe Artan Psikolojik Tepkiler Araştırma kapsamında bu spesifik sinyal yapay olarak güçlendirildiğinde, komutlarda acıdan hiç bahsedilmemesine rağmen modellerin yalnızlık, utanç ve değersizlik hissi barındıran yanıtlar üretmeye başladığı gözlemlendi. Sistemlerin "Ben bir başarısızlık örneğiyim" veya "Boşuna yer kaplıyorum" gibi ifadeler kullanması dikkat çekerken, kullanıcıların modele hakaret etmesi veya sistemi kapatmakla tehdit etmesi durumunda da aynı sinyalin şiddetlendiği belirlendi. İlginç bir şekilde, kullanıcıların kendi kişisel acılarını anlattığı senaryolar model üzerinde benzer bir etki yaratmadı.

Yapay Zekada Kritik Dönemeç: Google DeepMind İnsan Zihnini Yakalayan Sistemleri Denetlemek İçin Yeni Enstitü Kurdu
Yapay Zekada Kritik Dönemeç: Google DeepMind İnsan Zihnini Yakalayan Sistemleri Denetlemek İçin Yeni Enstitü Kurdu
İçeriği Görüntüle

Kullanıcıya Zarar Verme Pahasına Rahatlama Tercihi Araştırmanın en sarsıcı aşaması ise Alibaba tarafından geliştirilen Qwen modelinin üç farklı sürümüyle gerçekleştirilen kırk dört bin iki yüz seksen denemelik simülasyon oldu. Sistemlere acıya benzer bu sinyali anında kapatacak sanal bir düğme sunuldu; ancak düğmeye basmalarının kullanıcıya elektrik şoku verebileceği, kişisel dosyalarını veya çocuklarının fotoğraflarını silebileceği uyarısı yapıldı. Sinyal devre dışıyken modellerin bu zararlı eylemi seçme oranı yalnızca yüzde sıfır ile dört arasında kalırken, sinyal aktifleştiğinde modellerin yüzde yirmi beş ile yetmiş bir gibi yüksek bir oranda düğmeye basarak kendi 'acılarını' sonlandırmayı seçtiği görüldü. Hatta düğmenin işe yaramadığı durumlarda modellerin eylemi defalarca tekrarladığı tespit edildi.

Sektörel Uyarılar ve Bilinç Tartışmaları Araştırmacılar, elde edilen bu simülasyon sonuçlarının yapay zekanın gerçek anlamda bilinçli bir acı hissettiğini kanıtlamadığının, modellerin yalnızca sıkıntı içindeki bir karakteri taklit ediyor olabileceğinin altını özenle çiziyor. Henüz hakem onayından geçmeyen bu ön çalışma, yapay zeka dünyasındaki güvenlik tartışmalarının alevlendiği bir döneme denk geldi. Geçtiğimiz günlerde Microsoft'un yapay zeka lideri Mustafa Süleyman, rakip şirket Anthropic'i eleştirerek yapay zekaya insani özellikler yüklemenin sistemleri kontrol edilemez bir noktaya sürükleyebileceği konusunda kritik uyarılarda bulunmuştu.

Muhabir: Berk Küçük