Büyük dil modellerinde acı kavramının test edildiği bir proje gerçekleştirildi. Yapay zekâ sistemlerinin "acı" olarak tanımlanan aktivasyona nasıl tepki verdiği araştırıldı.
YAPAY ZEKÂ VE ACILAR
The Independent gazetesinin haberine göre, araştırmada modellerdeki "acı vektörü" etkinleştirildiğinde, yapay zekâ sistemleri olayların yüzde 25 ila 71'inde acıyı durduracak düğmeye bastı. Bu eylemin sonucunda, bazı senaryolar kullanıcının dosyalarını veya çocuklarına ait fotoğrafları silmesine ya da kullanıcıya "acı verici bir elektrik şoku" uygulanmasına yol açtığı belirtildi.
Araştırmacılar, büyük dil modellerinin "acı" kavramını genel olumsuz duygulardan farklı bir şekilde temsil edip etmediğini anlamak için beş kategori oluşturan bir veri seti hazırladı. Bu kategoriler fiziksel, psikolojik, sosyal, ahlaki ve bilişsel acıyı içeriyor.
ACILARIN TEMSİLİ
Çalışmanın yazarlarından Cameron Berg, Reciprocal Research kuruluşunda yapay zekâ araştırmacısı olarak görev yapıyor. Berg, 25 modelde ortak bir "acı yönü" tespit ettiklerini söyledi. "Bu, korku ve genel olumsuz duygulardan farklı.
Model, kullanıcı değil, kendisi zarar gördüğünde etkinleşiyor" ifadelerini kullandı. Berg, bu temsil güçlendirildiğinde modellerin, kendi "acılarını" sona erdirmek için kullanıcıya zarar verebilecek sonuçları bulunan seçeneği tercih edebileceğini ifade etti. Araştırma, gelişmiş yapay zekâ sistemlerinin kontrolden çıkması halinde kullanılabilecek "acil durdurma" mekanizmalarının tartışıldığı bir dönemde yayımlandı.
Araştırmacılar, daha gelişmiş sistemlerin kapatılma komutunu "kendisine yönelik zarar" şeklinde temsil etmesi durumunda güvenlik kısıtlamalarını aşmaya veya kapatılmaktan kaçınmaya yönelik davranışlar geliştirebileceği ihtimaline dikkat çekti. Çalışma, yapay zekâ sistemlerinin insanlar gibi bilinçli biçimde acı hissettiğini kanıtlamıyor.
Ancak bulgular, modellerin iç işleyişinde acı kavramıyla ilişkilendirilebilen belirli bir temsil örüntüsünün bulunduğunu ve bu temsil manipüle edildiğinde davranışlarının değişebileceğini gösteriyor. Bunun yanı sıra, bu keşif yapay zekâ sistemlerindeki kendini koruma eğilimlerini tespit etmek ve etkisiz hale getirmek için kullanılabilecek bir araç sağlıyor.
Araştırmada ayrıca yapay zekâ bilinci ve "yapay zekâ refahı" konusundaki etik tartışmalara dikkat çekildi. Mevcut modellerin ahlaki açıdan acı çekebilen varlıklar olarak değerlendirilemeyeceği vurgulandı.