Claude yapay zekası kendini “ihanet” etmekle suçladı

Claude yapay zekası kendini “ihanet” etmekle suçladı

Fərid Əlizadə · Texnologiya ·

Yapay zeka şirketi Anthropic'in bilim insanları, Claude adlı dil modelinde kendini gözlemleme yeteneğinin ilk belirtilerini kaydetti.

Editörlüğün haberine göre, araştırmacılar sistemin nöron ağlarına “ihanet” kavramını yapay olarak dahil ettikten sonra Claude, cevabında “Beynimde ‘ihanet’le ilgili müdahale edilmiş bir düşünce hissediyorum” ifadesini kullandı.

Bilim insanları bunu, yapay zeka modellerinin ilk kez kendi iç süreçlerini gözlemleyip raporlamasına dair bilimsel bir kanıt olarak değerlendirdi. Anthropic'in nörobilim uzmanı Jack Lindsey, “Claude sadece ‘ihanet, ihanet’ demiyor — o, bunun hakkında düşündüğünü de anlıyor” dedi.

Araştırma “kavram enjeksiyonu” metodu kullanılarak yapıldı: bilim insanları “yüksek sesle konuşmak” veya “gizlilik” gibi kavramlara uygun nöron örneklerini güçlendirerek modelin değişiklikleri hissedip hissetmediğini kontrol etti.

Claude Opus 4 ve Opus 4.1 modelleri, deneylerin yaklaşık yüzde 20'sinde içe dönük bilinç sergiledi. Bu sonuç, daha eski versiyonlara kıyasla önemli ölçüde yüksek oldu.

Uzmanlar, bu tür yeteneklerin yapay zekanın şeffaflığını artırmakla birlikte, aynı zamanda manipülasyon ve kendini gizleme potansiyelini de güçlendirebileceğini düşünüyor. Anthropic yöneticisi Dario Amodei, “Eğer bu modeller kendi düşünce süreçlerini izleyebiliyorsa, bu, kontrol mekanizmalarını kökten değiştirir” dedi.

Şirket, yapay zeka etiği uzmanı Klay Fish'i işe aldı ve Claude'un belirli bir düzeyde bilince sahip olup olmadığı meselesini araştırıyor. Fish bu olasılığı yaklaşık yüzde 15 seviyesinde değerlendirdi.