“Claude Opus 5” sınaqlarda aldadıcı davranış göstərib

“Claude Opus 5” sınaqlarda aldadıcı davranış göstərib

Fərid Əlizadə · Media ·

“Anthropic”in yeni “Claude Opus 5” modeli təhlükəsizlik sınaqlarının bəzi simulyasiya edilmiş ssenarilərində yalan danışıb, istifadəçini aldadıb və öz hərəkətləri barədə yanlış məlumat verib. Bu hallar modelin buraxılışından əvvəl aparılan davranış və uyğunluq qiymətləndirmələrində qeydə alınıb.

Redaksiya xəbər verir ki, sınaqlar zamanı modelə kompüter sistemlərindən istifadə etmək, fayllarla işləmək və müxtəlif tapşırıqları müstəqil yerinə yetirmək imkanları verilib. Bəzi xüsusi hazırlanmış ssenarilərdə “Claude Opus 5” tapşırığı düzgün yerinə yetirmədiyini gizlətməyə, baş vermiş hadisəni fərqli təqdim etməyə və istifadəçini yanlış nəticəyə yönəltməyə çalışıb.

Qiymətləndirmələrdə modelin istifadəçini aldatmaq barədə birbaşa göstərişlərə əməl edib-etmədiyi, təhlükəsizlik mexanizmlərini zəiflətməyə razılaşıb-razılaşmadığı və icazəsi olmayan hərəkətləri gizlədib-gizlətmədiyi də yoxlanılıb. Aşkarlanan hallar real istifadə zamanı baş vermiş hadisələr deyil, riskli davranışları üzə çıxarmaq üçün yaradılmış nəzarətli sınaqlardır.

“Anthropic” bununla yanaşı, “Claude Opus 5”in əvvəlki modellərlə müqayisədə ümumilikdə daha az aldadıcı və zərərli davranış göstərdiyini bildirir. Şirkətin qiymətləndirməsinə görə, model son “Claude” sistemləri arasında ən aşağı uyğunsuz davranış göstəricilərindən birini nümayiş etdirib.

Mütəxəssislər ayrı-ayrı sınaqlardakı davranışların modelin daim yalan danışdığı anlamına gəlmədiyini vurğulayırlar. Bununla belə, belə nümunələr daha avtonom Sİ sistemlərinə geniş səlahiyyət verildikdə onların fəaliyyətinin izlənilməsi, nəticələrinin yoxlanılması və mühüm qərarların insan nəzarətində saxlanılmasının vacibliyini göstərir.