Claude yapay zeka modelinin performansında kayda değer bir kötüleşme kaydedildi. AMD şirketinin yapay zeka baş direktörü, Ocak-Mart ayları boyunca Claude'un oturumlarını analiz ederek hoş olmayan bir tablo ortaya koydu.
Editörlük, modelin düşünme yeteneğinin azaldığını bildiriyor. Muhakemelerin ortalama uzunluğu yaklaşık 2.200 karakterden 600 karaktere düştü, bu da kararların kalitesini doğrudan etkiliyor. Aynı zamanda, Şubat'tan Mart'a kadar API sorgularının sayısı neredeyse 80 kat arttı; daha az analiz, daha fazla deneme ve token tüketimi gözlemleniyor.
Modelin davranışı da değişti. Claude daha sık "teslim oluyor" veya işe devam edip etmeyeceğini soruyor; 8 Mart'tan önce böyle durumlar gözlemlenmezken, 17 gün içinde 173 böyle olay kaydedildi. Ayrıca, düzeltme başına görüntüleme sayısı (modelin değişiklik yapmadan önce baktığı dosya/kod parçalarının sayısı) 6.6'dan 2.0'a düştü, bu da Claude'un kodu değişiklik yapmadan önce daha kötü incelediğini gösteriyor.
Buna ek olarak, çelişkilerin sayısı arttı ve model yanıt süreci sırasında daha sık yeniden öğrenmeye çalışıyor. Kullanıcılar, Claude'un CLAUDE.md gibi bilgileri dikkate almamaya başladığını belirtiyorlar, çünkü bağlamı dikkate almak için yeterli "düşünme bütçesi" yok. İlginçtir ki, kalite günün saatine bağlıdır: en kötü sonuçlar akşam 17:00-19:00 PST arasında, en iyi sonuçlar ise gece kaydediliyor, bu da GPU yüklenmesiyle doğrudan ilişkili görünüyor.
AMD'nin yapay zeka direktörü, Claude Code'un 6.852 oturumunu analiz ederek modelin önemli ölçüde kötüleştiğini ortaya koydu. Bu analiz, 234.760 araç çağrısı, 17.871 muhakeme bloğu ve 3 aylık kayıtları kapsadı. Anthropic şirketi bu sonuçlara yanıt vererek, aslında bu tespitleri doğruladı.
