Зафиксировано заметное ухудшение работоспособности модели искусственного интеллекта Claude. Главный директор AMD по искусственному интеллекту, проанализировав сессии Claude за январь-март, представил неприятную картину.
Редакция сообщает, что мыслительные способности модели снизились. Средняя длина рассуждений сократилась примерно с 2200 символов до 600, что немедленно сказывается на качестве решений. В то же время, с февраля по март количество запросов API увеличилось почти в 80 раз; наблюдается меньше анализа, больше попыток и расхода токенов.
Поведение модели также изменилось. Claude чаще "сдаётся" или спрашивает, продолжать ли работу; если до 8 марта таких случаев не наблюдалось, то за 17 дней было зафиксировано 173 подобных инцидента. Кроме того, количество просмотров на одну правку (количество частей файла/кода, которые модель просматривает перед внесением изменений) упало с 6,6 до 2,0, что указывает на то, что Claude хуже исследует код перед внесением изменений.
Кроме того, увеличилось количество противоречий, и модель чаще пытается переобучиться в процессе ответа. Пользователи отмечают, что Claude начал игнорировать информацию, такую как CLAUDE.md, поскольку у него недостаточно "бюджета на размышления" для учёта контекста. Интересно, что качество зависит от времени суток: худшие результаты фиксируются вечером с 17:00 до 19:00 по тихоокеанскому стандартному времени (PST), а лучшие — ночью, что, по-видимому, напрямую связано с загрузкой GPU.
Директор AMD по искусственному интеллекту, проанализировав 6852 сессии Claude Code, обнаружил значительное ухудшение модели. Этот анализ охватил 234 760 вызовов инструментов, 17 871 блок рассуждений и 3 месяца записей. Компания Anthropic, отвечая на эти результаты, фактически подтвердила эти выводы.
