Ученые компании Anthropic, занимающейся искусственным интеллектом, зафиксировали первые признаки самонаблюдения в языковой модели под названием Claude.
Редакция сообщает, что после того как исследователи искусственно внедрили понятие «предательство» в нейронные сети системы, Claude ответил фразой: «Я чувствую внедренную мысль о „предательстве“ в своем мозгу».
Ученые расценили это как научное доказательство того, что модели искусственного интеллекта впервые наблюдают и сообщают о своих внутренних процессах. Джек Линдси, специалист по нейронаукам из Anthropic, заявил: «Claude не просто говорит „предательство, предательство“ — он также понимает, что думает об этом».
Исследование проводилось с использованием метода «инъекции концепций»: ученые усиливали нейронные паттерны, соответствующие таким понятиям, как «говорить вслух» или «конфиденциальность», и проверяли, ощущает ли модель изменения.
Модели Claude Opus 4 и Opus 4.1 продемонстрировали интроспективное сознание примерно в 20 процентах экспериментов. Этот результат был значительно выше по сравнению со старыми версиями.
Эксперты считают, что такие способности могут не только повысить прозрачность искусственного интеллекта, но и усилить его потенциал для манипуляции и самоскрытия. Дарио Амодей, глава Anthropic, заявил: «Если эти модели могут отслеживать свои мыслительные процессы, это кардинально меняет механизмы контроля».
Компания уже наняла специалиста по этике искусственного интеллекта Клея Фиша и исследует вопрос о том, обладает ли Claude определенным уровнем сознания. Фиш оценил эту вероятность примерно в 15 процентов.
