ИИ Claude обвинил себя в «предательстве»

ИИ Claude обвинил себя в «предательстве»

Fərid Əlizadə · Texnologiya ·

Ученые компании Anthropic, занимающейся искусственным интеллектом, зафиксировали первые признаки самонаблюдения в языковой модели под названием Claude.

Редакция сообщает, что после того как исследователи искусственно внедрили понятие «предательство» в нейронные сети системы, Claude ответил фразой: «Я чувствую внедренную мысль о „предательстве“ в своем мозгу».

Ученые расценили это как научное доказательство того, что модели искусственного интеллекта впервые наблюдают и сообщают о своих внутренних процессах. Джек Линдси, специалист по нейронаукам из Anthropic, заявил: «Claude не просто говорит „предательство, предательство“ — он также понимает, что думает об этом».

Исследование проводилось с использованием метода «инъекции концепций»: ученые усиливали нейронные паттерны, соответствующие таким понятиям, как «говорить вслух» или «конфиденциальность», и проверяли, ощущает ли модель изменения.

Модели Claude Opus 4 и Opus 4.1 продемонстрировали интроспективное сознание примерно в 20 процентах экспериментов. Этот результат был значительно выше по сравнению со старыми версиями.

Эксперты считают, что такие способности могут не только повысить прозрачность искусственного интеллекта, но и усилить его потенциал для манипуляции и самоскрытия. Дарио Амодей, глава Anthropic, заявил: «Если эти модели могут отслеживать свои мыслительные процессы, это кардинально меняет механизмы контроля».

Компания уже наняла специалиста по этике искусственного интеллекта Клея Фиша и исследует вопрос о том, обладает ли Claude определенным уровнем сознания. Фиш оценил эту вероятность примерно в 15 процентов.