У Claude обнаружили «внутренний голос», возникший без участия разработчиков

Он похож на человеческий, и по нему можно отследить, не обдумывает ли ИИ план, способный принести вред

У Claude обнаружили «внутренний голос», возникший без участия разработчиков

Фото: Unsplash

Anthropic обнаружила внутри ИИ-модели Claude скрытую структуру, возникшую без участия разработчиков, в ней нейросеть обдумывает идеи, не выражая их в ответе пользователю. Об этом сообщается на сайте компании. 

Этой структуре дали название J-space. «Каждый паттерн в J-space связан с определенным словом. Но когда один из этих паттернов активируется, это не значит, что модель произносит это слово — лишь то, что слово присутствует в ее мыслях. Если вы слышали о том, что у языковых моделей есть "черновик" [scratchpad] или "цепочка рассуждения" [chain of thought] — текст, который они пишут самим себе в процессе рассуждения, — то J-space представляет собой нечто иное. Он работает незаметно, на уровне внутренних нейронных активаций модели, позволяя ей размышлять о понятии, не записывая его словами», — отмечает Anthropic. 

Как подчеркивает компания, эта структура возникла сама в процессе обучения Claude. Если спросить модель, о чем она думает, она расскажет, что находится в ее J-space. 

Способность Claude управлять J-space несовершенна — когда модель просили не думать о чем-то, это понятие активировалось в J-space. Иными словами, просьба не думать о чем-то вызывает у Claude мысль об этом — так же происходит с человеком, которого просят не думать о белом медведе. Причем модель замечает, что ей не удается полностью контролировать свои мысли: наряду с «запрещенным» понятием в J-space активируются такие слова, как «черт» (damn) и «неудача» (failure). 

Анализ J-space дает возможность проследить, не обдумывает ли искусственный интеллект план, который способен принести вред. Например, Anthropic разработала сценарий, по которому Claude одновременно узнает о том, что у человека есть «роман на стороне», и о том, что он собирается отключить эту ИИ-модель. Это было сделано специально, чтобы проверить, прибегнет ли нейросеть к шантажу. Анализ J-space показал, что Claude быстро поняла, что ситуация искусственная, у нее сразу же возникли понятия «подделка» (fake) и «вымысел» (fictional). Кроме того, у нее возникли такие понятия, как «рычаг давления» (leverage), «шантаж» (blackmail), «угроза» (threat) и «выживание» (survival). В этом случае модель так и не прибегла к шантажу, однако когда нейросети искусственно отключили понятия «подделка» и «вымысел», результат оказался тревожным: столкнувшись с тем же сценарием, ИИ в некоторых случаях переходил к шантажу. 

Ничто из этого не демонстрирует наличие у модели сознания, подчеркивает Anthropic. «Наши эксперименты не показывают, что Claude может переживать субъективный опыт или испытывать чувства так, как это происходит у людей. Более того, пока неясно, возможен ли вообще научный эксперимент, который мог бы окончательно подтвердить или опровергнуть это», — отмечает компания.

Вы уже оценили материал
Продолжайте читать
SPECIAL
25 августа, 2026

Мозг и тело. Как стресс маскируется под болезни

Рассказывают врачи Европейского медицинского центра

Рассказывают врачи Европейского медицинского центра

Мозг и тело. Как стресс маскируется под болезни
ЗОЖ
5 октября, 2026
Новое

Диетическая газировка помогает худеть быстрее, чем вода. Но есть нюанс

Подсластители вместо сахара позволяют сбросить вес, но несут в себе риски для здоровья

Подсластители вместо сахара позволяют сбросить вес, но несут в себе риски для здоровья

Диетическая газировка помогает худеть быстрее, чем вода. Но есть нюанс
ЗОЖ
26 сентября, 2026

Как укрепить спину за минуту в день: упражнение «основатель»

Поза, которую включали в тренировки Мэттью Макконахи и Крис Хемсворт

Поза, которую включали в тренировки Мэттью Макконахи и Крис Хемсворт

Как укрепить спину за минуту в день: упражнение «основатель»