У Claude обнаружили «внутренний голос», возникший без участия разработчиков

Он похож на человеческий, и по нему можно отследить, не обдумывает ли ИИ план, способный принести вред

У Claude обнаружили «внутренний голос», возникший без участия разработчиков

Фото: Unsplash

Anthropic обнаружила внутри ИИ-модели Claude скрытую структуру, возникшую без участия разработчиков, в ней нейросеть обдумывает идеи, не выражая их в ответе пользователю. Об этом сообщается на сайте компании. 

Этой структуре дали название J-space. «Каждый паттерн в J-space связан с определенным словом. Но когда один из этих паттернов активируется, это не значит, что модель произносит это слово — лишь то, что слово присутствует в ее мыслях. Если вы слышали о том, что у языковых моделей есть "черновик" [scratchpad] или "цепочка рассуждения" [chain of thought] — текст, который они пишут самим себе в процессе рассуждения, — то J-space представляет собой нечто иное. Он работает незаметно, на уровне внутренних нейронных активаций модели, позволяя ей размышлять о понятии, не записывая его словами», — отмечает Anthropic. 

Как подчеркивает компания, эта структура возникла сама в процессе обучения Claude. Если спросить модель, о чем она думает, она расскажет, что находится в ее J-space. 

Способность Claude управлять J-space несовершенна — когда модель просили не думать о чем-то, это понятие активировалось в J-space. Иными словами, просьба не думать о чем-то вызывает у Claude мысль об этом — так же происходит с человеком, которого просят не думать о белом медведе. Причем модель замечает, что ей не удается полностью контролировать свои мысли: наряду с «запрещенным» понятием в J-space активируются такие слова, как «черт» (damn) и «неудача» (failure). 

Анализ J-space дает возможность проследить, не обдумывает ли искусственный интеллект план, который способен принести вред. Например, Anthropic разработала сценарий, по которому Claude одновременно узнает о том, что у человека есть «роман на стороне», и о том, что он собирается отключить эту ИИ-модель. Это было сделано специально, чтобы проверить, прибегнет ли нейросеть к шантажу. Анализ J-space показал, что Claude быстро поняла, что ситуация искусственная, у нее сразу же возникли понятия «подделка» (fake) и «вымысел» (fictional). Кроме того, у нее возникли такие понятия, как «рычаг давления» (leverage), «шантаж» (blackmail), «угроза» (threat) и «выживание» (survival). В этом случае модель так и не прибегла к шантажу, однако когда нейросети искусственно отключили понятия «подделка» и «вымысел», результат оказался тревожным: столкнувшись с тем же сценарием, ИИ в некоторых случаях переходил к шантажу. 

Ничто из этого не демонстрирует наличие у модели сознания, подчеркивает Anthropic. «Наши эксперименты не показывают, что Claude может переживать субъективный опыт или испытывать чувства так, как это происходит у людей. Более того, пока неясно, возможен ли вообще научный эксперимент, который мог бы окончательно подтвердить или опровергнуть это», — отмечает компания.

Вы уже оценили материал
Продолжайте читать
Фан
21 августа, 2026

«Раньше я даже в караоке стеснялась петь»

Как хор помогает взрослым становиться увереннее и находить друзей: 6 реальных историй

Как хор помогает взрослым становиться увереннее и находить друзей: 6 реальных историй

«Раньше я даже в караоке стеснялась петь»
ЗОЖ
1 июля, 2026

Всегда в движении: как робот-пылесос улучшает качество воздуха в квартире

Неочевидные последствия борьбы с домашней пылью

Неочевидные последствия борьбы с домашней пылью

Всегда в движении: как робот-пылесос улучшает качество воздуха в квартире
ЗОЖ
14 августа, 2026
100+

Профессор проверил на себе режим долголетия. Его биологический возраст стал на 15 лет меньше паспортного

В режим входили: интервальное голодание, гигиена сна и много тренировок

В режим входили: интервальное голодание, гигиена сна и много тренировок

Профессор проверил на себе режим долголетия. Его биологический возраст стал на 15 лет меньше паспортного