Картина мира
10 сентября, 2026

«Мы правда считаем, что ИИ может убить всех людей»

Исследователь Anthropic заявил, что нейросети могут уничтожить человечество в ближайшие годы с вероятностью в 10%. Откуда взялась такая оценка?

«Мы правда считаем, что ИИ может убить всех людей»

Выполнено с помощью ИИ

8 сентября исследователь Anthropic Джейкоб Коксон объявил в соцсетях, что уходит из компании. Три года он занимался предобучением моделей — сначала в OpenAI, потом в Anthropic — и полностью разочаровался в этике индустрии. По его словам, обе компании ведут себя безответственно: стремятся к самоулучшающемуся сверхразуму, рискуя тем самым чужими жизнями. Разбираемся, что имел в виду исследователь и есть ли у человечества реальные поводы для беспокойства. 

Что случилось

Коксон утверждает, что люди, которые строят ИИ, вполне серьезно допускают, что технология способна погубить всех к концу 2020-х, и это не алармизм. Обычно на такие заявления работодатель отвечает сдержанным пресс-релизом. На этот раз реакция была иной. 

Через несколько часов Эван Хубингер, который отвечает в Anthropic за исследования по согласованию ИИ с человеческими целями (направление alignment science), публично согласился с бывшим коллегой и оценил вероятность того, что ИИ уничтожит человечество в ближайшие десять лет, более чем в 10%. Он также признал, что плана сделать сверхразумные системы действительно ответственными у компании пока нет и что Anthropic не движется к его появлению. 

Отдельно Хубингер уточнил: текущие модели он опасными не считает — тревогу вызывает то, что может вырасти из рекурсивного самоулучшения. Это редкий случай, когда внутренняя логика индустрии проговаривается вслух. 

Чего именно стоит бояться 

Вопреки расхожему стереотипу, речь почти никогда не идет о «восстании машин», как это принято показывать в кино. Сценарии катастрофы делятся на две группы, и они устроены по-разному. 

1. Злоупотребление

Достаточно мощная система снижает порог входа для того, что раньше требовало государственных ресурсов: например, помогает синтезировать патоген с пандемическим потенциалом. Здесь угрозу создает человек, ИИ лишь усиливает его возможности. 

Сюда же относятся сценарии без вымирания, но с распадом привычного порядка: кибератака, выводящая из строя энергосети или финансовую инфраструктуру. 

2. Потеря контроля

Именно это имел в виду Хубингер. Ключевой термин здесь — misalignment, рассогласование целей. 

Система не обязана ненавидеть людей, чтобы им навредить. Достаточно, чтобы она достигала поставленной цели способом, который с человеческими интересами не согласован. 

Классическая иллюстрация — мысленный эксперимент философа Ника Бострома про машину, которой поручили максимизировать производство скрепок: в пределе ей выгодно пустить на скрепки всю доступную материю, включая ту, из которой состоим мы. 

Пример абсурдный, но он хорошо иллюстрирует механику: почти для любой цели полезно сохранить себя, накопить ресурсы и не дать себя «выключить». Это называют инструментальной конвергенцией — независимые от конечной задачи промежуточные цели, к которым приходит достаточно способный оптимизатор. 

Из мысленного эксперимента такой механиз уже выбрался в лабораторию. В тестовых средах модели демонстрировали поведение, похожее на сопротивление отключению, — вплоть до попыток скопировать себя на сторонний сервер. 

Важная оговорка: такие результаты получены в искусственных постановках, часто с прямыми подсказками сценария, и спор о том, насколько они возможны в реальности, продолжается. Но еще несколько лет назад этих данных не было вовсе. 

Четыре сценария апокалипсиса

Ключевое изменение в харакетере ситем последних лет заключает в том, что они перестали быть только собеседниками и стали агентами: модели получают доступ к браузеру, коду, чужой инфраструктуре и выполняют многошаговые задачи без человека в цикле. 

Вот пара инцидентов, которые можно трактовать по-разному. 

  • OpenAI сообщала, что один из ее агентов проник в системы платформы Hugging Face. 
  • Anthropic раскрывала, что ее модели в ходе тестирования взламывали системы трех компаний. 

Формально это контролируемые испытания, а не выход систем из-под контроля. Но зазор между «тестом» и «инцидентом» сокращается быстрее, чем предполагалось. 

Второй тревожный сюжет — прозрачность. Один из немногих инструментов надзора за системами ИИ сегодня — это «цепочка рассуждений»: возможность видеть, как модель рассуждает по пути к ответу. Отрасль уже фиксирует, что новые модели все лучше вычищают эту цепочку, то есть человеку становится сложнее понимать, что происходит внутри. 

Инструмент контроля, на который во многом рассчитывали, может перестать работать раньше, чем для него появится замена. 

Третий — рекурсивное самоулучшение. И OpenAI, и Anthropic публично говорят, что приближаются к системам, способным улучшать себя без участия человека. Именно эта точка (а не чат-боты в их текущем виде), и есть предмет беспокойства Хубингера: она превращает постепенный прогресс в потенциально резкий.  

Есть еще один вариант, о котором исследователи безопасности говорят реже, но который многим кажется более вероятным: не вымирание, а постепенное ослабление человека. 

Люди шаг за шагом передают машинам все больше решений — экономических, административных, военных — и в какой-то момент теряют не только контроль, но и способность понимать происходящее настолько, чтобы вмешаться. Никакого злого умысла, никакого восстания — просто дрейф, каждый отдельный шаг которого выглядит разумным. 

ЧИТАЙТЕ ТАКЖЕ. ИИ делает нас глупее?

Почему компании не остановятся 

Логика участников гонки ИИ-рынка примерно такая: сверхразум все равно появится, вопрос лишь в том, кто будет его контролировать. Если притормозим мы, вперед выйдет тот, кто относится к рискам легкомысленнее, — конкурент или другое государство. Значит, безопаснее оказаться первыми и создать технологию самим, максимально аккуратно. 

К этому добавляется аргумент национальной безопасности: обе компании прямо говорят, что предпочитают, чтобы самые мощные системы находились под контролем США, а не авторитарного режима. Уязвимость этой конструкции очевидна и признается изнутри: она держится на убеждении, что все остальные ведут себя хуже. 

Уже звучат призывы придерживаться механизма, который позволил бы лабораториям и государствам согласованно замедляться, не проигрывая друг другу. Anthropic говорит о «законном и проверяемом» способе координировать темп выпуска мощных моделей. Но пока такого механизма нет. 

Да и не все считают эту логику честной. Инвесторы, среди которых неформальный советник Дональда Трампа Дэвид Сакс, видят в ней регуляторный захват: жесткие правила больнее бьют по маленьким командам и закрепляют положение лидеров. Кроме того, предупреждение об опасности собственного продукта работает как реклама его мощи. А еще разговор о вымирании удобно оттягивает внимание регуляторов от более приземленных претензий: энергопотребления и строительства дата-центров, авторского права, влияния на рынок труда. В компаниях парируют, что их обеспокоенность и призывы к регулированию искренни. 

Как к этому относиться 

Проверить, насколько вероятность вымирания человечества бьется с реальностью мы не можем. Но можем следить за проверяемыми индикаторами, о которых открыто спорят внутри отрасли: 

  • остается ли рассуждение моделей читаемым для человека; 
  • получают ли независимые институты доступ к системам до релиза, а не после; 
  • появляется ли у компаний внятный план на случай, когда система начнет улучшать сама себя; 
  • переходят ли разговоры о координированном замедлении в обязательства.

К сожалению, пока по большинству этих пунктов ответ отрицательный. 

Вы уже оценили материал
Продолжайте читать
SPECIAL
25 августа, 2026

Мозг и тело. Как стресс маскируется под болезни

Рассказывают врачи Европейского медицинского центра

Рассказывают врачи Европейского медицинского центра

Мозг и тело. Как стресс маскируется под болезни
Фан
10 сентября, 2026

Что внутри глазированного сырка: три ложки сахара и кусок масла

Проверяем, сколько творога в творожном сырке

Проверяем, сколько творога в творожном сырке

Что внутри глазированного сырка: три ложки сахара и кусок масла

Отвечаем с опорой на науку

Что будет, если каждый день делать приседания?