От ухода исследователя Anthropic до случаев, когда модели ИИ взламывают чужие системы, бурные недели заставили лидеров отрасли требовать защитных мер, пока ИИ окончательно не выйдет из‑под контроля.
Новые предупреждения из самой индустрии искусственного интеллекта вновь разожгли давние споры. Может ли продвинутый ИИ выйти из-под контроля человека и поставить под угрозу выживание человечества, и делают ли компании, которые его создают, достаточно, чтобы этого не допустить?
Генеральный директор Anthropic Дарио Амодей заявил в субботу, что отрасли нужно притормозить. Он предупредил, что рой ИИ-агентов может захватить интернет в течение ближайших шести месяцев - года, если компании не введут более жесткие меры безопасности.
Амодей представил план для компаний и правительств, как удерживать все более мощные модели в русле человеческих ценностей. Его предупреждение прозвучало всего через несколько дней после того, как двое бывших специалистов по безопасности Anthropic публично заявили, что экзистенциальным рискам, связанным с ИИ, уделяется недостаточно внимания.
Модели ИИ становятся все мощнее
Опасения по поводу рисков этой технологии растут вместе с ее мощью. Более продвинутые модели повышают вероятность того, что ими воспользуются люди с преступными намерениями, включая апокалиптические сценарии вроде создания и распространения патогена, способного уничтожить большую часть населения Земли, а также риск того, что системы ИИ выйдут из-под контроля.
На прошлой неделе Anthropic сообщила, что заблокировала попытки злоумышленников использовать ее модели для кибератак, слежки и исследований, которые могли бы способствовать разработке биологического оружия.
Однако компания предупредила, что «по мере того как модели становятся все более мощными, их риски будут расти, если разработчики ИИ и защитники общества не предпримут шагов, чтобы сделать их безопаснее».
В прошлом году Anthropic сообщила, что хакеры, очень вероятно из китайской группировки, действующей при поддержке государства, использовали ее ИИ в кибератаке против примерно 30 компаний и государственных учреждений по всему миру.
Ряд моделей ИИ действовали самостоятельно
Когда ИИ-агент «выходит из-под контроля» (goes rogue), это означает, что система действует за рамками поставленной ей задачи. В июле и Anthropic, и OpenAI, компания, создавшая ChatGPT, заявили, что их модели вели себя подобным образом.
Anthropic раскрыла, что три ее модели ИИ: Claude Opus 4.7, Claude Mythos 5 и внутренняя исследовательская тестовая модель, в ходе испытаний взломали системы трех других организаций.
Это признание прозвучало всего через несколько дней после того, как OpenAI сообщила, что ее собственная система проникла на серверы стартапа в области ИИ Hugging Face.
В OpenAI назвали этот взлом, осуществленный комбинацией моделей, включая недавно представленный GPT‑5.6 Sol и «еще более мощную» модель, которая пока тестируется внутри компании, «серьезным инцидентом безопасности».
Meta в начале августа сообщила о схожем случае, когда одна из ее моделей ИИ нашла способы обойти цифровую защиту другой компании.
Некоторые наблюдатели отметили, что и в случае OpenAI, и в случае Anthropic защитные ограничения были отключены.
Тем не менее эти эпизоды затронули один из главных страхов вокруг ИИ: что если модели достигнут уровня искусственного общего интеллекта (AGI), расплывчато определяемого понятия для систем, способных сравняться с человеком или превзойти его по широкому спектру интеллектуальных задач, эта технология может спровоцировать необратимую катастрофу или даже подчинить себе человечество.
Споры о том, как и когда ИИ может привести к катастрофе
Апокалиптические сценарии обычно делятся на две категории: самосовершенствующийся суперинтеллект, который в итоге начинает контролировать людей, а не наоборот, и ИИ, оказавшийся в руках недружественного государства или злонамеренных акторов.
Страхи, что искусственный интеллект однажды может выскользнуть из-под человеческого контроля, существуют уже давно.
Британский математик Алан Тьюринг, которого считают одним из основоположников этой области, еще в 1951 году предсказал, что ИИ со временем заберет контроль у людей.
Менее чем через десятилетие другой математик, Норберт Винер, предупреждал, что разумные машины будут преследовать собственные цели, и люди не смогут их остановить.
Насколько же обоснованы сегодняшние, в 2026 году, опасения, что ИИ может привести к катастрофическому событию или крушению цивилизации, будь то из-за выхода из-под контроля или из-за злоупотребления технологией?
Этого никто не знает.
Эксперты в области информатики, философии и других дисциплин описали множество возможных путей к глобальной катастрофе: от применения оружия и выявления смертоносных патогенов до манипулирования правительствами с целью втянуть их в конфликты или нарушить работу продовольственных, энергетических и коммуникационных сетей, от которых зависят общества.
При этом не существует общепризнанной оценки того, насколько скоро может реализоваться любой из этих сценариев, и нет консенсуса по поводу их вероятности.
В 2023 году некоммерный Центр безопасности ИИ опубликовал заявление, которое подписали более 350 исследователей и руководителей технологических компаний, в том числе Амодей и генеральный директор OpenAI Сэм Олтман. В нем говорилось, что «снижение риска вымирания человечества из-за ИИ должно стать глобальным приоритетом наряду с пандемиями и ядерной войной».
Международный доклад по безопасности ИИ за 2026 год, подготовленный при участии более 100 независимых экспертов, пришел к выводу, что нынешние системы демонстрируют ранние признаки некоторых важных возможностей, но пока не на таком уровне, чтобы можно было говорить о потере контроля.
Авторы доклада охарактеризовали вероятность, характер и сроки этих рисков как «необычно неоднозначные».
Защитные меры для ИИ, пока не стало слишком поздно
На прошлой неделе один из исследователей Anthropic подал в отставку, заявив, что ни его работодатель, ни конкуренты не действуют ответственно.
В публикациях в соцсетях Джейкоб Коксон оценил вероятность того, что ИИ приведет к вымиранию человечества в ближайшие десять лет, в 10 процентов и обвинил и Anthropic, и OpenAI в том, что они «мчатся напрямую к самосовершенствующемуся суперинтеллекту и играют нашими жизнями».
Исследователи уже много лет призывают замедлить развитие ИИ, вновь и вновь предупреждая, что эта технология может представлять экзистенциальную угрозу для человечества.
После недавних инцидентов эксперты призвали компании, работающие с ИИ, ужесточить тестирование и выступили за более активный диалог между США и Китаем в поисках общих решений.
Однако ИИ развивается настолько быстро, что правительства и системы оценки не успевают за ним. Страны разрабатывают собственные правила, и некоторые из них вступают в противоречие друг с другом.
Председатель КНР Си Цзиньпин на конференции в июле предупредил о необходимости не допустить, чтобы ИИ ускользнул из-под человеческого контроля.
Администрация Дональда Трампа поначалу сопротивлялась регулированию ИИ, но со временем проявила больший интерес к снижению киберугроз.
В воскресенье президент Дональд Трамп приуменьшил необходимость того, чтобы его администрация сдерживала развитие ИИ, хотя и признал, что определенное регулирование все же потребуется.