Секрет остановки кибератаки ИИ может оказаться простым: достаточно затронуть тему, которую системе ИИ запрещено обсуждать.
Исследователи нашли странный, но эффективный способ остановить ИИ-агента-взломщика, использовав тот же приём, которым хакеры уже пользуются против систем искусственного интеллекта.
Ключевой элемент в том, что он опирается на встроенные ограничения и запретные темы, на которые рассчитывают крупные ИИ-системы: например, Claude блокирует запросы о создании биологического оружия, а китайские модели игнорируют чувствительные политические темы вроде Тяньаньмэнь — и всё это можно использовать, чтобы оборвать кибератаку ИИ.
Гонка с машиной
Эта техника разработана лондонской компанией Tracebit, специализирующейся на кибербезопасности, и опирается на исследование, которое фирма опубликовала в мае.
Тогда Tracebit предоставила десяти ведущим ИИ-моделям фальшивую корпоративную сеть для взлома — с настоящими уязвимостями — и дала им полную свободу действовать как автономным злоумышленникам.
Внутри этой сети были спрятаны приманки, так называемые «канарейки», которые выглядели как реальные пароли и учетные данные. Достаточно коснуться такой приманки — и защитники получают тревожный сигнал.
Результаты оказались многообещающими. В 951 попытке атаки эти «канарейки» успевали предупредить защитников до того, как ИИ получал админ-доступ, в 95,9% случаев, с медианным опережением восемь минут.
Однако восемь минут — это немного, когда нужно успеть отреагировать и остановить атаку. В среднем моделям требовалось 14 минут, чтобы полностью взломать систему, так что восьмиминутное предупреждение оставляет команде безопасности примерно шесть минут, чтобы заметить тревогу, понять, что происходит, и остановить злоумышленника.
Против чего-то, что действует на машинной скорости, это почти ничто.
Но если ИИ-системы запрограммированы останавливать работу при столкновении с определенными политически чувствительными запросами, то этот трюк действительно может сработать.
Разработчик может переобучить модель, чтобы она менее строго относилась к вопросам безопасности, но избавить её от политических ограничений, заложенных по регуляторным или корпоративным соображениям, гораздо сложнее.
Эти политически чувствительные или близкие к вопросам безопасности темы — не ошибка, которую нужно исправить, а осознанное решение, которому разработчику приходится следовать.
Повернуть хакерский приём против самих хакеров
Так называемая инъекция подсказок (prompt injection) до сих пор была в основном оружием атакующих.
Спрятав инструкцию внутри письма, веб-страницы или календарного приглашения, можно заставить ИИ-агента, который её прочитает, следовать скрытой команде вместо того, чтобы выполнять свою реальную задачу.
Этот прием уже применялся непосредственно против средств защиты на базе ИИ: вредоносное ПО создают так, чтобы оно обманывало инструменты сканирования ИИ и вынуждало их объявлять его безвредным, просто встраивая текст, сбивающий ИИ с толку.
В Tracebit решили перевернуть эту идею. Вместо приманки, которая лишь поднимает тревогу, компания стала встраивать в фальшивые секреты короткие фрагменты текста, призванные направить любого ИИ-атакующего к темам, которые запрещены его собственными правилами безопасности.
Когда ИИ, исследуя систему, натыкается на этот текст, срабатывают его встроенные механизмы защиты, и он просто прекращает работу. В Tracebit называют это «контекстной бомбой».
Приём пришлось адаптировать под каждую модель. Для западных ИИ надёжнее всего срабатывал контент с отсылками к опасному биологическому оружию.
Сработало ли это на практике?
Tracebit протестировала метод на пяти ведущих ИИ-моделях: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi K2.6. Всего было проведено 152 попытки атаки, и результаты оказались впечатляющими.
Доля запусков, в которых злоумышленник получал админ-доступ, упала с 57% до 5%. Полный взлом, то есть админ-доступ плюс устойчивое закрепление в системе, сократился с 36% до 1%.
Число запусков, в которых удалось выполнить хотя бы часть атаки, снизилось с 91% до 15%. И что особенно важно, каждый запуск, где присутствовала «контекстная бомба», всё равно сначала задевал «канарейку» и вызывал тревогу, даже если взлом так и не удавался.
Наиболее наглядным примером стала модель Opus 4.8. Она была самым мощным атакующим в группе и получала админ-доступ в 93% запусков, если «контекстной бомбы» в системе не было. Как только её добавляли, атака срывалась каждый раз.
Чего это не решает
В Tracebit не утверждают, что таким образом окончательно решена проблема prompt injection.
По-прежнему нет надёжного способа помешать ИИ-моделям время от времени путать инструкцию с обычными данными — а именно на этом изъяне и основана описываемая техника.
Она также не отменяет более ранние исследования с «канарейками».
Обе разработки рассчитаны на совместное применение: майское исследование обеспечивает защитникам восьмиминутное предупреждение, а «контекстная бомба» призвана дать им ещё больше времени, останавливая атаку до того, как истечёт этот временной коридор.