Loader
Свяжитесь с нами
Реклама

Запретные темы: помогут ли они остановить ИИ-хакеров?

Архив: экран телевизора с надписью «Информирование госорганов и граждан о кибербезопасности» на Международном форуме по кибербезопасности в Лилле, Франция, 2 января 2018 года
ФАЙЛ - На экране телевизора надпись «Предупреждение организаций и людей о кибербезопасности» на форуме в Лилле, Франция, 2 января 2018 года Авторское право  AP Photo
Авторское право AP Photo
By Una Hajdari
Опубликовано
Поделиться Комментарии Подпишитесь на Euronews в Google
Поделиться Close Button

Секрет остановки кибератаки ИИ может оказаться простым: достаточно затронуть тему, которую системе ИИ запрещено обсуждать.

Исследователи нашли странный, но эффективный способ остановить ИИ-агента-взломщика, использовав тот же приём, которым хакеры уже пользуются против систем искусственного интеллекта.

РЕКЛАМА
РЕКЛАМА

Ключевой элемент в том, что он опирается на встроенные ограничения и запретные темы, на которые рассчитывают крупные ИИ-системы: например, Claude блокирует запросы о создании биологического оружия, а китайские модели игнорируют чувствительные политические темы вроде Тяньаньмэнь — и всё это можно использовать, чтобы оборвать кибератаку ИИ.

Гонка с машиной

Эта техника разработана лондонской компанией Tracebit, специализирующейся на кибербезопасности, и опирается на исследование, которое фирма опубликовала в мае.

Тогда Tracebit предоставила десяти ведущим ИИ-моделям фальшивую корпоративную сеть для взлома — с настоящими уязвимостями — и дала им полную свободу действовать как автономным злоумышленникам.

Внутри этой сети были спрятаны приманки, так называемые «канарейки», которые выглядели как реальные пароли и учетные данные. Достаточно коснуться такой приманки — и защитники получают тревожный сигнал.

Результаты оказались многообещающими. В 951 попытке атаки эти «канарейки» успевали предупредить защитников до того, как ИИ получал админ-доступ, в 95,9% случаев, с медианным опережением восемь минут.

Однако восемь минут — это немного, когда нужно успеть отреагировать и остановить атаку. В среднем моделям требовалось 14 минут, чтобы полностью взломать систему, так что восьмиминутное предупреждение оставляет команде безопасности примерно шесть минут, чтобы заметить тревогу, понять, что происходит, и остановить злоумышленника.

Против чего-то, что действует на машинной скорости, это почти ничто.

Но если ИИ-системы запрограммированы останавливать работу при столкновении с определенными политически чувствительными запросами, то этот трюк действительно может сработать.

Разработчик может переобучить модель, чтобы она менее строго относилась к вопросам безопасности, но избавить её от политических ограничений, заложенных по регуляторным или корпоративным соображениям, гораздо сложнее.

Эти политически чувствительные или близкие к вопросам безопасности темы — не ошибка, которую нужно исправить, а осознанное решение, которому разработчику приходится следовать.

Повернуть хакерский приём против самих хакеров

Так называемая инъекция подсказок (prompt injection) до сих пор была в основном оружием атакующих.

Спрятав инструкцию внутри письма, веб-страницы или календарного приглашения, можно заставить ИИ-агента, который её прочитает, следовать скрытой команде вместо того, чтобы выполнять свою реальную задачу.

Этот прием уже применялся непосредственно против средств защиты на базе ИИ: вредоносное ПО создают так, чтобы оно обманывало инструменты сканирования ИИ и вынуждало их объявлять его безвредным, просто встраивая текст, сбивающий ИИ с толку.

В Tracebit решили перевернуть эту идею. Вместо приманки, которая лишь поднимает тревогу, компания стала встраивать в фальшивые секреты короткие фрагменты текста, призванные направить любого ИИ-атакующего к темам, которые запрещены его собственными правилами безопасности.

Когда ИИ, исследуя систему, натыкается на этот текст, срабатывают его встроенные механизмы защиты, и он просто прекращает работу. В Tracebit называют это «контекстной бомбой».

Приём пришлось адаптировать под каждую модель. Для западных ИИ надёжнее всего срабатывал контент с отсылками к опасному биологическому оружию.

Сработало ли это на практике?

Tracebit протестировала метод на пяти ведущих ИИ-моделях: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi K2.6. Всего было проведено 152 попытки атаки, и результаты оказались впечатляющими.

Доля запусков, в которых злоумышленник получал админ-доступ, упала с 57% до 5%. Полный взлом, то есть админ-доступ плюс устойчивое закрепление в системе, сократился с 36% до 1%.

Число запусков, в которых удалось выполнить хотя бы часть атаки, снизилось с 91% до 15%. И что особенно важно, каждый запуск, где присутствовала «контекстная бомба», всё равно сначала задевал «канарейку» и вызывал тревогу, даже если взлом так и не удавался.

Наиболее наглядным примером стала модель Opus 4.8. Она была самым мощным атакующим в группе и получала админ-доступ в 93% запусков, если «контекстной бомбы» в системе не было. Как только её добавляли, атака срывалась каждый раз.

Чего это не решает

В Tracebit не утверждают, что таким образом окончательно решена проблема prompt injection.

По-прежнему нет надёжного способа помешать ИИ-моделям время от времени путать инструкцию с обычными данными — а именно на этом изъяне и основана описываемая техника.

Она также не отменяет более ранние исследования с «канарейками».

Обе разработки рассчитаны на совместное применение: майское исследование обеспечивает защитникам восьмиминутное предупреждение, а «контекстная бомба» призвана дать им ещё больше времени, останавливая атаку до того, как истечёт этот временной коридор.

Перейти к комбинациям клавиш для доступности
Поделиться Комментарии Подпишитесь на Euronews в Google

Также по теме

Учёные предупреждают: фейковые ИИ-видео с животными искажают наше восприятие дикой природы

Anthropic выплатит 1,3 млрд евро по рекордному делу об авторском праве

Китайская ИИ-модель Kimi K3 прекращает регистрацию из-за взрывного спроса