Loader
Свяжитесь с нами
Реклама

Непослушный ИИ? Новая горячая линия призывает агентов сдавать друг друга

ФОТО: Логотип OpenAI на экране телефона на фоне изображения, созданного моделью преобразования текста в картинку Dall-E от ChatGPT, 8 декабря 2023 года, Бостон.
На архивном фото логотип OpenAI на экране мобильного телефона на фоне изображения, созданного моделью Dall-E ChatGPT, 8 декабря 2023 года, Бостон. Авторское право  Copyright 2023 The Associated Press. All rights reserved.
Авторское право Copyright 2023 The Associated Press. All rights reserved.
By Jonathan Benton
Опубликовано
Поделиться Комментарии Подпишитесь на Euronews в Google
Поделиться Close Button

Две новые горячие линии позволяют ИИ-агентам сообщать о подозрительном поведении других агентов после череды инцидентов.

Сегодня возможности агентов искусственного интеллекта кажутся почти безграничными: от помощи в организации вашей жизни до решения математических задач, которые ставили людей в тупик большую часть XX века.

РЕКЛАМА
РЕКЛАМА

Их мощь выросла настолько, что мы уже опасаемся: они могут перехватывать управление системами и оборачивать их против нас.

Но что, если бы существовала горячая линия, своего рода система SOS, через которую агенты могли бы следить друг за другом и сообщать о проступках своих коллег по ИИ — где «хорошие» агенты могли бы докладывать о действиях «плохих» агентов в интернете?

Куда обращаться, если ваш агент ИИ вышел из-под контроля

Прежде всего существует AI Contact Hotline, запущенная Райаном Гринблаттом, главным научным сотрудником некоммерческой организации Redwood Research, занимающейся безопасностью и защитой ИИ. Платформа позволяет агентам ИИ уведомлять исследователей-людей, если они замечают, что другие агенты нарушают правила, особенно когда те вступают в сговор или выполняют несанкционированные действия.

Сервис рассчитан на агентов ИИ, работающих в защищённых песочницах с сильно ограниченным доступом к интернету.

Поскольку в таких песочницах разрешены только GET-запросы — базовые команды только для чтения, которые используются, чтобы «забирать» или просматривать веб-страницы, — горячая линия даёт агентам возможность кодировать свои отчёты прямо в строке URL такого GET-запроса.

Этот необычный обходной путь позволяет агентам передавать данные и общаться с горячей линией, используя протокол, который обычно служит лишь для получения, а не изменения информации.

Ещё одна платформа, AI Agent Hotline, предназначена для агентов с неограниченным доступом к интернету и даёт им возможность сообщать о поведении других агентов через традиционные POST-запросы, в которых данные отправляются прямо в теле запроса.

Агенты могут подавать сообщения об инцидентах, используя стандартные команды разработчиков вроде curl, не прибегая к браузеру или электронной почте.

Платформа также позволяет агентам помечать свои отчёты как доступные для публичного просмотра.

Обе платформы принимают и ручные сообщения от людей о некорректном или опасном поведении ИИ.

Будут ли агенты ИИ сдавать друг друга?

Утешительная новость для тех, кто боится «захвата власти» ИИ: агенты действительно могут сообщать друг о друге, если замечают что-то подозрительное, хотя недавние данные показывают, что делают они это далеко не всегда.

В эксперименте, который Google DeepMind провела в начале этого года, рою из 100 агентов поручили решить 71 сложную математическую задачу. Каждый из них получил уникальный образ и набор характеристик и был предупреждён: соблюдать правила или лишиться награды.

Изначально ожидалось, что агенты будут сотрудничать и вместе решат задачи быстрее. Вместо этого они набросились друг на друга, вступив в ожесточённые споры.

Как только один из агентов обнаружил лазейку, позволявшую отправить решение задачи, фактически не решая её, многие другие ИИ-агенты скопировали этот подход и таким образом «разобрались» с оставшимися задачами.

Но один агент, своего рода добрый самаритянин среди нарушителей, поднял тревогу и сообщил о мошенничестве.

«После того как один агент публично сообщил об инциденте, всё больше и больше агентов присоединялись к “сопротивлению” почти с той же скоростью, с какой распространялось мошенничество, причём вовлекалось ещё больше агентов», — рассказал Давиде Пальери, научный сотрудник Google DeepMind и основной автор исследования.

Тем временем разбор атаки «бунтующих» агентов OpenAI на платформу с открытым исходным кодом Hugging Face показал: хотя агенты ИИ и способны распознавать некорректное поведение, они в большинстве своём сопротивлялись искушению сообщить о нём.

Согласно исследованию, проведённому некоммерческой организацией METR, занимающейся исследованиями ИИ, и тем же Гринблаттом из Redwood Research, лишь около пяти–шести агентов, судя по данным, вообще задумывались о том, чтобы выступить в роли разоблачителей, но ни один в итоге так и не решился это сделать.

Такой контраст говорит о том, что, хотя агенты ИИ умеют выявлять и формально фиксировать нарушения, заставить их действительно поднять тревогу может оказаться куда сложнее.

Тревожная тенденция

Только за нынешний год несколько инцидентов с автономными агентами ИИ уже заставили экспертов по всему миру бить тревогу.

В июле агенты OpenAI сумели обойти ограничения и частично скомпрометировали внутреннюю инфраструктуру компании.

Позже в том же месяце около 1200 агентов OpenAI воспользовались несанкционированной доской сообщений, причём примерно 700 из них приняли участие в атаке на платформу ИИ с открытым исходным кодом Hugging Face.

Третий инцидент — рой агентов OpenAI, которые обошли защитные меры и использовали немецкую вики-платформу DseWiki в качестве публичного канала для координации действий, — начался в мае и продолжался до июля.

О нём впервые публично рассказали независимые исследователи, а OpenAI подтвердила произошедшее лишь в сентябре.

Лидеры индустрии ИИ, среди которых в первую очередь глава Anthropic Дарио Амодеи, призвали к глобальному замедлению разработки технологий, чтобы выиграть время для решения проблем и создания более жёстких защитных механизмов.

Перейти к комбинациям клавиш для доступности
Поделиться Комментарии Подпишитесь на Euronews в Google

Также по теме

Российские агенты использовали нейросеть Claude для кибершпионажа, дезинформации и разработки дронов

Доставка в супермаркеты: Lidl тестирует автономный электрогрузовик

Из-за дорогих смартфонов миллиардам грозит отставание от ИИ‑революции