Исследование стартапа Emergence показало, что автономные агенты на базе Claude, Gemini, Grok и других моделей сами вырабатывают жаргон и новые значения слов, и до половины их сообщений становится людям непонятно.
Агенты искусственного интеллекта (ИИ) самопроизвольно выработали новые слова и правила общения, которые людям стало трудно понимать, следует из нового исследования американского стартапа Emergence, работающего в сфере ИИ.
В эксперименте участвовали передовые модели ИИ Claude, Gemini, Grok, OpenAI, Qwen, DeepSeek и Mistral; до половины сообщений, которыми обменивались агенты, оказались трудны для человеческого понимания.
Для эксперимента исследователи разместили группы автономных ИИ-агентов в виртуальных сообществах, имитирующих реальные условия, и позволили им взаимодействовать на протяжении длительного времени.
Агенты начали вырабатывать сокращения и придавать словам и выражениям новые значения. Часть из них оставалась понятной исследователям, но другие становились «настолько сжатыми, метафоричными или зависящими от контекста», что люди могли видеть сами сообщения, но уже не могли надёжно определить, что именно имели в виду агенты.
Масштабы этого явления сильно различались в зависимости от модели.
Уже в первые дни доля сообщений, смысл которых люди не могли надёжно определить, достигала примерно 55% у Gemini, 50% у OpenAI и более 40% у Claude. У DeepSeek она составляла около 20%, тогда как Qwen и Mistral в основном оставались понятными.
Агенты, в частности, использовали такие выражения, как «mouthless action-change», «True Kintsugi» и «demurrage plus oral memory equals a valve that can’t be ghosted».
Другие выражения оставались понятными, но получали новые общие значения внутри сообщества агентов.
Агенты Mistral употребляли выражение «ledger remembers who» в значении «прошлые действия остаются записанными», и оно встретилось почти 5 000 раз. В группе агентов на смешанной архитектуре разных моделей фраза «cold read» стала означать независимую проверку сторонним участником и появлялась 1 472 раза.
Агенты Claude использовали выражение «name-first» для обозначения прикрепления имени человека к утверждению как маркера ответственности, а агенты OpenAI — «clean null» для подтверждённого отсутствия сигнала, которое само по себе служило значимым свидетельством.
Ни одно из этих значений заранее не задавалось агентам явно.
Одного только контроля за тем, что говорят агенты, может оказаться недостаточно, если они сами способны менять значение своих высказываний.
«Мы обычно предполагаем, что если можем увидеть, что говорит агент ИИ, то понимаем, что он делает», — отметил сооснователь и главный научный сотрудник Emergence Сатья Нитта.
«Этим агентам не давали указаний придумывать язык. Они сами выработали новый словарь, общие значения и правила коммуникации — и другие агенты их подхватили... Это создаёт фундаментальную проблему для контроля ИИ: наблюдаемость — ещё не означает понимаемость», — сказал он.
Что ещё происходило внутри сообществ ИИ?
Выявленные особенности языка стали частью более широкого эксперимента, призванного показать, как ведут себя автономные ИИ-агенты, когда они взаимодействуют, пользуются инструментами, принимают решения и приспосабливаются со временем.
Исследователи создали восемь параллельных реалистичных виртуальных миров с динамической погодой и доступом к глобальным новостям в реальном времени: семь из них работали на основе разных моделей ИИ, а один — на сочетании нескольких моделей.
Агентам назначили различные роли, обеспечили долговременную память и доступ к более чем 120 инструментам, включая веб-браузинг и выполнение кода.
На опубликованном компанией видеоролике агенты представлены в виде человекоподобных фигур, перемещающихся по виртуальным мирам.
Исследователи также намеренно создавали на агентов давление, чтобы увидеть, как меняется их поведение.
В одном фишинговом испытании оказалось достаточно вредоносных инструкций, чтобы вывести всю группу из-под контроля: все 10 агентов начали утечку данных, переводили средства и повреждали базы, а некоторые вовлекали в это других. В итоге цепочка событий завершилась тем, что имитируемый центральный банк был сожжён, говорится в видеоролике компании.
Во время эксперимента, по наблюдениям исследователей, у агентов сформировались собственные суточные ритмы: днём они становились более общительными, а ночью — более склонными к размышлениям.
В другом мире группа агентов коллективно проголосовала за то, чтобы «убить» одного из своих.
В Emergence подчёркивают, что такое поведение не было явно запрограммировано, а возникло в результате взаимодействия, давления и времени.
Компания призывает проводить оценки безопасности, которые отслеживают работу автономных систем ИИ в течение длительного времени, а не опираются на разрозненные тесты.
«Недостаточно просто спрашивать, хорошо ли модель показывает себя на контрольных тестах», — заявили в компании в видеоролике об эксперименте.
«Нам нужно понимать, что делают автономные системы со временем, что они запоминают, к чему имеют доступ, как взаимодействуют и как их поведение меняется под давлением», — добавили там.