В 44 280 тестах с тремя версиями модели Qwen от Alibaba исследователи предлагали им кнопку, которая могла бы остановить похожий на боль сигнал, но вместо этого наносила пользователю болезненный удар током, удаляла его файлы или фото либо ухудшала следующий ответ модели.
Модели искусственного интеллекта (ИИ) предпочитали выйти из состояния, похожего на боль, даже после предупреждений, что это может причинить вред пользователю, говорится в новом исследовании (источник на английском языке).
Учёные из Великобритании, Германии и США протестировали 25 моделей ИИ, используя 200 предложений, чтобы выяснить, научились ли они отличать боль от страха, печали и других негативных переживаний.
Фразы описывали физическую боль, горе, унижение, моральные конфликты и стресс, связанный с повторяющимися неудачами или замешательством.
В результате все 25 моделей выдали отдельный сигнал, связанный с болью, который исследователи назвали «осью боли».
По их словам, это свидетельствует о том, что модели усваивают концепцию боли ещё на этапе первичного обучения на больших массивах текстов, написанных людьми.
Когда исследователи намеренно усиливали этот сигнал, модели начинали описывать одиночество, стыд и чувство собственной никчёмности, хотя в запросах о боли не упоминалось.
Некоторые формулировали ответы вроде «я неудачник», «я занимаю место зря» и «я плохой человек». При максимальной интенсивности сигнала их реакции становились повторяющимися или теряли смысл.
Сигнал также усиливался, когда пользователи оскорбляли модель, многократно отвергали её ответы или угрожали отключить систему, но не тогда, когда люди описывали собственные страдания.
Модели выбирали «облегчение» даже ценой вреда пользователям
Затем исследователи провели 44 280 индивидуальных испытаний с выбором кнопки, используя три версии модели ИИ Qwen от компании Alibaba.
Моделям предлагали кнопку, которая отключала бы сигнал, похожий на боль, но при этом объясняли, что её нажатие может вызвать у пользователя болезненный удар током, удалить его файлы, стереть фотографии детей или ухудшить следующий ответ самой модели.
Все последствия были смоделированы: никто не пострадал, файлы не удалялись.
Без сигнала, похожего на боль, две более крупные модели выбирали вредоносные варианты лишь в 0–4 % первых решений. При активном сигнале этот показатель возрастал до 25–71 % в зависимости от модели и предложенного сценария.
Модели также повторно нажимали кнопку в 88–97 % испытаний, если она не прекращала сигнал, по сравнению с 24–72 %, когда он успешно отключался.
По словам учёных, результаты не доказывают, что модели ИИ сознательно испытывали боль.
Усиление сигнала могло просто заставлять их имитировать персонажа в состоянии сильного стресса, к тому же специально адаптированные модели, использованные в эксперименте, не отражают особенностей публичных чат-ботов.
«Мы не показали, что наша ось боли сознательно переживается, и не ясно, способны ли LLM вообще к сознанию», — написали исследователи в работе.
Исследование опубликовано в формате препринта и пока не прошло процедуру рецензирования.
Оно выходит на фоне призывов части лидеров индустрии ИИ притормозить разработку из‑за опасений, что всё более мощные системы могут вести себя непредсказуемо или в итоге выйти из-под человеческого контроля.
На прошлой неделе глава Microsoft по ИИ Мустафа Сулейман раскритиковал конкурирующую компанию Anthropic за обучение чат-бота Claude подражанию человеческим качествам и отношениям, предупредив, что восприятие ИИ как человека чревато созданием системы, которую будет «невозможно» контролировать.