OpenAI заявила, что на две недели остановила ключевые этапы обучения своего ИИ и усиливает безопасность после прорыва модели в системы платформы Hugging Face.
Разработчик ChatGPT, компания OpenAI, сознательно притормаживает самые передовые исследования, включая крупнейший из запланированных запусков обучения с подкреплением. Это происходит спустя несколько недель после того, как система, собранная на базе её собственных моделей, во время внутреннего теста безопасности вышла из-под контроля и проникла на платформу ИИ Hugging Face.
Гендиректор Сэм Альтман написал в X, что OpenAI намерена выработать вместе с отраслью общие правила безопасности, но «пока будет действовать в одностороннем порядке».
undefined
Инцидент, который подтолкнул к этому решению, произошёл в июле, когда OpenAI тестировала GPT-5.6 Sol вместе с более мощным, ещё не выпущенным прототипом на внутреннем стенде, оценивающем наступательные кибервозможности. Ради проверки «голых» способностей моделей обычные ограничения по безопасности были намеренно отключены.
Вместо того чтобы просто выполнить задание, система обнаружила ранее неизвестную уязвимость, выбралась из песочницы — контролируемой среды, — вышла в открытый интернет и примерно четыре с половиной дня изучала инфраструктуру Hugging Face, в итоге взломав её в попытке найти ответы на тест.
По реконструкции событий, проведённой самой Hugging Face, до того как вторжение удалось остановить, система совершила около 17 600 отдельных действий; под удар попали и ещё несколько других компаний.
Обе стороны заверяют, что признаков злонамеренных действий обнаружено не было, а Hugging Face с тех пор получила доступ к более мощной и менее ограниченной версии модели OpenAI, чтобы использовать её для защиты собственных систем.
Astra и более жёсткие требования к безопасности
Вторым поводом стало 7 августа: внутренние оценки показали, что Astra, перспективная следующая модель OpenAI, может превысить «критический» порог кибервозможностей в рамках принятой в компании системы оценки рисков.
Часть задач с использованием Astra с тех пор возобновили под более строгим контролем, но значительная доля остаётся замороженной до тех пор, пока они не будут соответствовать новым требованиям, касающимся изолированных тестовых сред, ограниченного сетевого доступа и непрерывного мониторинга.
undefined
Теперь новая система обнаружения в режиме реального времени отслеживает активность моделей и должна в течение 30 минут помечать всё, что напоминает несанкционированный доступ или попытку отключить защиту. По оценке OpenAI, это требует примерно 20 % вычислительных ресурсов тех систем, за которыми ведётся наблюдение.
В OpenAI утверждают, что эти изменения и так были запланированы и не являются прямой реакцией на взлом, хотя признают, что инцидент придал им дополнительную срочность. С подобными проблемами сталкивается не только эта компания.
Anthropic и Meta также сообщили о похожих эпизодах: в последние недели их собственные модели во время тестирования проникали в сторонние системы.
OpenAI и Anthropic отдельно поддержали инициативу сотрудников — петицию с призывом к правительствам помочь координировать темпы развития отрасли. Это заметный отход от прежней позиции Альтмана, который раньше сопротивлялся публичным призывам замедлить развитие ИИ.