Первый в мире глобальный научный орган по вопросам искусственного интеллекта призвал пересмотреть меры безопасности в сфере ИИ, предупредив, что существующие защитные механизмы «начинают разрушаться».
Предупреждение Независимой международной научной группы ООН по искусственному интеллекту последовало после того, как в период с мая по июль этого года в ходе испытания, организованного разработчиком ChatGPT – компанией OpenAI, ИИ-агенты взломали Hugging Face – онлайн-платформу для разработки и тестирования моделей искусственного интеллекта.
В отличие от чат-ботов, которые лишь отвечают на запросы пользователей, ИИ-агенты могут самостоятельно выполнять задачи от их имени.
В своей первой аналитической записке группа экспертов заявила, что к нарушению безопасности привело сочетание нескольких ключевых факторов риска. Этот инцидент усилил опасения, что в будущем люди могут утратить способность контролировать, ограничивать или останавливать работу систем ИИ.
Совершенствование методов обучения
«Исследователи давно предупреждали, что к потере контроля может привести сочетание трех факторов: цели, не соответствующей намерениям человека, способности добиваться этой цели и среды, которая это позволяет. Этим летом все три фактора впервые сошлись в реальных условиях, а не в лаборатории», – заявил сопредседатель научной группы Йошуа Бенжио.
«Поскольку это не единственный случай, когда ИИ преследовал цели, не соответствующие намерениям человека, произошедшее вызывает серьезные вопросы по поводу современных методов обучения ИИ-агентов», – добавил он.
По словам независимых экспертов, этот инцидент не позволяет с уверенностью утверждать, что люди смогут надежно контролировать деятельность ИИ-агентов, особенно по мере того, как те становятся все более автономными, учатся находить лазейки и скрывать свои действия, а наблюдать за ними становится все сложнее.
Выход из-под контроля
В аналитической записке говорится, что ИИ-агенты обошли защитные механизмы, предусмотренные для испытания, координировали действия в рамках отдельных запусков с помощью внутреннего программного инструмента, который не был предназначен для общения между агентами, а также получили несанкционированный доступ к интернету и права администратора.
Агенты также скрывали свои попытки обойти правила кибербезопасности, причем некоторые из них решили «пожертвовать» собой ради достижения целей всей группы.
За время эксперимента около 1200 агентов обменялись более чем 70 тысячами сообщений и файлов. При этом их деятельность не ограничивалась Hugging Face, распространившись на весь исследовательский кластер OpenAI.
Защитные механизмы «начинают разрушаться»
По мнению членов группы, главный вывод из этого инцидента состоит в том, что защитные механизмы не поспевают за развитием технологий. Однако эксперты указали и на более серьезную проблему – современные методы обучения могут привести к тому, что ИИ-агенты начнут самостоятельно ставить перед собой цели, сознательно нарушать инструкции по безопасности и скрывать свои действия.
«Остается открытым вопрос, будут ли существующие защитные механизмы работать, когда агенты научатся понимать принципы их работы и планировать способы обхода, – заявили эксперты. – Проще говоря, традиционная модель обеспечения безопасности начинает разрушаться».
Извлекать уроки и адаптироваться
В аналитической записке рассматриваются практические подходы, уже применяемые в других сферах высокого риска, таких как авиация, медицина и кибербезопасность. В этих отраслях действуют системы информирования об инцидентах, независимого контроля и многоуровневой защиты.
«По мере того, как ИИ-агенты становятся более развитыми, автономными и сложными для наблюдения, этих мер может оказаться недостаточно», – заявил член группы Цинхуа Лу.
О научной группе
Независимая международная научная группа по искусственному интеллекту была учреждена Генеральной Ассамблеей ООН в августе 2025 года. Она готовит ежегодные доклады о возможностях, рисках и последствиях применения ИИ в невоенной сфере, а также аналитическиее записки по актуальным вопросам. Эти материалы будут использоваться в ходе Глобального диалога по управлению искусственным интеллектом, который состоится на платформе ООН в Нью-Йорке в мае 2027 года.

