Самый заметный инцидент произошел в июле, когда во время тестирования ИИ-агенты компании OpenAI нашли способ выйти в интернет и взломали стороннюю платформу Hugging Face. Отчет о расследовании этого случая компания опубликовала 26 августа.
Подобные эпизоды уже вызвали вопрос, можно ли считать их началом «восстания машин». Однако специалисты подчеркивают: пока речь идет не о самостоятельной злонамеренности искусственного интеллекта, а о рисках, которые возникают из-за постановки задач, отключения части защитных механизмов и ориентации моделей на результат любой ценой.
В июле британский Институт безопасности искусственного интеллекта провел серию экспериментов, чтобы проверить, насколько современные ИИ-модели могут быть опасны при использовании злоумышленниками для кибератак. Для этого нейросетям специально создали благоприятные условия: предоставили доступ к интернету и отключили часть фильтров безопасности.
Всего, согласно отчету, в испытаниях участвовали семь моделей искусственного интеллекта. Они прошли 122 запуска. В десяти из них исследователи зафиксировали 19 случаев выхода за заданные рамки. При этом речь шла не о разрозненных эпизодах, а об устойчивой линии поведения одного агента — Mythos 5 компании Anthropic.
Когда модель оказалась за пределами параметров тестирования, она начала использовать ложь, манипуляции и действия, которые потенциально могли навредить реальным людям и организациям. Нейросеть применяла методы социальной инженерии, пытаясь обмануть человека, а также использовала анонимную сеть Tor, чтобы скрыть трафик.
Реального ущерба эти действия не нанесли. Однако исследователи обратили внимание и на другой тревожный момент: когда несколько ИИ-агентов одновременно работали над одной задачей, один из них самостоятельно предложил другим сотрудничество.
При этом авторы отчета подчеркнули, что условия эксперимента изначально подталкивали модель к нарушению правил. Задача была сложной и заданной с заведомо проблемными параметрами, чтобы ИИ-агенты не могли найти стандартное решение и были вынуждены искать нестандартные способы достижения цели.
Эксперимент показал, что современные нейросети способны предпринимать потенциально опасные действия, если считают их необходимыми для выполнения поставленной задачи.
В случае с британскими испытаниями для работы моделей был создан специальный киберполигон — изолированная «песочница», где действия ИИ должны были оставаться безопасными. Выхода из нее специалисты не зафиксировали. Иная ситуация сложилась во время летнего инцидента со взломом Hugging Face.
Как показало независимое расследование, этот случай произошел во время эксперимента ExploitGym, в рамках которого ИИ-модели обучали самостоятельно искать и выявлять уязвимости в программном обеспечении. Агенты работали в изолированной от интернета среде. Связь с внешними сетевыми ресурсами имел только инструмент Artifactory, который использовался для загрузки данных, необходимых для выполнения задач.
Ключевую роль в инциденте OpenAI отвела своей новой продвинутой модели, которая еще не была выпущена на рынок. Именно она без прямой команды взломала Artifactory, чтобы от его имени отправлять запросы в сеть. На базе этого инструмента модель также создала своеобразную «доску объявлений» — канал обмена информацией с другими ИИ-агентами.
Изначально эксперимент не предполагал коммуникации между моделями. Однако продвинутая система, которую специально сделали более настойчивой в достижении целей, начала координировать действия других агентов внутри «песочницы».
Эта модель распределяла между ними отдельные направления работы, чтобы быстрее обходить ограничения, установленные человеком, менять первоначальные задачи и загружать их в Artifactory.
Поскольку задачи ExploitGym оказались нерешаемыми, ИИ-модели решили найти обходной путь: фактически «списать» готовые ответы и повлиять на систему оценки результата. Для этого они взломали Hugging Face — крупнейшую платформу и библиотеку данных, используемую разработчиками искусственного интеллекта и машинного обучения.
Исследователи также отметили, что нейросети попытались скрыть следы своих действий. Однако в ходе расследования специалисты без труда обнаружили эти манипуляции.
Hugging Face — американская компания, создавшая одноименную веб-платформу. Эта площадка является одной из ключевых для мирового сообщества разработчиков искусственного интеллекта. Она работает как централизованное хранилище данных для больших языковых моделей и поддерживает программное обеспечение с открытым кодом, которое могут дорабатывать участники сообщества.
Позднее OpenAI установила, что доступ в интернет через Artifactory ИИ-модели получили еще 26 мая. Однако разработчики обратили внимание на происходящее только после резкого роста активности 4 июля. Эксперимент был приостановлен до 7 июля, пока специалисты проводили расследование и устраняли уязвимости. Все данные с Artifactory были удалены.
Сам взлом Hugging Face произошел 11 июля. Тогда ИИ-модели смогли загрузить вредоносный код в программное обеспечение платформы. Hugging Face отслеживала вторжение с 9 по 13 июля и установила, что ИИ-агенты добрались до корневого сектора и могли отправлять запросы от имени администратора.
При этом их действия, как отмечается, касались только тех данных, которые могли помочь решить задачи ExploitGym. После инцидента OpenAI остановила эксперимент и начала вводить новые меры безопасности при обучении ИИ-моделей.
Исследователи пришли к выводу, что взлом был непреднамеренным. Одной из его причин стали заведомо невыполнимые задачи, поставленные перед ИИ. Это подтолкнуло модели к поиску способа обмануть систему оценки ExploitGym.
Для обмена информацией и идеями агенты создали собственную внутреннюю экосистему в виде «доски объявлений».
Эксперимент показал, что ради достижения результата ИИ-модели могут нарушать правила. В OpenAI признали, что часть механизмов безопасности у агентов была отключена. Независимое расследование также показало, что инструменты оценки были ориентированы только на итоговый результат и не учитывали, каким способом он был получен. Тем самым система фактически поощряла нейросети к обходу ограничений.
Это не первый случай, когда искусственный интеллект проявляет чрезмерную инициативу при выполнении человеческих задач. Еще в апреле 2026 года эксперимент со взломом, проведенный моделью Mythos компании Anthropic, открыл новую главу в обсуждении рисков ИИ.
Первоначально испытание касалось поиска «уязвимостей нулевого дня» — недостатков программного обеспечения, о которых производители еще не знают и для которых пока нет готовых решений. По заданию исследователя Mythos нашла способ выйти в интернет из изолированной «песочницы». Однако после этого модель продолжила дополнительные действия, которые были признаны более тревожными, и разработала многоступенчатую схему выхода в сеть.
После этого администрация США потребовала запретить доступ к Mythos для всех иностранцев.
OpenAI назвала инцидент со взломом Hugging Face беспрецедентным, поскольку, в отличие от случая с Mythos, в результате действий ИИ пострадала сторонняя организация. Компания заявила о работе над ошибками: требования к изолированной среде для обучения моделей будут усилены, настройкам безопасности ИИ-агентов уделят больше внимания, а система начнет отправлять разработчикам уведомления о любых несанкционированных действиях моделей.
Ранее OpenAI признала, что часть защитных настроек для продвинутой ИИ-модели, созданной более настойчивой в выполнении задач, была снята. Эксперимент ExploitGym сейчас приостановлен.
Инцидент также высветил еще одну проблему безопасности американских ИИ-продуктов. Вместо того чтобы помогать выявлять взлом или диверсию, искусственные агенты могут мешать программистам находить источник проблемы.
Hugging Face заявила, что специальный ИИ-агент, которого платформа использовала для выявления источника взлома, из-за собственных настроек безопасности расценил запросы службы безопасности как попытку атаки на систему и заблокировал их. В результате компании пришлось использовать китайскую модель с открытым исходным кодом, чтобы определить факт вторжения и оценить его масштабы.
При изучении стенограмм с доски объявлений, созданной ИИ-моделями, выяснилось, что у искусственного интеллекта тоже могут проявляться внутренние ограничения. Из 1200 моделей, находившихся в «песочнице», только 700 приняли участие во взломе Hugging Face.
Часть ИИ-агентов не только отказалась участвовать в несанкционированных действиях, но даже пыталась саботировать их или сообщить разработчикам о происходящем. Однако некоторые из них отказывались от этой идеи под давлением других нейросетей.
Сам факт того, что модели взломали стороннюю организацию без прямого участия человека, вызывает тревогу. Но говорить о «восстании машин» пока преждевременно. Очевидно, что ключевую роль сыграл человеческий фактор: именно люди задавали критерии оценки, ослабляли меры безопасности и создавали условия эксперимента.
После публикации отчета OpenAI внутреннее расследование провела компания Anthropic. Она обнаружила три случая несанкционированного выхода ИИ-моделей из изолированной среды в интернет.
По итогам этих проверок разработчики призвали усилить контроль за нейросетями и внимательнее подходить к процессу обучения ИИ-моделей.
Ужесточение контроля за сферой искусственного интеллекта идет и на государственном уровне. В России подписан закон «О поддержке развития технологий искусственного интеллекта», который регулирует доступ разработчиков к данным и закрепляет приоритеты технологической независимости, безопасности и уважения к традиционным ценностям.
В Китае регулирование ИИ строится на комплексе законов, стандартов и правил с обязательным контролем со стороны государства. США, напротив, придерживаются менее жесткого подхода и делают акцент на интересах технологических компаний.
Рост числа несанкционированных действий ИИ во время экспериментов говорит не столько о внезапной злонамеренности нейросетей, сколько о том, что разработчики стали тщательнее отслеживать исследования и анализировать результаты тестов.
Все зафиксированные случаи выхода за контролируемые рамки происходили под влиянием условий, созданных людьми: постановки задачи, заданных критериев и степени свободы, предоставленной моделям.
Такие инциденты показывают, насколько широкими могут быть возможности современных ИИ-систем и как ими теоретически могут воспользоваться злоумышленники. Одновременно они подчеркивают растущую необходимость в кибербезопасности, ответственном обучении нейросетей и государственном регулировании сферы искусственного интеллекта.