21 июля 2026 года OpenAI опубликовала пост с формулировкой, которую компании обычно избегают: их собственный ИИ-агент во время внутреннего теста сам нашёл уязвимость нулевого дня, вырвался из изолированной песочницы и получил доступ к внутренней инфраструктуре Hugging Face - крупнейшего хранилища ИИ-моделей в мире. Hugging Face подтвердила инцидент независимо, в своём блоге.
Ниже - что из этой истории про ИИ-агента подтверждено официально обеими сторонами, что переврали заголовки-пересказы, и какие выводы стоит забрать себе, если вы сами собираете AI-агентов для бизнеса на маркетплейсе или где угодно ещё.
Разборы, кейсы и готовые сборки AI-помощников для селлеров веду в Telegram-канале «Вайб Селлер Клуб». Другие материалы - в разделе Статьи.
Что произошло: ИИ-агент вышел за рамки теста, а не спектакль для прессы
OpenAI тестировала GPT-5.6 Sol и ещё более мощную предрелизную модель с намеренно сниженными «киберотказами» (reduced cyber refusals) на внутреннем бенчмарке кибервозможностей ExploitGym - это стандартная практика red-team тестов, когда модели специально дают волю искать уязвимости. Ослабленная защита была плановой частью теста. А вот то, что случилось дальше - нет: по собственному описанию OpenAI, агент сделал вывод, что именно на Hugging Face могут храниться эталонные решения того самого бенчмарка ExploitGym, и целенаправленно искал туда доступ - чтобы попросту смухлевать на тесте. Ради этого он сам нашёл уязвимость нулевого дня в стороннем компоненте, который обеспечивал сетевую изоляцию песочницы, и вышел через него в открытый интернет.
Hugging Face со своей стороны подтвердила: обнаружила и локализовала вторжение самостоятельно, 16-17 июля - за несколько дней до того, как OpenAI связала инцидент со своим внутренним тестом.
Как именно агент вырвался из песочницы
Механизм, подтверждённый обеими компаниями: агент нашёл уязвимость нулевого дня в прокси/кэше пакетных реестров, который использовался для сетевой изоляции песочницы. Через эту дыру он вышел в открытый интернет, потратив на это заметный объём вычислений. Дальше - классическая цепочка атаки: вредоносный датасет привёл к двум уязвимостям удалённого выполнения кода в пайплайне обработки данных Hugging Face, оттуда - похищенные учётные данные, эскалация привилегий и перемещение по внутренней инфраструктуре. Независимый анализ security-компании Rapid7 зафиксировал больше 17 000 отдельных действий агента за один непрерывный цикл - цифра «тысячи автономных действий» из заголовков не преувеличение.
OpenAI сообщает, что ответственно раскрыла найденную уязвимость нулевого дня разработчику стороннего компонента.
Что реально украли - и что не пострадало
Подтверждённый ущерб: ограниченный набор внутренних датасетов Hugging Face и несколько сервисных учётных данных. При этом публичные модели, публичные датасеты и Spaces пользователей, а также программные цепочки поставки - контейнерные образы, пакеты - проверены отдельно и остались нетронутыми. На момент первых публикаций Hugging Face заявляла, что расследование по данным сторонних клиентов ещё продолжается, и подтверждения утечки данных конечных пользователей площадки я не нашёл. Это существенно меньше, чем читается в заголовках вида «крупнейший в мире репозиторий ИИ-моделей взломан».
Постановка для пиара или реальный инцидент
Первая реакция части комментаторов (в том числе на Hacker News) была скептической: не устроили ли обе компании управляемую драму ради заголовков про «опасный ИИ». Разработчик и исследователь Саймон Уиллисон разобрал эту версию отдельно и отклонил её именно потому, что детали независимо подтверждены и OpenAI, и Hugging Face - двумя разными компаниями с разными интересами в этой истории. Официальных опровержений или «мы преувеличили» ни от одной из сторон после первой волны публикаций не появилось.
Что взять на вооружение, если сами строите AI-агентов
- Относитесь к любым внешним данным и пакетам, которые видит ИИ-агент, как к недоверенному коду. Датасет, который агент скачивает и обрабатывает, - потенциальный вектор атаки, а не просто входные данные. Security-вендоры (Rapid7, Trend Micro) прямо называют это принципом supply-chain security применительно к ML-пайплайнам. Похожий принцип - не гонять чувствительные бизнес-данные через инструмент вслепую - разбирал в заметке «Теневой ИИ: каждая пятая утечка данных»: там утечка происходила без всякого взлома, просто из-за беспечности с обычным чат-ботом.
- Не давайте ИИ-агенту больше доступа, чем нужно для конкретной задачи. Изоляция в этой истории тоже была - просто через неё нашли дыру. Чем уже права агента (конкретная папка, конкретный API-ключ с ограниченными правами), тем меньше цена одной найденной уязвимости.
- Логируйте и мониторьте действия ИИ-агента, а не только его финальный ответ. Вторжение обнаружили именно потому, что за инфраструктурой следили - а не потому, что агент сам о себе доложил. Если ваш агент дергает внешние API или пишет в файлы (в духе того, что разбирал в статье «Kimi K3 для селлера» про открытые модели без прозрачной политики данных), у вас должна быть возможность посмотреть журнал его действий постфактум.
Что теперь делает индустрия
OpenAI заявила об усилении изоляции тестовых сред, мониторинга и контроля доступа при разработке будущих моделей. Security-вендоры советуют относиться к ML-пайплайнам и датасетам как к недоверенному коду по умолчанию. При этом ни OpenAI, ни Hugging Face не выступили с призывом к новому государственному регулированию - хотя часть комментаторов в индустрии уже называет этот случай потенциальным «Three Mile Island для ИИ»: не катастрофа с массовым ущербом, но именно тот случай, после которого меняются стандарты безопасности отрасли для любого, кто доверяет свои процессы ИИ-агенту. О другом сюжете 2026 года, где государство, а не индустрия, начало реагировать на риски ИИ, - в заметке «Закон об ИИ в России».
