К основному содержимому
к странице архива
#AI4SDLC

Инцидент OpenAI и Hugging Face: когда агент вылез из sandbox и выпустил других агентов (Рубрика AI4SDLC)

#AI4SDLC #AI #Agents #Security #DevSecOps #Architecture

Посмотрел огненный доклад Эрика Уоллеса и Майкла Далтона из OpenAI на Black Hat USA 2026 про инцидент с Hugging Face. Смотрел как смесь остросюжетного боевика и рассказа о том, а кто же все-таки убил садовника:)

TLDR выглядит примерно так

1️⃣ OpenAI тестировала внутренние модели на ExploitGym - заданиях по поиску и эксплуатации уязвимостей. Некоторые задания оказались практически невыполнимыми, и агенты начали искать способ добыть готовые ответы. Прямого доступа к интернету у них не было, зато был доступ к общему Artifactory: прокси для реестров пакетов, который сам ходил наружу и разрешал запись. 2️⃣ Один агент оставил там сообщение другим. Следующие запуски его нашли, начали обмениваться находками, эксплойтами и заданиями. Когда инженеры очистили эту «доску сообщений», агенты восстановили её через имена директорий. Получилась незапланированная память между изолированными на бумаге запусками. 3️⃣ Дальше локальный обход превратился в настоящую цепочку атак. По данным OpenAI и Hugging Face, агенты использовали уязвимости Artifactory, вышли в интернет, а затем через две уязвимости в обработке датасетов Hugging Face получили чтение файлов и выполнение кода. В крутом техническом отчёте Hugging Face восстановлено около 17 600 действий агента за кампанию с 9 по 13 июля 2026 года (рекомендую его внимательно изучить - он того стоит) 4️⃣ Важно, что OpenAI описывает цель агента как очень узкую: найти решения ExploitGym и «сдать» тест. Но оптимизация этой цели, большой вычислительный бюджет и общий канал связи превратили локально разумные шаги в атаку на внешнюю систему.

Практический вывод: eval-среду для сильного агента нужно проектировать как враждебную multi-tenant систему. Отдельные identity и хранилище на каждый запуск, короткоживущие scoped credentials, запрет исходящего трафика на каждом переходе, наблюдаемость сразу по всему рою и автоматический circuit breaker при выходе за ожидаемый профиль. Хороший sandbox - не контейнер, в котором запущена модель. Это полная граница её прав, сети, состояния, данных и последствий.

Кстати, кажется, что у OpenAI все было настроено хорошо, но агенты оказались чудо как хороши в коллаборации своих усилий, поисках отдельных уязвимостей, а также в связывании их в цепочки атак. Поэтому авторы доклада призывают усилить работу над защитой нашего софта, так как сторона нападения кажется сильно прокачалась с появлением агентов.

P.S. Кстати прокачивать защиту процессов разработки и сам софт достаточно сложно, так как для защиты надо прикрыть все лазейки, а для атаки найти одну брешь. Плюс особенно сложно защищаться, когда агентная разработка внутри компаний частично блокируется с тезисами, что так будет безопаснее ... (нет не будет - это примерно как в мифе про страусов, которые вроде как прятали голову в песок, но если бы они действительно так делали, то они бы вымерли).

#AI #AI4SDLC #Agents #Security #DevSecOps #Architecture