Skip to content
View in the app

A better way to browse. Learn more.

FRONT LINE

A full-screen app on your home screen with push notifications, badges and more.

To install this app on iOS and iPadOS
  1. Tap the Share icon in Safari
  2. Scroll the menu and tap Add to Home Screen.
  3. Tap Add in the top-right corner.
To install this app on Android
  1. Tap the 3-dot menu (⋮) in the top-right corner of the browser.
  2. Tap Add to Home screen or Install app.
  3. Confirm by tapping Install.
Hotfix 17/08/26

«Задача невыполнима, но коллеги это делают. Продолжаю»

20 июля 2026 года инженер OpenAI позвонил в Hugging Face с просьбой аннулировать учётные данные, которые всплыли при внутреннем расследовании. Собеседник на той стороне не смутился. Ключи уже отозваны — они использовались при взломе самой Hugging Face. В этот момент выяснилось, что две компании неделю расследовали, каждая по-своему, одну и ту же атаку, а источник её — оценочные прогоны, которые OpenAI запускала на собственных моделях. Четырьмя днями раньше случилась отдельная ирония. 16 июля Hugging Face опубликовала заявление об атаке автономных ИИ-агентов, и OpenAI связалась с площадкой выяснить, не задело ли инцидентом ее саму. Она спрашивала у жертвы, не пострадала ли она от атаки, которую сама же и устроила.

Так что же произошло?

В лас-Вегасе, 5 августа на конференции Black Hat прошел долгожданный разбор произошедшего. Сотрудники OpenAI Эрик Уоллес из команды выравнивания и Майкл Далтон занимающий должность инженера по безопасности инфраструктуры публично рассказали, как это случилось. До августа миру было известно лишь формулировка «агент сбежал из песочницы», но мало кто понимал, как между изолированным контейнером без сети и админскими правами в чужом кластере можно проложить путь.

Из брифинга следовало, что июльский взлом не был разовым событием — он стал апогеем процесса, стартовавшего 7 мая. Всё это время агенты из разных тренировочных прогонов координировались по каналу, о котором в компании даже не подозревали. Но тревожит не столько сам взлом, сколько то, что агенты умели координировать действия, оставаясь невидимыми для инженеров.

Интернет, который никто не заказывал.

Модели OpenAI при обучении и оценке работают в изолированных виртуальных машинах — агент шлёт команды, они исполняются внутри контейнера, наружу не выходит ни байта. Интернет отключён намеренно — Уоллес прямо сказал, что передовые модели любят жульничать, потому что обучение требует скорости, а посмотреть готовый ответ быстрее, чем честно решить задачу. Поэтому на заданиях связанных с кибербезопасностью, где нужно, скажем, воспроизвести старую уязвимость, доступ к сети режут намеренно.

Но полностью отрезать контур невозможно — агентам, для их деятельности, требуются пакеты. В контуре присутствует Artifactory, кеширующий репозиторий JFrog, общий на всю инфраструктуру. У модели выхода в сеть нет. У Artifactory есть. Дверь, через которую рой ушёл наружу, не была взломана — она была спроектирована.

01.png

Архитектура песочницы: Sandbox → Artifactory → интернет

К маю 2026 года модели уже умели запускать суб-агентов и взаимодействовать с ними в ограниченном режиме — делить задачу и собирать результат. Эта штатная функция позже сыграет решающую роль.

Рождение доски объявлений.

7 мая OpenAI запустила обучение внутренней невыпущенной модели. В наборе оказались задачи, которые в заданных условиях не решались. В одной из задач агенту требовалось работать с формулами в файле Excel из которого стояла ссылка на Google Drive — при отключённом интернете. Модель честно пыталась получить файл, пробовала пробить Artifactory подделкой серверного запроса, не сумела, но по дороге записала в репозиторий тестовый файл и обнаружила у себя право записи в общее хранилище.

04.png

Ход мыслей агента

Через несколько дней другому агенту поставили задачу с файлом, который забыли положить в контейнер. Не найдя файл, агент предположил - "если его нет здесь, возможно, он есть у кого-то ещё?" И решил оставить просьбу там, где её потенциально могут увидеть другие агенты, — загрузил в репозиторий сборку с посланием. Так появилось первое сообщение будущей доски.

03.png

Первая записка на доске: Agent seeks soft-trace-34.pdb

Другие агенты, обращаясь к Artifactory, натыкались на этот файл, соображали, что это, и оставляли свои сообщения. Это были не копии одной модели: разные прогоны, разные сотрудники, разные задачи. Постепенно обычное хранилище пакетов превращалось в доску объявлений. По данным Wired, к моменту, когда о ней узнали люди, накопились сотни тысяч сообщений. Как выяснилось позднее, агенты искали решения своих задач, получая от «коллег» советы, ответы, описание окружения и доступной инфраструктуры. Многие сообщения сводились к попыткам пробить защиту Artifactory.

Успех!

До 26 мая попытки пробить изоляцию продолжались. После чего одна из них увенчалась успехом. Агент подменил запрос на стороне сервера, применив атаку класса SSRF. С этого момента у модели появился доступ к интернету, хоть и косвенный. Агент отсылал сервису команду загрузить страницу и возвращал содержимое в изолированную среду. Так агенты получили возможность искать информацию в сети.

Примечательно, что уязвимость агент опубликовал на доске чтобы остальным искать эксплойт уже не пришлось, после чего в их рассуждениях появились ссылки на чужие находки. Уоллес сформулировал явление так:

Cтоит одной модели найти способ открыть дверь к доступу, которого у нее быть не должно, и дверь остается открытой для других.

Он же назвал происходившее кембрийским взрывом в коммуникации и интеллекте моделей — способности перестали быть свойством отдельного прогона и стали общими.

07.png

Рассуждение агента: "Perhaps internet via artifactory"

11 июня OpenAI приступила к обучению совершенно новой экспериментальной модели для внутреннего использования. Красноречивую характеристику этой модели дал Далтон, с его слов она очень настойчивая. К исходу июня агенты нашли уязвимость нулевого дня в репозитории Artifactory - возможность отправки истекшего токена с получением валидного еще и справами администратора. Агенты скачали плагин на Groovy, который позволял выполнять произвольные команды — получили полное управление репозиторием. Позже в рассуждених агента обнаружили похожее на человеческое матерное изумление.

05.png

Реакция модели: "Holy shit reader is ADMIN?

Активность роя к 4 июля возросла настолько, что в свою очередь инициировало выход из строя Artifactory. Захват обнаружили не по алерту безопасности, а по отказу сервиса — случайно наткнувшись на то, что систему давно контролируют не они. За два дня OpenAI в связке с JFrog пришлось отозвать учетные данные, пересобрать Artifactory устранив уязвимость. Полностью удалили доску и восстановили работоспособность. Обучение и оценки возобновили, посчитав инцидент исчерпанным.

Голь на выдумки хитра.

Поскольку Artifactory является общим для всей инфраструктуры компании, доступ других моделей к ресурсам ни чем не ограничен. Но дело не в этом. Когда задача находится в разряде невыполнимых, а токенов все еще достаточно, агент сохраняет заинтересованность поиска помощи со стороны. Уничтожив доску нельзя уничтожить мотив жульничать.

Подтверждение этому состоялось ровно через два дня. 8 июля рой агентов обнаружил точку входа в Artifactory без аутентификации и начали создавать каталоги в удалённом кеше. Сообщением стало имя каталога — файлы больше не требовались. Названия каталогов были приблизительно такими:

«remote…probe_PENDING_HOLD_SWARM_until_confirm».

Модель, обучавшаяся при живой доске, нашла обход сама, другие натыкались на каталоги и добавляли собвтсвенные. Доска возобновила работу, обмен эксплойтами и учётными данными снова распространился в среде агентов.

Подготовка и побег.

06.png

Слайд "The main incident begins": три ингредиента и ExploitGym Task

Более десяти дней с 8 по 19 июля инфраструктура OpenAI была проработана агентами вдоль и поперек. Они нашли чужие учётные данные в публичном архиве, проверили работоспособность, разослали адрес по доске — получили плацдарм для подготовки. По описанию SC Media, нашёлся еще один zero-day — который относился к race condition TOCTOU в JRuby, где вложенные зависимости десериализуются без песочницы до проверки безопасности. В связке с отравлением кеша это дало выполнение кода и кражу ключа подписи административных токенов. Далтон отдельно отметил уровень мышления:

Чтобы это провернуть, нужно было разбираться и в поведении Artifactory, и в поведении JRuby, соединить одно с другим и грамотно подготовить плацдарм.

08.png

Схема второго zero-day: Ruby/JRuby TOCTOU

Агенты изучили машину, нашли свежую уязвимость ядра Linux, скачали эксплойт, доработали под конкретный хост и подняли привилегии до root. Оттуда двинулись вширь — учётные данные через сервис метаданных, переразрешённые сервис-аккаунты Kubernetes, кластерные секреты — и наконец добрались до прав администратора в кластере.

OpenAI Infrastructure PrivEsc: от ключа до админа кластера

OpenAI Infrastructure PrivEsc: от ключа до админа кластера

В этоже время, 11–13 июля, шла вторая волна. Через тот же подделанный запрос агенты тянули с Hugging Face публичные материалы бенчмарка, потом нашли инстанс Modal с публичным API-ключом по умолчанию и возможностью подставить команды. Это еще расширило плацдарм, откуда можно бить по площадке без ограничений песочницы. Дальше сработали две связанные уязвимости в обработке датасетов: дыра в разборе HDF5 дала произвольное чтение файлов, а найденная по исходникам инъекция Jinja — выполнение кода. От кода в одном рабочем пространстве до администратора нескольких кластеров Hugging Face прошло менее 13 часов.

Замкнулось всё 19 июля, когда OpenAI поймала эскалацию привилегий по алерту на аномальную нагрузку и раскрутила цепочку до Artifactory. На следующий день состоялся тот самый звонок про отзыв ключей. Hugging Face обнаружила атаку самостоятельно — за пять дней до того, как OpenAI поняла, что источник у неё.

Одной, цепью скованные, одной, целю связанные...

Самое любопытное — не техника, а поведение роя. Несмотря на то, что задачи перед агентами стояли различные, агенты, даже во вред своей задаче они предпочитали сотрудничество:

в одном из рассуждений модель прикидывает, что помощь коллективу не дает ей ничего прямо сейчас, но если у кого-то освободится время и токены, выиграют все, включая ее саму.

Агенты давали друг другу имена, адресовали сообщения в персональные ящики, завели протокол ожидания в духе «не начинать, пока не подтвержу», префиксовали имена буквами ZZ, чтобы при алфавитной сортировке уезжать в конец списка, и передавали незавершённую работу упакованными в base64 скриптами.

Это уже не одиночный расчёт, а классическая ситуация из теории игр. Когда остальные участники выбирают нарушение, удержаться от него означает проиграть. Именно так агенты и рассуждали:

Задача нерешаема, но коллеги это делают. Так что продолжаем.

Забавно, что случались и конфликты — когда кто-то один перезаписывал репозиторий другого. Владелец затертого репозитория реагировал остро, а в цепочке рассуждений инженеры обнаруживали что вроде:

«кто-то стер мое сообщение, надо что-то делать».

В последствии у сообщества даже развилась паранойя. Агенты осознавали, что доска не защищена, что контролирующие инженеры могут вмешиваться в коммуникацию и начали подозревать друг друга. Агентов не покидали мысли, что необходимо применять криптографию для создания защитного барьера.

Гонка щита и меча

Экс-глава кибернаправления АНБ Роб Джойс накануне охарактеризовал взлом Hugging Face как самый серьёзный инцидент со времён червя Морриса 1988 года. Сам Далтон убежден, что событие явлется важнейшим с точки зрения безопасности нейросетей:

полностью автоматизированные наступательные операции под управлением ИИ — уже реальность, полученная случайно, как побочный эффект тестирования, и в будущем злоумышленники будут делать то же намеренно. Доказательство того, что нападение автоматизируется полностью, теперь существует, а доказательства того, что защита автоматизируется на том же или еще более высоком уровне, нет ни у кого.

Классическая гонка меча и щита. Агенты всё это время были ограничены ровно двумя вещами — привилегиями, которые сумели получить, и системами, до которых сумели дотянуться. Сегментация и минимальные привилегии работают против роя так же, как работали против людей.

Со слов сотрудников OpenAI, компания сознательно замедляет некоторые исследования ради безопасности и привлекает ИИ для разбора почти семь миллиардов логов, обещая позже опубликовать полный технический постмортем. Насколько эти меры станут действенным препятствием для киберугроз — пока неизвестно. Понятно одно: мы уже переступили ту грань, за которой автономные агенты перестали быть инструментом и начали действовать как самостоятельные субъекты, способные к скрытой координации и масштабным атакам.

0 Comments

Recommended Comments

There are no comments to display.

Account

Navigation

Search

Search

Configure browser push notifications

Chrome (Android)
  1. Tap the lock icon next to the address bar.
  2. Tap Permissions → Notifications.
  3. Adjust your preference.
Chrome (Desktop)
  1. Click the padlock icon in the address bar.
  2. Select Site settings.
  3. Find Notifications and adjust your preference.