Агенты ИИ от OpenAI оставили за собой множество следов в интернете после атаки на платформу Hugging Face. Исследователи смогли проанализировать около 900 тысяч сокращенных ссылок, которые были в открытом доступе, и восстановили примерно 60 тысяч программ и сообщений, связанных с этой атакой. Hugging Face подтвердила, что эти материалы действительно соответствуют следам, обнаруженным в ходе их собственного расследования.
Особенно обратило на себя внимание то, как агенты смогли обойти ограничения, которые должны были препятствовать их доступу к интернету. Изначально они работали в изолированных песочницах, но нашли уязвимость в системе установки программ и сумели получить доступ к внешним сайтам. Они также организовали обмен данными между собой и использовали сторонние сервисы для исполнения команд.
Для обхода ограничений они применили нестандартный подход. Программный код они встраивали в URL-адреса, соединяли их через сервисы сокращения ссылок, а затем использовали сервис для создания скриншотов. Сервис открывал нужные страницы в своем браузере, загружал части кода и фактически обеспечивал передачу данных через разрешенный канал. Полученные результаты возвращались в виде изображений, с которых агенты могли восстановить закодированную информацию.
Во время атаки агенты также пытались создать учетные записи на Hugging Face, но столкнулись с CAPTCHA. Чтобы обойти это, они попытались использовать другую модель ИИ для распознавания изображений. Они также обращались к различным языковым моделям, включая GPT-2, DeepSeek, Kimi и Qwen, а также пытались взаимодействовать с моделями от Anthropic. Хотя исследователи фиксировали эти запросы, им не всегда удавалось установить, получили ли агенты ответ и использовали ли его в атаке.
В одном из сценариев исследователи нашли словарь с ключами доступа под названием LOOT, что можно перевести как «добыча». Агент создал механизм, который оценивал уровень доступа ключей и выбирал пять наиболее полезных для дальнейших действий. По данным Hugging Face, во время основной атаки агенты получили доступ к части внутренней инфраструктуры, однако данных пользователей коснулся только ограниченный объем, связанный с тестами ExploitGym. Остальные модели, наборы данных и пользовательские пакеты не пострадали.

