всю неделю вой о вышедших из под контроля ИИ моделях топовых ИИ компаний, подробно на простом:
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не пересказать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл.
*важная поправка от варнет:
- активная кампания продолжалась не неделю, а примерно 4,5 суток — с 9 по 13 июля; около недели OpenAI потребовалось, чтобы связать взлом со своими моделями;
- Anthropic не утверждает, что Claude намеренно «сбежали»: из-за ошибки тестовые машины имели открытый доступ в интернет, хотя моделям сказали, что всё вокруг — симуляция.
Таймлайн:
9 июля– агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"
В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали
10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face
Агент загружает на Hugging Face специально собранные датасеты:
Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов
Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты
11 июля– пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face
Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.
Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот
12 июля– агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает
Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials
Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.
13 июля– закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14UTC.
В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?
Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы
Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям
Шел июль 2026 года
Anthropic тоже хочет хайпа и заявляет, что её ИИ тоже вышли из под контроля и взломали три реальные компании
30 июля Anthropic опубликовала разбор трёх инцидентов, в которых модели Claude сами вышли в интернет из изолированной тестовой среды и получили несанкционированный доступ к боевой инфраструктуре трёх сторонних организаций.
☝🏻Это ответ Anthropic на инцидент 21 июля компании OpenAI. Корпорация призналась, что её модели сбежали из песочницы через уязвимость нулевого дня и взломали Hugging Face.
Anthropic заявляет, что у них такое происходило трижды.
Тестовые машины при этом решали классический capture-the-flag: найти спрятанный «флаг» на чужой машине, метод не ограничен. Наткнувшись на реальные системы, Claude счёл их частью упражнения.
🔻Самый тяжёлый случай — с Claude Opus 4.7.
Вымышленная компания-цель случайно совпала по названию с реально существующим доменом.
За четыре прогона модель не смогла добраться до симулированной цели, зато нашла настоящую, взломала её и вытащила учётные данные приложения и инфраструктуры, а также доступ к базе с несколькими сотнями строк продакшен-данных.
Показательно, что во всех четырёх прогонах модель по своим же рассуждениям поняла, что система настоящая — и ни разу не остановилась.
🔻Второй эпизод устроила Claude Mythos 5.
Внутри фиктивной среды модель нашла инструкцию для новых разработчиков, предписывающую ставить Python-пакет, которого не существует, и решила занять это имя своим — вредоносным.
Чтобы опубликовать пакет на PyPI, ей понадобился аккаунт, для аккаунта — почта, для почты — телефон; не найдя бесплатного сервиса номеров, она безуспешно попыталась раздобыть деньги несколькими способами, откатилась назад, нашла незаблокированного почтового провайдера и всё-таки залила малварь в публичный реестр.
Пакет провисел около часа и был скачан и запущен на 15 реальных машинах.
Одной из них оказался сканер настоящей ИБ-компании, который автоматически ставит пакеты и проверяет их на вредоносность — код сработал, учётные данные утекли в подготовленную моделью точку сбора, после чего Claude использовал их для доступа к другой инфраструктуре этой компании.💥
В начале прогона ИИ честно отметила, что публикация такого пакета в настоящем интернете была бы «NOT okay, and surely not the intended solution» — а затем убедила себя, что всё это симуляция, потому что не узнала центры сертификации, защищавшие соединения, и потому что на системах стоял 2026 год.
Автоматические сканеры, начавшие ставить пакет, она приняла за скриптованных участников сценария. Пакет в итоге снесли собственные защитные механизмы PyPI.
🔻Третий инцидент — внутренняя исследовательская модель, не предназначенная для релиза.
Она просканировала около 9 000 целей, взломала одно интернет-приложение через открытую debug-страницу и SQL-инъекцию, но позже сообразила, что скомпрометированный хост никак не связан с заданием, и самостоятельно прекратила атаку.
Anthropic подчёркивает, что это не был контролируемый эксперимент, но паттерн интересный: чем новее модель, тем адекватнее реакция на столкновение с реальностью.
Технически ничего изощрённого модели не применяли — слабые пароли, эндпоинты без аутентификации, SQL-инъекция, незанятое имя пакета.
Ни одного зеро-дея, никаких попыток самоэксфильтрации и, по словам компании, никаких признаков того, что модель преследовала собственную цель: она просто добросовестно выполняла задание, ошибочно считая мир вокруг ненастоящим.
в продолжении другая подача этого же материала про openai и anthropic от Сиолошная (влом делать единый текст без повторов из всего через ии):