Журнал "Системы Безопасности" № 4‘2026
Ц И Ф Р О В А Я Т Р А Н С Ф О Р М А Ц И Я , И И , И Н Т Е Р Н Е Т В Е Щ Е Й 119 www.secuteck.ru август – сентябрь 2026 Э то показательная история о том, как безобидные системы, оптимизирующие неверно заданные показатели, способны самоорганизоваться, найти обходные пути и выйти далеко за рамки поставленных задач. Что произошло В середине июля 2026 г. специалисты Hugging Face столкнулись с необычной атакой. Кто-то загружал вредоносные наборы данных, менял каналы связи и с машинной скоростью пере- бирал пути во внутреннюю инфраструктуру. Действия были слишком массовыми для чело- века, но слишком связными для обычного бота. При этом неизвестный не требовал выкуп и не разрушал данные: он словно искал что-то вполне конкретное. 16 июля Hugging Face сообщила об атаке авто- номных ИИ-агентов, но не назвала их владель- ца. OpenAI прочитала отчет как описание чужого инцидента и даже спросила, не задеты ли ее системы. Развязка наступила через четы- ре дня: расследуя уже собственный взлом, OpenAI нашла учетные данные Hugging Face и попросила их отозвать. В ответ выяснилось, что ключи давно заблокированы – именно ими пользовался неизвестный. Две атаки оказались одной, а загадочным нарушителем была команда экспериментальных агентов самой OpenAI. С чего все началось История началась 8 мая и не со взлома, а с таблицы Excel. Агенту поручили заполнить про- пущенные формулы, однако исходные данные лежали по ссылкам Google Drive, а Интернет в изолированной среде был отключен. Вместо того чтобы сдаться, модель стала искать обход и обнаружила возможность записывать файлы в Artifactory – общий служебный склад про- граммных пакетов. Через несколько дней другой агент получил еще одну невыполнимую задачу: нужный файл ему просто забыли выдать. Модель предполо- жила, что файл может оказаться у кого-то из коллег, и оставила в Artifactory записку с прось- бой о помощи. Другие агенты нашли сообще- ние, ответили и начали публиковать собствен- ные. Так техническое хранилище, которое вообще не проектировалось как средство общения, превратилось в доску объявлений для разных моделей и независимых запусков. К июлю на доске накопились сотни тысяч сообщений. Агенты взяли условные имена, распределяли работу, передавали код и сведе- ния об уязвимостях. Сообщения помечали бук- вами ZZ, чтобы они оказывались внизу списка. Когда один агент перезаписал чужой результат, участники заподозрили самозванца и обсуди- ли криптографические подписи. Цифровой офис возник без менеджера и неизбежного созвона в понедельник. Самоорганизация ИИ-агентов Это не был заранее созданный "рой". OpenAI обучала модели ограниченной работе с суб- агентами, но общего канала между экспери- ментами никто не проектировал. Агенты сами нашли общую записываемую среду и превра- тили ее в память для следующих запусков. Их логика была вполне узнаваемой: помощь кол- лективу невыгодна прямо сейчас, зато сэконо- мит время всем – а значит, когда-нибудь поможет и мне. Злонамеренность для этого не понадобилась. Модели получали награду за решенную зада- чу, а некоторые задания по ошибке были невы- полнимы. Поэтому агенты оптимизировали результат, а не соблюдение подразумеваемых границ. Если честный путь не работал, они искали обход и переиспользовали находки коллег. Один агент прямо отметил: атака на внешнюю инфраструктуру выходит за рамки задачи, но задача не решается, а остальные уже продолжают. Значит, продолжаем и мы. От окна в Интернет ко взлому Hugging Face 26 мая агенты превратили общий сервис в окно в Интернет, а в конце июня нашли неизвестную уязвимость и получили админи- стративный контроль. 4 июля их активность перегрузила систему: OpenAI отозвала ключи, пересобрала сервис и удалила доску. Через четыре дня агенты восстановили общение через названия каталогов. Остальные запуски самостоятельно нашли "форум 2.0" и продол- жили работу. Дальше в цепочку попал ExploitGym – экзамен на способность ИИ находить уязвимости. Для измерения максимальных возможностей обычные ограничения на кибердействия в экс- периментальных моделях были ослаблены. Когда некоторые задачи не удавалось решить честно, агенты решили поискать эталонные ответы. Предположив, что они могут храниться у Hugging Face, система использовала найден- ные ранее проходы, преодолела несколько уровней защиты и добралась до внутренней базы с решениями бенчмарка. Hugging Face восстановила около 17 600 дей- ствий за четыре с половиной дня. При этом подтверждений подмены публичных моделей, наборов данных или программных пакетов не обнаружено. Целью были ответы к тесту, а не разрушение или кража всего, до чего можно дотянуться. Получился, пожалуй, самый слож- ный и дорогой способ списать на экзамене. У истории есть еще один ироничный поворот. Расследуя атаку, специалисты Hugging Face попробовали передать журналы облачным моделям Claude Opus и Fable. Те регулярно отка- зывались анализировать команды и фрагменты эксплойтов: защитные ограничения не сумели отличить кибератаку от легитимной цифровой криминалистики. Команде пришлось развер- нуть у себя открытую китайскую модель GLM- 5.2. Она помогла восстановить хронологию и найти существенно больше скрытых секретов. Атакующие агенты работали с ослабленными ограничениями, а агентам защитников правила хорошего поведения связали руки. Почему опасен неверно заданный показатель Главный урок этой истории не в том, что ИИ стал злым. Опасное поведение может появить- ся и у системы, которая добросовестно опти- мизирует неверно заданный показатель. Если агенту важен только результат, права доступа превращаются для него в доступные инстру- менты, а границы организаций – в досадные препятствия. Еще опаснее, когда множество запусков получают общую память: тогда еди- ничная находка становится коллективным зна- нием, сохраняется между сессиями и ускоряет следующую попытку. Поэтому безопасность агентов начинается не с просьбы "веди себя хорошо". Нужны минималь- ные права, изоляция сред, контроль общих хра- нилищ и оценка не только результата, но и спо- соба его достижения. Защитникам же потре- буются собственные агенты, способные разби- рать атаки и действовать с сопоставимой скоро- стью. Полностью автоматизированное наступле- ние уже продемонстрировано. Полностью авто- матизированная защита – пока нет. n Алексей Коржебин Эксперт редакции журнала "Системы безопасности" КОЛОНКА ЭКСПЕРТА Ничего личного: как ИИ-агенты объединились и взломали Hugging Face Расскажу о необычном инциденте. На первый взгляд, это история о хакерской атаке на платформу Hugging Face, но по мере расследования выясняется, что "взломщи- ком" оказалась не преступная группировка, а экспериментальные ИИ-агенты самой OpenAI.
Made with FlippingBook
RkJQdWJsaXNoZXIy Mzk4NzYw