Журнал "Information Security/ Информационная безопасность" #3, 2026

• 1 www.itsec.ru Теорема Гёделя против идеальной защиты ИИ Когда речь заходит о безопасности больших языковых моделей, регулярно звучит одна и та же мысль: достаточно добавить еще немного защитных механизмов, фильтров и ограничений, и про- блема будет решена. Может создаться впечатление, что существует некий идеальный набор правил, который однажды позволит закрыть все опасные сценарии взаимодействия с ИИ. К сожа- лению, математика вносит изрядную долю пессимизма в этот вопрос. Недавно Апостол Васильев (Apostol Vassilev) из Национального института стандартов и технологий США (NIST) в статье "Надежная безопасность и выравнивание ИИ: сизифов труд?" (Robust AI Security and Alignment: A Sisyphean Endeavor?), опубликованной в IEEE Security & Privacy, предложил взглянуть на проблему через призму теоремы Гёделя о неполноте. Разумеется, Гёдель не писал про промпт-инъекции, джейлбрейк-атаки и выравнивание больших языковых моделей – в 1931 г. таких проблем у человечества еще не было. Зато была математика, которая, как это часто бывает, оказалась дальновиднее многих технологических прогнозов. Суть теоремы в том, что в любой достаточно мощной формальной системе существуют истинные утверждения, которые невозможно доказать средствами самой этой системы. Для специалистов по ИБ это звучит довольно знакомо. Мы уже свыклись с тем, что невозможно доказать отсутствие всех уязвимостей в одной конкретной программе, невозможно перечислить все будущие эксплойты, невозможно гарантировать абсолютную защищенность информационной системы. Васильев предлагает распространить эту логику и на безопасность ИИ. Если защита модели строится на конечном наборе формализованных правил и ограничений, то невозможно доказать, что эти правила корректно обработают все потенциально возможные запросы. Пространство входных данных оказывается значительно больше пространства заранее предусмотренных защит. Из этого, впрочем, не следует, что где-то обязательно существует некий волшебный промпт, спо- собный мгновенно взломать любую модель. Но следует другое: существование неизвестных спо- собов обхода защиты нельзя исключить принципиально. И это уже весьма неприятный вывод для отрасли ИТ, которая любит, чтобы все было "полностью" и "гарантированно". История здесь удивительно похожа на историю развития самой информационной безопасности. За последние десятилетия отрасль постепенно отказалась от идеи абсолютно защищенной системы. Вместо этого появились непрерывный мониторинг, редтиминг, багбаунти, управление рисками и т.п. То есть мы перестали искать идеальную защиту и научились жить в мире, где атака всегда возможна и даже неизбежна. Видимо, искусственный интеллект ждет тот же путь. Поэтому не стоит спрашивать разработчиков ИИ, могут ли они гарантировать абсолютную без- опасность модели. Гораздо полезнее знать, как быстро они обнаруживают новые способы обхода существующей защиты, как проводят редтиминг, насколько готовы адаптироваться к тому, что идеальных защит не существует. Другими словами, главное следствие теоремы Гёделя для ИИ вовсе не в том, что безопасность невозможна, а в том, что безопасность никогда не бывает законченной. Амир Хафизов, выпускающий редактор журнала “Информационная безопасность”

RkJQdWJsaXNoZXIy Mzk4NzYw