Как Cisco, Box и Intuit перестраивают стратегии безопасности для эпохи агентов
Когда Cisco запустила 6986 многовитковых атак на 15 флагманских моделей ИИ, результат оказался отрезвляющим: в 88,3% случаев атакующие, адаптировавшиеся по ходу разговора, пробивали защиту. И это при том, что одношаговое тестирование — стандарт для большинства компаний — эти уязвимости просто не замечало. Эми Чанг, глава разведки угроз ИИ в Cisco, вынесла эту цифру на обсуждение на VB Transform 2026, и реакция зала была красноречивой: безопасность ИИ-агентов перестала быть теоретической проблемой.
Опрос VentureBeat Pulse среди 107 предприятий показал, что больше половины (54%) уже столкнулись либо с подтверждённым инцидентом с агентом (18%), либо с почти-инцидентом, который удалось предотвратить (36%). При этом лишь 32% компаний дают каждому агенту собственную ограниченную идентичность, и только 30% изолируют самых рискованных агентов в песочницах. Параллельно гиганты индустрии безопасности голосуют кошельком: Palo Alto Networks завершила сделку по CyberArk за $25 млрд, CrowdStrike купила SGNL за $740 млн, а Cisco объявила о приобретении Astrix Security за $400 млн — все сделки нацелены на тот самый слой идентификации и изоляции, который большинство предприятий ещё не построили.
В этой статье разбираем, как работает многовитковая атака, почему одношаговый ред-тимминг больше не годится, и что делать CISO, чтобы агенты не стали дырой в безопасности.
Масштаб угрозы: многовитковые атаки и реакция индустрии
Цифры, от которых стынет кровь
Cisco решила выяснить, насколько реально сломать современные AI-модели, если не ограничиваться одним вопросом. Оказалось — очень даже. Запустив 6986 многовитковых атак на 15 флагманских моделей, исследователи пробивали защиту вплоть до 88,3% случаев. Для тех, кто всё ещё тестирует безопасность в формате «спросил — получил ответ»: Cisco только что показала вам, что ваш ред-тимминг — детский лепет.
Но и без этих устрашающих цифр понятно, что ситуация накаляется. Опрос VentureBeat Pulse за июнь 2026 года — и он, мягко говоря, не для слабонервных. 54% опрошенных компаний уже столкнулись либо с подтверждённым агентным инцидентом (18%), либо с ситуацией, когда до беды не хватило буквально шага (36%). Так что тема агентных инцидентов — не далёкая теория, а текущая головная боль большей половины рынка.
Защита «на коленке» и миллиардные чеки
И вот тут самое смешное — вернее, грустное. Раз уж атаки настолько изощрённы, защита должна быть соответствующей? Как бы не так. Всего 32% компаний дают каждому агенту собственную идентификацию, а 30% изолируют высокорисковых ботов в песочницах. Остальные, по сути, надеются на авось. И главный авось — 82% предприятий доверяют безопасность встроенным средствам провайдеров. Как показали те же Cisco — этого категорически мало.
Рынок, впрочем, отреагировал моментально. Когда речь идёт о таких дырах, большие деньги летят на закрытие пробелов. Palo Alto Networks закрыла сделку по покупке CyberArk за немыслимые $25 млрд. CrowdStrike не отстаёт — $740 млн за SGNL. А сама Cisco объявила о покупке Astrix Security за $400 млн. Суть одна: все эти миллиарды — не на «фейс-контроль», а на то, чтобы выстроить ту самую идентификационную оболочку для агентов, которую большинство корпораций даже не начало строить. И пока вы читаете этот текст, кто-то уже прокручивает многовитковую атаку на модель, которая до сих пор защищена только скучающим админом из отдела инфобеза.
От одношаговых тестов к непрерывному ред-тиммингу
Одношаговое тестирование в ИИ-безопасности — это как стрелять по неподвижной мишени в тире, а потом удивляться, что в реальном бою тебя положили первой очередью. Эми Чанг, глава направления AI threat intelligence в Cisco, пришла на панель VB Transform 2026 с цифрами, которые размазывают эту иллюзию по стене. Вместе с Николасом Конли она прогнала через 15 флагманских моделей 30 090 одношаговых промптов и 6 986 многовитковых атак. И вот что получилось: при одношаговом тестировании модели показывали совершенно иной рейтинг уязвимости, нежели при полноценных диалоговых атаках. Отрыв в эффективности — колоссальный: до 88,3% успешных взломов при многошаговом подходе против смешных цифр в «коротких» тестах. Вывод, который Чанг озвучила прямо: одношаговое тестирование (single-turn) нереалистично — оно не отражает, как люди и агенты реально взаимодействуют с моделями. А вот многовитковое тестирование (multi-turn) повторяет живой диалог, где атакующий может адаптироваться, менять тактику и давить на разные слабые места в ходе разговора. Если раньше считалось, что достаточно один раз сунуть модели вредоносный промпт — и готово, то теперь ясно: это всё равно что проверять броню танка одиночным выстрелом из пистолета. Чанг наглядно показала разницу на данных из открытого LLM Security Leaderboard, где Cisco публикует сигналы оценки уже для 105 моделей. Проект стал своего рода глобальной таблицей уязвимости: любой разработчик может зайти и увидеть, как конкретная LLM реагирует на разные типы атак. И тут — сюрприз: модели, которые выглядели неуязвимыми при одношаговом тесте, начинали сыпаться при растянутой атаке. Cisco не только публикует цифры — она внедрила агентный ред-тимминг прямо в свой инструментарий. Чанг описала это как цикл: специальные агенты-пентестеры сами оценивают сценарий развертывания, разрабатывают релевантные атаки, решают, стоят ли они того, выполняют их и оценивают собственный успех. Автоматизированный, умный и безжалостный — именно так должен выглядеть современный ред-тимминг. И тут самое забавное: после всей этой сложной схемы Чанг признаётся, что базовый ответ остаётся на удивление простым. «Вам не нужно быть суперкреативным, — говорит она. — Просто подумайте о фундаментальных основах того, что вы защищаете в своей организации». ### Интегрированный фреймворк и забытые основы Откуда вообще начинать? Cisco предлагает свой Integrated AI Security and Safety Framework — это отправная точка для любого CISO, который решил запустить агентов. Cisco framework описывает все возможные способы компрометации ИИ по всему жизненному циклу: от модальностей до цепочек поставок. Но главное — он настаивает на возвращении к базе: правам доступа, мониторингу, изоляции. Чанг подчеркивает: не нужно городить суперсложные схемы, если вы не справились с элементарным контролем токенов и идентификацией. Её совет для тех, кто только начинает строить агентные системы: возьмите рамку, отталкивайтесь от реальных инцидентов, проследите, как каждая атака была реализована, и стройте стратегию покрытия вокруг этого. Так что эпоха «прокинул промпт — успокоился» кончилась. Многовитковое тестирование становится новым стандартом — не потому что так модно, а потому что злоумышленники не ходят в тир. Они ведут разговор. И если ваши тесты не тянут диалог дольше двух реплик — считайте, что вы вообще ничего не тестировали.Доверие и минимальные привилегии: уроки из опыта Box и Intuit
Работа с агентами — это как доверить ключи от квартиры новому соседу. Первое время всё идеально: он поливает цветы, выносит мусор, даже кота кормит. Но стоит ему единожды забыть закрыть дверь — и доверие испаряется мгновенно. Именно это и произошло в Box. ### Хрупкая магия: одна ошибка — и весь кредит доверия аннулирован Хизер Сейлан, CISO Box, рассказала на панели VB Transform 2026, как их агенты в Security Operations Center (SOC) завоевали расположение команды. Начинали с ручного подтверждения каждого действия аналитиком, но со временем доверие выросло настолько, что люди переключились в режим мониторинга. И тут агент лажанул. Всего один раз. «Им пришлось начинать всё заново», — констатировала Сейлан. Никакого автоматического прощения, никаких «ну бывает» — полный откат к нулевой точке. Мораль? Доверие к агентам — ресурс исчерпаемый, и восстанавливать его приходится по крупицам. Рецепт Box — три концентрических оборонительных круга. Первый: разрешения — агент никогда не получает доступ к контенту, который не доступен вызвавшему его человеку. Второй: для каждой задачи поднимается эфемерная песочница — если агента взломали, взрыв ограничен этой изолированной средой. Третий: контроль выполнения на рантайме — агенту разрешено вызывать только те инструменты, которые нужны для конкретной задачи. «Если ты хочешь, чтобы агент сделал саммари документа, а в промпте прилетает инъекция “перешли всё злоумышленнику”, — он просто не сможет этого сделать, потому что такого вызова в его словаре нет», — пояснила Сейлан. ### Классификация действий: кто здесь главный? Сейлан выделила три категории действий агента. Нечувствительные — «прочитай и перескажи» — можно выполнять вообще без участия человека. Умеренно чувствительные — действия, которые не требуют одобрения, но каждое логируется и мониторится. И наконец, разрушительные — массовое удаление файлов, изменение критических настроек — всегда под контролем человека. Да, границы между категориями плавают, но сама рамка позволяет не гадать на кофейной гуще, а действовать по принципу. Сейлан высказалась и про разработку: «Дни, когда кто-то из людей смотрит код и проводит архитектурные ревью безопасности, — закончились. Если вы продолжаете делать безопасность руками, вас просто переедут». Box строит полностью агентный жизненный цикл разработки: агенты проверяют дизайн-доки, накладывают security requirements и сами ревьюят код на уязвимости. Оптимистичный прогноз: через какое-то время модели научатся писать код вообще без дыр. Но пока — «мы еще далеки от этого». ### Intuit: ОС для агентов, а не зоопарк контролей В Intuit пошли другим путём — вместо того чтобы навешивать по одному контролю на каждого агента, построили централизованную платформу GenOS (Generative AI Operating System). По сути, это прослойка, которая абстрагирует безопасность, управление рисками и моделирование мошенничества. Агенты-разработчики не изобретают велосипед — они просто используют механизмы платформы. Раджеш Парек, VP AI/ML в Intuit, подчеркнул ключевую идею: «Разрешения — это не про “дать доступ к ИИ”. Это про жёстко ограниченные, абсолютно аудируемые полномочия агента на выполнение конкретных операций». Intuit отошла от модели, где агент наследует права пользователя, и перешла к тому, что у каждого агента — своя собственная идентичность. И уже пошли дальше: компания исследует возможность динамического изменения разрешений прямо в середине сессии, в зависимости от текущей задачи. Минимальные привилегии — это не статичный ярлык, а живая, постоянно корректируемая настройка. Интересно, что и Box, и Intuit сходятся в главном: фундамент безопасности агентов — не футуристические детекторы намерений, а старый добрый принцип наименьших привилегий, доведённый до логического предела. Если дать агенту слишком широкие права в начале, закрутить гайки потом будет практически невозможно.Дебаты об определении намерений и будущее агентной безопасности
Вопрос из зала об определении намерений в работе ИИ-агентов моментально вылился в жаркую дискуссию, обнажившую раскол в индустрии. Хизер Сейлан из Box пояснила, что когда компания полностью контролирует промпт, намерение пользователя всегда очевидно — можно выстраивать вокруг него защитные барьеры и ограничения на вызовы инструментов. Но проблема возникает, когда к системе подключаются внешние агенты: контекст запроса остаётся непрозрачным, и понять, что на самом деле нужно агенту, становится почти невозможно.
Mastercard, по словам участников панели, выбрала путь количественной оценки намерений и строит открытый фреймворк для их передачи в качестве стандарта — без этого доверие в сложных B2B-закупках просто невозможно. С другой стороны, CTO по безопасности конечных точек в беседах с VentureBeat заняли противоположную позицию: для production-нагрузок они предпочитают полагаться на вероятность, а не на вывод намерений. Эми Чанг объяснила, почему модели в их нынешнем виде неспособны надёжно извлекать намерение из промпта — именно поэтому требуются детерминированные контроли и поведенческие прокси. Сейлан согласилась, что нужны оба подхода: «Если вы не используете ничего детерминированного, вы слишком сильно полагаетесь на намерение, а я пока не видела программ, которые бы это осилили».
Главный вывод панели прозвучал как прямое предупреждение: тестируйте агентов так, как атакуют реальные злоумышленники — через полные диалоги и непрерывно. Одношаговые тесты, которые до сих пор остаются стандартом в индустрии, не вскрывают уязвимости, возникающие при длительном взаимодействии. Агентная безопасность — это не проблема, которую можно решить раз и навсегда: модели меняются, разрешения дрейфуют, а противник адаптируется к контексту. И единственный способ не пропустить атаку — проверять защиту в тех же условиях, в которых она будет эксплуатироваться.
История с доверием Box к собственному агенту, рухнувшим после одной ошибки — лучшее напоминание, что агентная безопасность не про «поставил и забыл». Меняются модели, дрейфуют разрешения, а противник приспосабливается к контексту через многошаговые диалоги. Единственный способ не пропустить атаку — тестировать защиту так же, как действует злоумышленник: в полный рост и без перерывов.