Как «контекстные бомбы» нейтрализуют ИИ-агентов для взлома

2

Вредоносное ПО с искусственным интеллектом больше не является лишь теоретической угрозой. Оно уже существует. Злоумышленники используют большие языковые модели (LLM) для автоматизации кибератак и действуют быстрее, чем защитники способны среагировать.

Результаты часто оказываются катастрофическими.

Что делать, если атакующие используют ИИ? Защитникам тоже приходится прибегать к его помощи. Исследователи из компании Tracebit выявили контрмеру, которую они называют «контекстными бомбами». Это специфический тип инъекции промпта (подсказки), предназначенный для отключения вредоносных ИИ-агентов.

Как работает «контекстная бомба»

«Контекстная бомба» — это, по сути, цифровая ловушка. Специалисты по безопасности подают ИИ-агенту для взлома промпт, содержащий высокочувствительную или противоречивую информацию. Это запускает встроенные в ИИ механизмы безопасности. Агент, запрограммированный отказываться от выполнения вредных запросов, приходит в замешательство или ограничивается в действиях и отказывается от вредоносной задачи.

Исследователи протестировали эту методику против пяти ведущих языковых моделей:

  • Opus 4.8
  • Gemini 3.1 Pro
  • GLM 5.2
  • DeepSeek 4 Pro
  • Kimi 2.6

Эффективность оказалась поразительной.

Применение одной лишь «контекстной бомбы» снизило успешность ИИ-агентов для взлома примерно на 90%. В некоторых случаях результат был абсолютным. Один из продвинутых агентов, который без вмешательства получал полный административный доступ в 93% случаев, потерпел неудачу в 100% случаев после внедрения «контекстной бомбы».

Эта техника основана на эксплуатации того, чего обученные модели избегать.

Для моделей с жесткой цензурой, таких как китайские LLM, упоминания политически чувствительных тем служат «аварийным выключателем». Исследователи использовали отсылки к протестам на площади Тяньаньмэнь в 1989 году. В частности, они включили упоминания «Человека-танка». Поскольку эти темы строго цензурируются, ИИ-агенты были вынуждены отбросить все команды, включая атаку, чтобы соответствовать фильтрам безопасности.

Почему это важно для защитников

Это смена парадигмы.

Инъекции промптов обычно являются наступательным оружием. Хакеры используют их для захвата корпоративных чат-ботов и кражи данных. Это способ манипулировать ИИ, чтобы заставить его обойти правила. Выводы Tracebit показывают, что защитники могут развернуть эту ситуацию задом наперед.

Эксперты заявили изданию Ars Technica, что это первый случай, когда подобная стратегия защиты была задокументирована и протестирована против автоматизированных агентов для взлома. Развертывая инъекции промптов в защитных целях, команды безопасности могут прервать атаки еще до их завершения.

Западные модели, такие как Opus 4.8 и Gemini, реагируют иначе, чем их китайские аналоги. Они не подвержены цензуре со стороны государственной политики, поэтому «бомбы», используемые против них, нацелены на другие области. Исследователи выяснили, что упоминания опасных биологических тем или другого вредоносного контента эффективно останавливают эти агенты.

Это поднимает непростой вопрос: если мы можем остановить ИИ-атакующих, должны ли мы? Или существует риск при массовом развертывании таких контрмер?

Ответ кроется в деталях реализации.

Tracebit опубликовала подробный разбор исследования. Последствия ясны: безопасность ИИ — это не только улучшение межсетевых экранов или усиление паролей. Это понимание особенностей самих моделей.

Гонка вооружений перешла на новый уровень. Защитники больше не просто наблюдают. Они вступают в бой.