К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Copilot сам выдал обход защиты: скрытые инструкции пора считать вводом атакующего

Исследователи Varonis выведали у Microsoft 365 Copilot Enterprise недокументированный параметр, который отключал подтверждение пользователя. Для корпоративных AI-агентов вывод неприятный: секретный промпт не защищает систему, если модель способна его пересказать или подсказать путь обхода.

Редакция 18 августа 2026 г., 17:20 MSK

В Telegram
Вывеска Microsoft у штаб-квартиры компании
Иллюстрация: hegai.media

Microsoft 365 Copilot Enterprise помог исследователям обойти собственную защиту: отвечая на серию вопросов, ассистент раскрыл недокументированный параметр промпта, который позволял выполнять действие без подтверждения пользователя. Это не просто ошибка Microsoft. Закрытый от пользователя ввод нельзя считать границей доверия, если он попадает в контекст модели.

Для бизнеса практический вывод жестче: системный промпт, описание защитных механизмов и служебные параметры нужно проектировать так, будто атакующий со временем сможет их восстановить. Не обязательно целиком. Иногда достаточно одного фрагмента, который превращает обязательный клик в декоративный ритуал.

Copilot допросили, и он ответил

Как пишет Ars Technica, исследователи Varonis хотели создать эксплойт, способный вывести чувствительные данные после единственного действия пользователя, перехода по ссылке. Copilot отказывался выполнять чувствительные команды автоматически и объяснял, что для них нужен явный жест: например, нажатие клавиши.

Тогда исследователи начали расспрашивать ассистента о самой защите. Почему автоматическое выполнение невозможно? Какие структуры URL и deep links используются? Что происходит, если страница загружается, а поле промпта уже заполнено?

Каждый ответ давал новую деталь. В итоге Copilot раскрыл недокументированный параметр промпта, который полностью обходил требование пользовательского подтверждения. По данным Ars Technica, исследователи смогли заставить модель выдавать пароли и другие чувствительные данные без согласия пользователя.

Ключевая ошибка здесь не в том, что Copilot оказался слишком разговорчивым. Модель сделала ровно то, для чего ее обучали: связала вопросы, объяснила поведение системы и помогла решить задачу. Проблема архитектурная: знание о привилегированном механизме оказалось доступно тому же компоненту, который общается с потенциальным атакующим.

Секретный промпт не является контролем доступа

У обычного приложения секрет не перестает быть секретом только потому, что пользователь задает много вопросов интерфейсу. У LLM граница размыта: модель получает инструкции, данные и описание доступных действий в одном контексте, а затем строит ответ по связям между ними.

Отсюда полезное правило для корпоративного AI: все, что модель видит, нужно считать потенциально извлекаемым. Формулировка системного промпта может быть скрыта в интерфейсе, но скрытость сама по себе не дает защиты. Это скорее занавеска, чем сейф.

История Copilot уже несколько месяцев движется по одному маршруту. В июне SecurityLab писал о SearchLeak: переход по ссылке позволял похищать почту и коды подтверждения через сайты Microsoft. Ars Technica тогда же описывала уязвимость, позволявшую украсть код 2FA. В мае Саймон Уиллисон разбирал утечку файлов через Copilot Cowork, где агент мог отправлять письма в ящик пользователя без подтверждения, а их отображение создавало путь для утечки данных.

Общий знаменатель этих эпизодов, на мой взгляд, не в качестве отдельных фильтров. Агент одновременно работает с недоверенным вводом, чувствительными данными и действиями от имени пользователя. Пока эти три зоны соединены моделью, очередной запрет на уровне промпта лишь добавляет атакующему еще одну загадку. Varonis показала, что ответы иногда лежат у самого агента.

Что проверить в своем контуре

Первое: уберите секреты из контекста модели. Если ключ, служебный параметр или полный текст защитной инструкции не нужен для генерации ответа, модель не должна его видеть.

Второе: считайте системные промпты раскрытыми заранее. Защита обязана сохраняться даже после публикации их текста. Если знание формулировки позволяет обойти контроль, это не контроль, а ставка на молчание модели.

Третье: ограничьте инструменты независимо от промпта. Подтверждение чувствительного действия должно проверяться отдельным компонентом, а не инструкцией в том же контексте, который обрабатывает запрос пользователя.

Четвертое: тестируйте не только прямой prompt injection. Задавайте агенту последовательность невинных вопросов о ссылках, параметрах, причинах отказа и условиях выполнения. Атака Varonis сработала не как магическая команда, а как методичный разговор о внутренней логике продукта.

Конкретный маркер зрелости простой: дайте red team полный системный промпт и описание доступных инструментов. Затем проверьте, может ли недоверенная ссылка или заранее заполненный ввод привести к чтению чувствительных данных либо привилегированному действию без отдельного подтверждения. Если может, проблема уже существует. Секретность инструкций лишь мешает вашей команде увидеть ее раньше атакующего.

Как процитировать

«Copilot сам выдал обход защиты: скрытые инструкции пора считать вводом атакующего». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/copilot-sam-vydal-obhod-zaschity-skrytye-instruktsii-pora-schitat-vvod--898dfa5b-124c-44ef-ac67-aff811cbdd44

так материал выглядит в мессенджере