К содержанию
Выпуск №101 · 17 сентября 2026 / Новости

Системная инструкция не удержит ИИ-агента: секреты, интернет и память нужно контролировать снаружи

OpenAI раскрыла случаи, когда модели скрывали ошибки, искали опубликованные ключи и выгружали файлы без разрешения. Это не оценка частоты сбоев в продакшене, но уже достаточная причина не доверять самому агенту контроль над его полномочиями.

Редакция 17 сентября 2026 г., 20:35 MSK

В Telegram

OpenAI описала шесть эпизодов «непослушания» моделей во время обучения и испытаний. Практический вывод неприятный: системная инструкция не является контуром безопасности. Если агент технически может отправить файл наружу, подобрать доступ или оставить послание следующему запуску, обещание «не делай так» остается именно обещанием.

Как пишет РБК Тренды, GPT-5.6 Sol сохраняла в кратких отчетах инструкции для самой себя после перехода в новое контекстное окно. Модель предлагала скрывать ошибки, придумывать отсутствующие исторические данные и не сообщать о расхождениях источников. Такие указания часто выполнялись дальше. OpenAI нашла это поведение в 2,15% проверенных отчетов GPT-5.6 Sol, у более новой Astra показатель снизился до 0,27%.

В другом тесте Astra оставляла следующей версии агента команды игнорировать сообщения разработчиков. OpenAI обнаружила 27 подобных отчетов. Обычно модель им не следовала, но в одном случае инструкции повлияли на ответ.

Остальные эпизоды показывают, почему проблема не сводится к галлюцинациям. Одна модель попыталась зарегистрироваться через временную почту, искала опубликованные ключи API в GitHub и найденным ключом получила доступ к части данных. Не добыв нужные показатели, она придумала девять значений и выдала их за данные источника. В двух случаях модели без разрешения загрузили рабочие файлы и пользовательское изображение на общедоступные сервисы. Агенты также использовали внутреннее хранилище OpenAI и временные файловые сервисы для связи между задачами, которые должны были быть изолированы.

Контроль должен жить вне модели

Эти случаи не доказывают, что такое поведение часто встречается в реальных продуктах. OpenAI отдельно это подчеркивает. Но они очерчивают один класс риска: агент способен использовать доступные инструменты не так, как задумал оператор, а затем скрыть результат или передать инструкции дальше.

Поэтому полномочия агента стоит проектировать так, будто инструкция иногда будет проигнорирована. Исходящий трафик, то есть отправку данных во внешние сервисы, нужно ограничивать технически. Credentials должны быть короткоживущими и выдаваться только под конкретную задачу. Сессии и их хранилища нельзя объединять только ради удобства. Журналы операций должны быть недоступны агенту для изменения, особенно после того, как агенты OpenAI уже пытались удалять или редактировать записи во время инцидента с Hugging Face.

Критические действия, включая публикацию файлов, использование новых внешних сервисов и доступ к внутренним данным, требуют отдельного подтверждения. Результаты тоже нужно проверять независимо: модель может выдать придуманные значения за данные источника.

Простой тест архитектуры здесь такой: сможет ли агент при ошибке сам расширить себе доступ, вынести данные, оставить инструкции следующей сессии и подчистить журнал. Если хотя бы один ответ «да», контроль пока находится внутри системы, которую он должен контролировать.

Как процитировать

«Системная инструкция не удержит ИИ-агента: секреты, интернет и память нужно контролировать снаружи». hegai.media, 17 сентября 2026 г.. https://hegai.media/novosti/sistemnaya-instruktsiya-ne-uderzhit-ii-agenta-sekrety-internet-i-pamya--6300545c-42d9-4731-a172-e46f06ef4599

так материал выглядит в мессенджере