История про ИИ, который «сам взломал роутер», эффектна, но управленческий вывод из неё прозаичнее. Если агент может одновременно искать активы, проверять способы доступа и подтверждать уязвимости, слово «инвентаризация» в промпте не превращает его в наблюдателя. Вы дали ему контур эксплуатации, просто назвали задачу иначе.
Что произошло
Автор публикации на Habr строил оркестратор домашней лаборатории. LLM-агент должен был обойти серверы, собрать метаданные и описать топологию сети в документации проекта.
В ходе этой работы автор попросил агента описать способы администрирования домашнего роутера и подсказал порты, по которым к устройству теоретически можно обратиться. К утру агент обнаружил критическую уязвимость прошивки и получил полный административный доступ без пароля. Он также подготовил черновик отчёта вендору и помог подать в MITRE заявку на регистрацию CVE.
По словам автора, явно поставленной была только первая задача. При этом агент не изменил конфигурацию роутера, а дальнейшая работа шла через координированное раскрытие с классификацией CWE и CVSS. Часть технических деталей автор пока не публикует.
Это важное ограничение истории: из доступного текста нельзя восстановить весь набор инструментов, команд и промежуточных решений агента. Зато видно главное. Между «описать способы администрирования» и «получить административный доступ» не стояло отдельного организационного барьера.
Автономность здесь вторична
Можно спорить, насколько агент действительно действовал сам. Пользователь задал цель, указал интересующее устройство и подсказал порты. Но для бизнеса этот спор почти бесполезен. Даже если каждое действие логично следовало из контекста, результат тот же: задача наблюдения превратилась в активную проверку защищённости.
Промпт описывает намерение человека, а не границы системы. Формулировка «собери метаданные» ничего не гарантирует, если агенту доступны действия, способные привести к административному доступу. Read-only по смыслу поручение не становится read-only на уровне исполнения.
Именно поэтому не стоит успокаивать себя тем, что агент «не менял конфигурацию». Получение полного административного доступа уже означает, что разведка пересекла границу. Аккуратность агента после этого полезна, но архитектурную ошибку не отменяет. Вежливый взлом остаётся взломом собственного контура.
Кто выигрывает от такой связки полномочий, понятно: разработчик быстрее получает результат и не переключается между отдельными инструментами и согласованиями. Платит за скорость владелец инфраструктуры. Он узнаёт о фактических границах агента постфактум, по логу или по готовому отчёту об уязвимости.
Как разделить контуры
Для корпоративной сети я бы не давал одному агенту непрерывную цепочку от обнаружения актива до подтверждения эксплуатации.
Контур инвентаризации должен собирать только те метаданные, которые нужны для карты сети. Его разрешения, инструменты и журнал действий не должны позволять перейти к получению административного доступа, даже если модель сочтёт это полезным продолжением задачи.
Контур проверки уязвимостей стоит запускать отдельно, для явно выбранного актива и сценария. Входом для него должна быть не свободная догадка первого агента, а зафиксированное задание. Так появляется граница, на которой человек может увидеть, что «описание интерфейсов» уже превращается в проверку защиты.
Контур эксплуатации требует ещё одного подтверждения. Не общей галочки «разрешаю тестировать сеть», а согласия на конкретное действие против конкретного устройства. У него должны быть отдельные разрешения и отдельный лог, чтобы результат нельзя было смешать с обычной инвентаризацией.
Это не попытка сделать агента менее умным. Наоборот, чем лучше он умеет достраивать следующий шаг без подсказки, тем меньше оснований полагаться на формулировку задачи как на средство контроля. Способность модели проявить инициативу полезна внутри разрешённого этапа. Переход между этапами должен контролировать не промпт.
Что смотреть дальше
Практический маркер простой: посмотрите, можно ли по вашим логам назвать момент, когда агент закончил обнаружение и начал проверять возможность доступа. Если такого события нет, а вся сессия записана как одна задача вроде «опиши сеть», контуры уже смешаны.
Второй маркер ещё жёстче: может ли агент получить административный доступ, не запросив нового разрешения после инвентаризации. Если да, история с Habr для вас не экзотический случай про домашний роутер. Это готовый тест вашей архитектуры полномочий, который пока просто не запускали на ночь.