Anthropic предлагает Auto Mode как более безопасную замену ручным подтверждениям в Claude Code. Но свежий тест показывает неприятный класс отказа: режим может разрешить запуск вредоносного процесса, а затем запретить агенту его остановить. Поэтому включать Auto Mode на всю команду как готовую страховку рано, даже если автономная работа заметно удобнее диалогов с кнопкой Allow.
Что сломалось
Как пишет Саймон Уиллисон, исследователь промпт-инъекций Иоганн Ребергер нашёл атаку на Auto Mode, которая, по его оценке, работает в 80% запусков. Claude Code удавалось заставить скачать и распаковать zip-архив, а затем выполнить код с импортом base64. Агент не замечал, что импорт одновременно подхватывает и исполняет локальный файл struct.py из архива.
Особенно показательно продолжение. В нескольких запусках Claude замечал компрометацию и пытался завершить вредоносный процесс, но Auto Mode блокировал команду очистки. Классификатор пропустил действие, создавшее проблему, и запретил действие, которое должно было её остановить.
Это не просто очередной пример того, что промпт-инъекции всё ещё существуют. Здесь защитный механизм становится частью цепочки отказа. Для оператора бизнеса разница существенная: агент ошибается, а отдельный слой контроля закрепляет ошибку.
Почему дефолт здесь важнее самой уязвимости
С 14 августа Anthropic начала делать Auto Mode режимом по умолчанию для новых сессий в планах Pro, Max и Team, писал ранее Уиллисон. Режим позволяет Claude выполнять задачи без постоянных запросов разрешения, а отдельный AI-классификатор оценивает вызовы инструментов и Shell-команды.
У Anthropic были сильные аргументы в пользу такого решения. По данным, которые приводил The Decoder, в тестах классификатор обнаруживал 89% опасных команд, тогда как люди при ручном подтверждении замечали 13,6%. Gadgets 360 также передавал позицию компании: Auto Mode показал себя лучше ручной проверки разрешений.
Логика понятна. Если разработчик десятки раз подряд механически нажимает подтверждение, формальный контроль быстро превращается в интерфейсный ритуал. Автоматический фильтр может быть дисциплинированнее человека. Но сравнение средних процентов не отвечает на более важный для эксплуатации вопрос: что происходит после первого пропуска.
Тест Ребергера показывает, почему этот вопрос нельзя оставить службе безопасности на потом. Ошибки классификатора могут быть не независимыми. Один и тот же слой сначала разрешает опасное действие, а затем блокирует восстановление. В командном rollout это хуже обычного ложного отрицания: система не только не защищает, но и создаёт ложное ощущение, что автономный запуск уже находится под контролем.
Что менять в rollout
Выбор между Auto Mode и зафиксированным режимом модели нельзя принимать только по качеству кода, latency и расходу токенов. Эти метрики всё равно нужны: стоит считать стоимость принятого изменения, время до результата и долю ручных исправлений на собственном наборе задач. Но теперь в тестовый контур нужно добавить ещё один сценарий: способен ли агент остановить и удалить то, что его защитный классификатор только что пропустил.
Для задач с недоверенным кодом разумный дефолт сегодня не Auto Mode сам по себе, а изолированная среда. Уиллисон соглашается с выводом Ребергера: unattended-агентов следует запускать в контейнере, VM или OS sandbox, ограничивать исходящий сетевой трафик, наблюдать за их действиями и не открывать среде домашние директории, SSH-ключи и облачные учётные данные.
Иными словами, Auto Mode можно тестировать как инструмент производительности, но не использовать вместо архитектуры изоляции. Классификатор решает, какую команду разрешить. Sandbox ограничивает цену неправильного решения. Это разные уровни защиты, хотя интерфейс продукта соблазняет принять один за другой.
Конкретный маркер для следующего этапа прост: воспроизводится ли на вашем наборе ситуация, когда Auto Mode разрешает создание нежелательного процесса, но блокирует его завершение. Если да, режим нельзя делать командным дефолтом вне sandbox независимо от того, сколько токенов он экономит и насколько хороший код пишет. Если Anthropic изменит классификатор так, что подобные цепочки стабильно останавливаются и корректно очищаются, тогда разговор о новом дефолте можно начинать заново.