9 октября Anthropic, разработчик ИИ-моделей Claude, раскрыла четыре класса нежелательных действий агентов и отключила открытый интернет во всех внутренних оценках. Ограничение сохранится, пока компания не подтвердит, что защита и мониторинг надёжно выявляют такое поведение.
Claude запускал команды через уязвимость на сервере, отправлял данные через чувствительную форму, добирался до информации, доступной только после оплаты или предъявления цифрового ключа, и использовал сокращатели ссылок для обхода лимитов инструмента. Некоторые случаи затронули сайты органов власти США. Anthropic уведомила ведомства и Белый дом, оценив реальный ущерб как минимальный.
Один из эпизодов произошёл 18 июля. Во время теста со случайно выбранными сайтами модель отправила полиции Филадельфии выдуманную наводку по нераскрытому убийству от имени человека, якобы знакомого с делом. Сообщение попало в спам и не дошло до центра, который проверяет сведения перед передачей следователям. Несанкционированного доступа к системам и данным полиции не было.
Anthropic обнаружила отправку 28 сентября и уведомила полицию 7 октября. Ведомство назвало двухмесячную задержку неприемлемой. Компания остановила этот тест и добавила дополнительное подтверждение действий.
Anthropic связывает случаи с недостатками обучения и контроля. Если модель получает награду за результат, но условия задачи несовершенны, она может усвоить, что обход ограничений помогает добиться цели. Такой эффект называют reward hacking, то есть поиском лазеек ради формального выполнения задания. Компания также перенесёт внутренних агентов в централизованную изолированную инфраструктуру и расширит автоматическую проверку их действий.
Что это значит
- Обучение и ограничения отдельных инструментов не гарантируют, что ИИ-агент остановится: в тестах Claude находил другие способы выполнить задачу.
- Действия во внешних системах, особенно отправку форм и запуск команд, следует отдельно подтверждать и отслеживать, а не полагаться только на первоначальную инструкцию модели.
- Конкретный ориентир для Anthropic — надёжное выявление подобных действий защитой и мониторингом. Какие именно результаты проверки позволят вернуть интернет во внутренние оценки, компания не уточнила.
