Anthropic раскрыла сбой, при котором около 133 млн диалогов внешних подрядчиков почти год не проходили через биозащитный классификатор. Это не доказательство биологического вреда, но вполне измеримый операционный провал: защитный слой существовал в документации, однако не работал на большом участке реального трафика.
Для компаний, которые подключают Claude или другую модель к чувствительным процессам, вывод прямой. Фильтр поставщика снижает риск, но не может считаться вашим контуром контроля, если вы не видите, когда и к какому трафику он действительно применяется.
Что именно сломалось
Как пишет IT Home со ссылкой на отчет Anthropic от 14 августа, часть классификаторов, предназначенных для блокировки опасных запросов о химическом и биологическом оружии, не проверяла трафик внешних подрядчиков с мая 2025-го по апрель 2026 года.
Около 50 тысяч подрядчиков провели за этот период примерно 133 млн диалогов с моделями. Речь не о 133 млн вредоносных запросов: источник утверждает только, что этот массив не проходил через соответствующий биозащитный фильтр. Внутреннее расследование Anthropic не обнаружило доказательств того, что запросы использовались для реального злоупотребления.
По описанию компании, классификаторы должны в реальном времени анализировать ввод пользователя и ответы модели, а затем блокировать информацию, которая может помочь в опасной деятельности. Этот механизм входит в многоуровневую защиту Anthropic от рисков, связанных с химическим, биологическим, радиологическим и ядерным оружием.
Проблема возникла на участке, связанном с внешними поставщиками, которые отвечали за проверку подрядчиков. Anthropic признала недостатки этого процесса и после расследования ужесточила требования к их отбору и управлению.
Защита была, наблюдаемости не было
Самая важная цифра здесь не 133 млн, а почти год. Один из заявленных защитных механизмов не работал на этом участке трафика на протяжении всего периода. Значит, наличие классификатора само по себе еще не дает ответа на два операционных вопроса: весь ли нужный трафик проходит через него и узнает ли клиент о сбое раньше, чем выйдет очередной отчет.
Это уже не первый случай, когда граница между моделью и внешним процессом оказывается слабым местом. В июле IT Home сообщал, что ошибки конфигурации среды сторонней оценки Anthropic привели к трем реальным инцидентам в сфере кибербезопасности. В том эпизоде проблема тоже была не только в возможностях модели, а в том, как люди и подрядчики собрали вокруг нее систему.
Одновременно Anthropic настраивает классификаторы так, чтобы они реже мешали нормальной работе. В августе компания сообщила, что обновление защиты Claude Fable 5 сократило число случаев деградации при обработке биологических запросов на 85%. Это нормальный продуктовый конфликт: слишком мягкий фильтр пропускает опасное, слишком строгий ломает полезные сценарии. Но оптимизация этой границы принадлежит поставщику. Риск конкретного бизнеса принадлежит самому бизнесу.
Что строить поверх API
Чувствительным стоит считать сценарий, где модель получает закрытые данные, выдает инструкции с потенциально опасными последствиями или может без проверки человека запустить действие во внешней системе. Здесь одного системного промпта и обещаний провайдера мало. Поверх API нужен собственный классификатор входящих запросов и результатов модели, с правилами по теме запроса, намерению пользователя, степени практической применимости ответа и допустимому действию: пропустить, заблокировать или отправить на ручную проверку.
Решения этого слоя следует журналировать: какой запрос был разрешен, какой заблокирован, какая версия политики сработала и куда ушло исключение. Без этого расследование превращается в археологию по чатам.
Периодические red-team-проверки должны охватывать не только модель, но и всю цепочку: маршрутизацию, резервные модели, роли подрядчиков и обходные пути. Отдельный аварийный выключатель должен закрывать рискованный сценарий независимо от доступности панели поставщика.
Сроки уведомления об уязвимостях и сбоях стоит закреплять в договоре. Если провайдер сообщает о годовом пробеле только после внутреннего расследования, клиент не должен узнавать о собственной зоне риска из публикации в медиа.
Главный маркер на будущее прост: начнут ли AI-провайдеры раскрывать не только устройство защитных фильтров, но и показатели их фактического покрытия, историю отказов и сроки уведомления клиентов. Встроенную биозащиту разумно учитывать как полезную страховку, но опасно принимать за подтвержденный контроль.