Cloudflare добавила настройку Disallow AI Training. Владелец сайта теперь может разрешить смешанному краулеру индексировать страницы для поиска, но запретить использовать тот же обход для обучения ИИ. Для медиа, маркетплейсов и SaaS с публичной базой знаний это практический способ не платить контентом за видимость в поиске.
Проблема была в смешанных краулерах Apple, Google и Microsoft: один бот мог одновременно собирать данные для поискового индекса и обучения моделей. Блокировка такого бота защищала материалы, но могла ударить по обнаружению сайта в поиске.
Как пишет Cloudflare в блоге, менее 1% сайтов в её сети блокируют поисковых ботов, тогда как 17% используют какой-либо механизм блокировки обучения. То есть владельцы сайтов проводят довольно ясную границу: поиск обычно приводит посетителей, а обучение моделей само по себе посетителей не обещает.
Что именно изменилось
Cloudflare теперь разделяет три назначения ботов: Search для поисковой индексации, Training для обучения или дообучения моделей и Agent для агентов, которые открывают страницы по запросу пользователя.
При включении Disallow AI Training сервис публикует соответствующее правило в robots.txt. Смешанные краулеры со статусом Accountable остаются допущены к поисковой индексации, но должны учитывать запрет на обучение. Apple, Google и Microsoft, по данным Cloudflare, уже соответствуют требованиям этого статуса либо взяли на себя обязательства выполнить недостающие требования в обозначенные сроки.
Остальные обучающие краулеры Cloudflare блокирует на сетевом уровне. В эту категорию входят отдельные краулеры Amazon, Anthropic, Meta* и OpenAI; их блокировка, согласно компании, не влияет на поиск. Это важное отличие от обычного robots.txt: файл сообщает предпочтение, но сам не умеет определить цель обхода или остановить бота, который решил его проигнорировать. Cloudflare может классифицировать трафик и заблокировать такого краулера.
Ограничение здесь существенное. Настройка не переписывает поведение Apple, Google и Microsoft, а опирается на их текущие возможности и срочные обязательства. Поэтому это уже рабочий контроль доступа, но ещё не универсальный технический запрет на любое использование контента.
Для бизнеса вывод простой: правила для Search, Training и Agent теперь стоит рассматривать отдельно. Разрешить всё или заблокировать всё больше не единственные варианты. Следующий спор будет сложнее: Cloudflare уже называет ИИ-сводки новой задачей и к началу следующего года хочет дать сайтам контроль над тем, какая доля их контента может попадать в такие ответы.