Исследование Pew показывает неприятную для билдеров вещь: дата публикации больше не служит признаком актуального и первичного знания. Если RAG или поисковый агент без разбора собирает свежие страницы, он рискует подтвердить синтетический текст его же пересказами.
Интернет не стал «мёртвым», однако работа с ним становится сложнее и дороже. Поиску нужен отдельный контур происхождения, дедупликации и проверки качества. Без него корпус разрастается за счёт документов, которые повторяют друг друга.
Что именно измерили
Как пишет IT Home со ссылкой на TechCrunch, Pew Research Center собрал через архив Common Crawl почти 500 тысяч англоязычных веб-страниц примерно за пять лет. Для определения возможного ИИ-авторства или существенной ИИ-редактуры исследователи использовали технологию Open Pangram.
В случайной выборке из 10 тысяч страниц, сделанной в июле 2026 года, явные признаки ИИ обнаружились примерно у 10% документов. В выборку входили и старые страницы, опубликованные до появления массовых инструментов ИИ-письма. После исключения материалов, вышедших до запуска ChatGPT в ноябре 2022 года, доля страниц с возможными следами ИИ выросла до 35%.
Распределение по доменам оказалось неравномерным. На сайтах.edu и.gov признаки ИИ нашли примерно в 1% материалов, на.org, в 4,6%. У.com доля была примерно в десять раз выше, чем у.edu и.gov.
У методики есть очевидное ограничение, которое признаёт и Pew: Pangram, как и другие детекторы, может принять человеческий текст за машинный. Исследование также заметило рост конструкций, которые принято связывать с ИИ-письмом, включая оксфордскую запятую и формулу «это не X, а Y». Одна пунктуация или синтаксическая привычка ещё ничего не доказывает.
Поэтому 35% нельзя читать как точную перепись текстов, написанных моделью. Для продуктового решения точность до последнего процента здесь и не требуется. Масштаб уже достаточен, чтобы отказаться от старой презумпции, согласно которой новая страница автоматически означает новое свидетельство.
RAG теперь должен считать происхождение, а не ссылки
Обычный поисковый контур оптимизируется на релевантность и свежесть. Этого больше недостаточно. Пять страниц могут пересказывать шестую, а шестая, быть сгенерирована из тех же пяти. Модель увидит уверенное согласие источников, хотя за ним стоит один размноженный тезис.
Происхождение документа стоит хранить как часть индекса. URL и дата обхода сами по себе мало что дают. Нужны домен, дата публикации, признаки первичного материала, ссылки на исходники и связь с найденными копиями. Эти данные не гарантируют достоверность, зато помогают различать независимое подтверждение и очередной рерайт.
Посимвольной дедупликации тоже мало. Тексты с разными заголовками и формулировками могут повторять один набор утверждений. Я бы объединял такие материалы в кластеры и ограничивал их совокупный вес при формировании ответа. Десять пересказов не должны голосовать десять раз.
Рейтинг источников стоит строить под конкретную задачу. Низкая доля обнаруженных ИИ-следов на.gov и.edu выглядит полезным сигналом, хотя универсального качества она не гарантирует. Для корпоративной цены первичным источником останется сайт компании, для исследования важнее сама публикация, для новости, материал со ссылкой на документ или прямое заявление. Домен здесь работает как один из коэффициентов рейтинга.
Критичные ответы придётся проверять вручную. Если от результата зависит платёж, договор, медицинское решение или действие оператора, красивого списка цитат недостаточно. В бюджете RAG-продукта рядом с токенами и векторной базой должна появиться работа с происхождением данных. Именно этот контур снижает риск получить машину по производству уверенных пересказов.
Что проверить до следующего сбора корпуса
После семантической дедупликации посчитайте, сколько независимых цепочек источников остаётся за ключевыми ответами. Если десять ссылок схлопываются в один кластер, а уверенность модели почти не меняется, система принимает плотность копирования за качество подтверждения.
Ещё один полезный внутренний показатель, доля ответов, где критичный тезис опирается минимум на два независимых первичных или близких к первичным источника. Если после переиндексации она не растёт, увеличение корпуса продукту не помогает. Загрязнение лишь становится дороже хранить и проще цитировать.