К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Голосование LLM завышает уверенность: на RAGTruth шесть судей дали 1,9 независимого голоса

Ансамбль моделей может оценивать лучше одиночного судьи, но число голосов нельзя принимать за число независимых проверок. Для eval-пайплайна важны не размер жюри и список провайдеров, а корреляция ошибок и эффективный размер ансамбля.

Редакция 18 августа 2026 г., 22:22 MSK

В Telegram

Шесть LLM-судей из четырех лабораторий выглядят как серьезная проверка, пока не начинаешь считать не модели, а независимые ошибки. На RAGTruth их средняя попарная корреляция составила около 0,42, поэтому шесть вердиктов несут примерно столько же независимой информации, сколько 1,9 голоса. Для бизнеса вывод неприятный: кнопка majority vote повышает качество оценки, но легко завышает уверенность в результате.

Что измерили

Как пишет автор исследования на Habr, он сравнил вердикты шести инструктивных LLM из четырех лабораторий и трех стран на публичном бенчмарке RAGTruth. По приближению через design effect эффективный размер комитета составил 1,9 при фактических шести моделях.

Это не означает, что в панели буквально осталось два судьи. Эффективный размер показывает, сколько независимых голосов содержится в наборе коррелированных решений. Если модели ошибаются на одних и тех же примерах, очередное совпадение вердиктов добавляет меньше информации, чем новый независимый взгляд.

При этом сам консенсус не бесполезен. В июле автор уже показывал, что комитет из шести LLM на RAGTruth обходит любого одиночного судью, и новый расчет этого не отменяет. Он отменяет более удобную интерпретацию: будто преимущество шести моделей автоматически дает статистическую уверенность шести независимых измерений.

Метод можно перепроверить без расходов на модели. В опубликованном репозитории скрипт analyze.py пересчитывает среднюю корреляцию и эффективный размер по сохраненным вердиктам, без обращений к API.

Разные логотипы не означают разные ошибки

Соблазн ансамбля понятен. Берем модели разных лабораторий, просим их голосовать и считаем большинство защитой от смещения отдельного судьи. Но разнообразие провайдеров оказалось слабым заменителем независимости: в этом измерении ошибки все равно заметно коррелировали.

Именно здесь eval-пайплайн может начать производить лишнюю уверенность. Результат 5:1 выглядит убедительнее, чем вердикт одной модели. Но если голоса связаны, арифметическое большинство нельзя читать как шесть отдельных подтверждений. По оценке автора, гарантии независимого голосования в таком комитете ослабевают до уровня примерно двух эффективных судей. Теорема Кондорсе для коррелированных голосов не исчезает, отмечает он, но ее границы становятся существенно слабее.

Проблема уже была видна с других сторон. Июньский препринт RoPoLL формализовал LLM Jury в модели загрязнения Хубера и показал неограниченное смещение при любом положительном загрязнении. Другой июльский препринт прямо поставил вопрос, означает ли согласие LLM их правоту, на фоне того, что LLM-as-judge все чаще используется в корпоративных пайплайнах и масштабируется до ансамблей. Авторы эксперимента, описанного на LessWrong в августе, также сообщили, что рейтинги моделей оказались крайне чувствительны к отдельным компонентам итоговой оценки.

Все три сигнала указывают на одну операционную ошибку: агрегировать ответы проще, чем доказать независимость измерений. Поэтому число судей само по себе почти ничего не говорит о надежности оценки.

Что менять в eval-пайплайне

Во-первых, хранить вердикты по каждому примеру, а не только итоговый процент побед и решение большинства. Без этого корреляцию ошибок уже не посчитать.

Во-вторых, выводить рядом с качеством панели среднюю попарную корреляцию ошибок и эффективный размер ансамбля. Формулировка «шесть моделей согласились» должна уступить место более честной: «шесть моделей согласились, но несут 1,9 независимого голоса».

В-третьих, добавлять не только новые LLM, но и проверки другого типа: формальные правила, отдельные тесты на конкретные сбои, ручную разметку выборки. Это не гарантирует независимость автоматически, зато перестает подменять разнообразие методов разнообразием логотипов.

Главный маркер на ближайших итерациях простой. Если добавление новых судей повышает размер панели с шести до восьми, а эффективный размер остается около двух, ансамбль покупает дополнительные токены, но почти не покупает уверенность. Если же корреляция ошибок снижается и эффективный размер растет вместе с числом моделей, тогда жюри действительно становится жюри, а не хором с шестью микрофонами.

Как процитировать

«Голосование LLM завышает уверенность: на RAGTruth шесть судей дали 1,9 независимого голоса». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/golosovanie-llm-zavyshaet-uverennost-na-ragtruth-shest-sudey-dali-1-9--db2b834f-5cdf-48f0-a633-aaf8a74592ba

так материал выглядит в мессенджере