Исследование сравнило выгоду LLM-оркестрации по точности и затратам

Исследователи провели контролируемую оценку методов оркестрации LLM и сравнили их с одиночными вызовами моделей. В работе разбирались подходы Self-Refine, Best-of-N и Debate, а в качестве baseline использовались варианты task-only и chain-of-thought. Тестирование проводили на пяти LLM-бэкбонах и трёх типах задач: соревновательное программирование, шахматные задачи и математика.
Как сообщает arXiv cs.AI (Artificial Intelligence), для сопоставимости все методы оптимизировали с помощью GEPA при одинаковом бюджете оптимизации. Проверка шла на одних и тех же наборах задач с разбивкой по уровню сложности. По словам авторов, оркестрация давала умеренный прирост качества, и результат заметно зависел от конкретного бенчмарка.
В среднем по бенчмаркам максимальное улучшение составило 4,6 процентного пункта относительно оптимизированного CoT-инференса и 4,5 пункта относительно task-only inference. Одновременно такие схемы требовали примерно в 2–4 раза больше токенов по сравнению с task-only inference. Исследование также показало: более высокая сложность задач, определённая людьми, коррелировала со снижением абсолютной точности во всех трёх наборах тестов.
Ключевые факты
Сравнение включало методы Self-Refine, Best-of-N и Debate
Тестирование проводилось на задачах по соревновательному программированию, шахматам и математике
Все методы оптимизировали с помощью GEPA при одинаковом бюджете оптимизации
Максимальный средний прирост составил 4,6 процентного пункта относительно optimized CoT inference
Вопросы и ответы
- Какой реальный прирост качества дали схемы оркестрации по сравнению с обычным chain-of-thought?
Максимальный средний прирост составил 4,6 процентного пункта относительно optimized CoT inference и 4,5 пункта относительно task-only inference. Эффект зависел от конкретного бенчмарка и не был одинаковым для всех задач.
- Во сколько обходится оркестрация по сравнению с одиночным вызовом модели?
Self-Refine, Best-of-N и Debate требовали примерно в 2–4 раза больше токенов, чем task-only inference. То есть рост точности сопровождался заметным увеличением вычислительных затрат.
- На каких задачах и моделях проверяли результаты, чтобы сравнение было сопоставимым?
Тестирование проводилось на пяти LLM-бэкбонах и охватывало соревновательное программирование, шахматные задачи и математику. Все методы оптимизировали через GEPA при одинаковом бюджете оптимизации и проверяли на одинаковых наборах задач с разбивкой по сложности.
Контекст по теме
- Исследование описывает «скрытые якоря» в коллективных обсуждениях LLM-агентов19 июня 2026 г.
- Фреймворк ICT предлагает новый подход к оптимизации рассуждений LLM через анализ распределений токенов19 июня 2026 г.
- Исследование описывает риски «trajectory collapse» при использовании LLM‑агентов в юридическом e‑discovery19 июня 2026 г.
- Исследование arXiv: объём вычислений на этапе инференса влияет на результаты тестов для frontier LLM18 июня 2026 г.