К содержанию
Новости

Исследование сравнило выгоду LLM-оркестрации по точности и затратам

Инфографика: 4,6 процентного пу прирост качества
Графика: hegai.media

Исследователи провели контролируемую оценку методов оркестрации LLM и сравнили их с одиночными вызовами моделей. В работе разбирались подходы Self-Refine, Best-of-N и Debate, а в качестве baseline использовались варианты task-only и chain-of-thought. Тестирование проводили на пяти LLM-бэкбонах и трёх типах задач: соревновательное программирование, шахматные задачи и математика.

Как сообщает arXiv cs.AI (Artificial Intelligence), для сопоставимости все методы оптимизировали с помощью GEPA при одинаковом бюджете оптимизации. Проверка шла на одних и тех же наборах задач с разбивкой по уровню сложности. По словам авторов, оркестрация давала умеренный прирост качества, и результат заметно зависел от конкретного бенчмарка.

В среднем по бенчмаркам максимальное улучшение составило 4,6 процентного пункта относительно оптимизированного CoT-инференса и 4,5 пункта относительно task-only inference. Одновременно такие схемы требовали примерно в 2–4 раза больше токенов по сравнению с task-only inference. Исследование также показало: более высокая сложность задач, определённая людьми, коррелировала со снижением абсолютной точности во всех трёх наборах тестов.

Ключевые факты

  • Сравнение включало методы Self-Refine, Best-of-N и Debate

  • Тестирование проводилось на задачах по соревновательному программированию, шахматам и математике

  • Все методы оптимизировали с помощью GEPA при одинаковом бюджете оптимизации

  • Максимальный средний прирост составил 4,6 процентного пункта относительно optimized CoT inference

Вопросы и ответы

Какой реальный прирост качества дали схемы оркестрации по сравнению с обычным chain-of-thought?

Максимальный средний прирост составил 4,6 процентного пункта относительно optimized CoT inference и 4,5 пункта относительно task-only inference. Эффект зависел от конкретного бенчмарка и не был одинаковым для всех задач.

Во сколько обходится оркестрация по сравнению с одиночным вызовом модели?

Self-Refine, Best-of-N и Debate требовали примерно в 2–4 раза больше токенов, чем task-only inference. То есть рост точности сопровождался заметным увеличением вычислительных затрат.

На каких задачах и моделях проверяли результаты, чтобы сравнение было сопоставимым?

Тестирование проводилось на пяти LLM-бэкбонах и охватывало соревновательное программирование, шахматные задачи и математику. Все методы оптимизировали через GEPA при одинаковом бюджете оптимизации и проверяли на одинаковых наборах задач с разбивкой по сложности.

Контекст по теме