К содержанию
Выпуск №10 · 18 июня 2026 / Новости

Исследование arXiv: объём вычислений на этапе инференса влияет на результаты тестов для frontier LLM

В работе arXiv:2606.17930v1 исследуется, как объём вычислений во время инференса влияет на оценку возможностей крупных языковых моделей.

Редакция 18 июня 2026 г., 13:04 MSK

В Telegram

В работе arXiv:2606.17930v1 исследуется, как объём вычислений во время инференса влияет на оценку возможностей крупных языковых моделей. Авторы обращают внимание на сдвиг в самих AI‑бенчмарках: всё чаще это сложные задачи, где требуется длинная цепочка действий, работа с инструментами и итеративное решение проблем. В такой среде итоговые оценки начинают зависеть от того, сколько вычислительных ресурсов модель получает во время выполнения теста ("inference compute"). При этом многие результаты по‑прежнему публикуют при одном фиксированном и ограниченном вычислительном бюджете. Поэтому слабый результат может отражать не реальные способности модели, а условия, в которых проходил тест.

Чтобы проверить этот эффект, исследователи протестировали до 12 frontier language models на семи сложных бенчмарках. Они относятся к областям software engineering, mathematics, medicine и cybersecurity. Эксперименты проводились в контролируемой конфигурации. Использовались три простых способа масштабирования инференса: увеличение token budget, context compaction и повторные попытки отправки решения. Повторные попытки могла инициировать сама модель, либо они сопровождались минимальной обратной связью о корректности.

Среди результатов авторы отмечают заметный рост показателей на ряде бенчмарков при увеличении token budgets. Это наблюдается в разных областях, включая cybersecurity, FrontierMath, Humanity's Last Exam и TerminalBench.

Ключевые факты

  • В работе оцениваются до 12 frontier language models на семи сложных бенчмарках из областей software engineering, mathematics, medicine и cybersecurity.

  • Эксперимент использует три интервенции масштабирования инференса: увеличение token budgets, context compaction и повторные попытки отправки решений.

  • Повторные попытки выполняются либо под управлением самой модели, либо с минимальной обратной связью о корректности.

  • Увеличение token budgets заметно улучшает результаты на бенчмарках, включая cybersecurity, FrontierMath, Humanity's Last Exam и TerminalBench.

Как процитировать

«Исследование arXiv: объём вычислений на этапе инференса влияет на результаты тестов для frontier LLM». hegai.media, 18 июня 2026 г.. https://hegai.media/novosti/issledovanie-arxiv-obem-vychisleniy-na-etape-inferensa-vliyaet-na-rezu--92f3353b-77b6-46bf-bac3-a537ae70d3ae

так материал выглядит в мессенджере