Исследователи предложили бенчмарк GAUGE для оценки финансовых моделей, созданных ИИ-агентами
Авторы работы GAUGE считают, что существующие методы оценки финансовых моделей слишком часто опираются на единственный «правильный» ответ. При этом аналитики нередко приходят к разным, но обоснованным выводам. Это касается прогнозов, ставок дисконтирования и целевых цен, где допустимы сразу несколько разумных оценок.
Как сообщает arXiv cs.AI (Artificial Intelligence), исследователи проанализировали независимо созданные аналитические модели одних и тех же компаний и обнаружили заметные расхождения. В выборке из 108 пар моделей для 65 компаний медианная оценка при сравнении с единственным эталоном составила 0,33, а 92,6% результатов оказались ниже уровня 0,70. Авторы отдельно отмечают, что ни одна пара моделей, созданных в один и тот же период, не совпала по предполагаемой цене актива в пределах 10%.
Для оценки агентных систем исследователи предложили бенчмарк GAUGE. Он ориентируется не на одну референсную модель, а на диапазон практик, которые встречаются у профессиональных аналитиков. В основу вошли 1 001 аналитическая рабочая книга, классифицированная поставщиком данных, а также набор из 196 задач. Система включает трехуровневую модель допустимых отклонений, 56 проверяемых параметров, восемь уровней валидации и детерминированные структурные проверки.
Кроме того, авторы описали валидацию бенчмарка с участием 55 человек, использованием company-grouped cross-fitting и дополнительными проверками. По замыслу исследователей, это должно подтвердить пригодность метода для оценки финансовых моделей, создаваемых ИИ-агентами.
Ключевые факты
В исследовании рассмотрены 108 направленных пар аналитических моделей для 65 компаний.
Медианная оценка при сравнении с единственным эталоном составила 0,33.
92,6% моделей получили оценку ниже 0,70 при single-reference grading.
GAUGE использует 1 001 аналитическую рабочую книгу и набор из 196 задач.
Вопросы и ответы
- Чем GAUGE отличается от обычной проверки модели по одному «правильному» ответу?
GAUGE оценивает модель по диапазону допустимых решений, а не по единственному эталону. Для этого используются 1 001 аналитическая рабочая книга, 196 задач, 56 проверяемых параметров и восьмиуровневая система валидации.
- Почему исследователи считают текущие методы оценки финансовых ИИ-моделей ненадежными?
При анализе 108 пар независимых моделей для 65 компаний медианная оценка при сравнении с одним эталоном составила 0,33, а 92,6% моделей получили меньше 0,70. При этом ни одна пара моделей, созданных в один период, не совпала по целевой цене актива в пределах 10%.
- Насколько GAUGE проверяли перед публикацией?
Авторы описали валидацию с участием 55 человек, применением company-grouped cross-fitting и дополнительными проверками, чтобы подтвердить пригодность бенчмарка для оценки финансовых моделей, создаваемых ИИ-агентами.
Контекст по теме
- Исследователи связали выводы об ИИ-моделях с выбором метрик производительности2 июля 2026 г.
- OpenFinGym: единая среда для проверки агентов в задачах количественных финансов26 июня 2026 г.
- Исследование предлагает оценивать LLM‑агентов по «предиктивной валидности», а не по суммарным баллам бенчмарков19 июня 2026 г.
- AgentFinVQA: многоагентный пайплайн для проверяемых ответов по финансовым графикам19 июня 2026 г.