К содержанию
Новости

Исследователи предложили бенчмарк GAUGE для оценки финансовых моделей, созданных ИИ-агентами

Исследователи предложили бенчмарк GAUGE для оценки финансовых моделей, созданных ИИ-агентами

Авторы работы GAUGE считают, что существующие методы оценки финансовых моделей слишком часто опираются на единственный «правильный» ответ. При этом аналитики нередко приходят к разным, но обоснованным выводам. Это касается прогнозов, ставок дисконтирования и целевых цен, где допустимы сразу несколько разумных оценок.

Как сообщает arXiv cs.AI (Artificial Intelligence), исследователи проанализировали независимо созданные аналитические модели одних и тех же компаний и обнаружили заметные расхождения. В выборке из 108 пар моделей для 65 компаний медианная оценка при сравнении с единственным эталоном составила 0,33, а 92,6% результатов оказались ниже уровня 0,70. Авторы отдельно отмечают, что ни одна пара моделей, созданных в один и тот же период, не совпала по предполагаемой цене актива в пределах 10%.

Для оценки агентных систем исследователи предложили бенчмарк GAUGE. Он ориентируется не на одну референсную модель, а на диапазон практик, которые встречаются у профессиональных аналитиков. В основу вошли 1 001 аналитическая рабочая книга, классифицированная поставщиком данных, а также набор из 196 задач. Система включает трехуровневую модель допустимых отклонений, 56 проверяемых параметров, восемь уровней валидации и детерминированные структурные проверки.

Кроме того, авторы описали валидацию бенчмарка с участием 55 человек, использованием company-grouped cross-fitting и дополнительными проверками. По замыслу исследователей, это должно подтвердить пригодность метода для оценки финансовых моделей, создаваемых ИИ-агентами.

Ключевые факты

  • В исследовании рассмотрены 108 направленных пар аналитических моделей для 65 компаний.

  • Медианная оценка при сравнении с единственным эталоном составила 0,33.

  • 92,6% моделей получили оценку ниже 0,70 при single-reference grading.

  • GAUGE использует 1 001 аналитическую рабочую книгу и набор из 196 задач.

Вопросы и ответы

Чем GAUGE отличается от обычной проверки модели по одному «правильному» ответу?

GAUGE оценивает модель по диапазону допустимых решений, а не по единственному эталону. Для этого используются 1 001 аналитическая рабочая книга, 196 задач, 56 проверяемых параметров и восьмиуровневая система валидации.

Почему исследователи считают текущие методы оценки финансовых ИИ-моделей ненадежными?

При анализе 108 пар независимых моделей для 65 компаний медианная оценка при сравнении с одним эталоном составила 0,33, а 92,6% моделей получили меньше 0,70. При этом ни одна пара моделей, созданных в один период, не совпала по целевой цене актива в пределах 10%.

Насколько GAUGE проверяли перед публикацией?

Авторы описали валидацию с участием 55 человек, применением company-grouped cross-fitting и дополнительными проверками, чтобы подтвердить пригодность бенчмарка для оценки финансовых моделей, создаваемых ИИ-агентами.

Контекст по теме