К содержанию
Новости

CoverageCat сравнил AI-модели по задачам страхового андеррайтинга и расчёта премий

CoverageCat сравнил AI-модели по задачам страхового андеррайтинга и расчёта премий

CoverageCat представил бенчмарк для оценки AI-моделей в страховых сценариях. Он проверяет модели по двум направлениям: расчёт стоимости umbrella-полисов на анонимизированных данных и ответы на вопросы брокеров и агентов по андеррайтингу, eligibility и coverage. Как пишет Hacker News, авторы считают, что стандартные AI-бенчмарки плохо отражают задачи, связанные с лимитами ответственности, ограничениями страховых carriers и неопределённостью при расчёте премий.

В тестах на price estimation моделям передают данные о штате, carrier, лимите покрытия и обезличенных риск-факторах. После этого они должны предсказать годовую премию и диапазон неопределённости P10/P50/P90. Результаты сверяют с фактическими quote outcomes. Для оценки используют несколько метрик. Coverage показывает корректность диапазонов, MAPE оценивает точность точечных прогнозов, а Winkler loss штрафует слишком широкие диапазоны и прогнозы, которые не попали в реальную стоимость.

Отдельный leaderboard посвящён задачам brokerage и agent reasoning. В этих сценариях модели отвечают на вопросы о соответствии требованиям страховой компании, стоимости увеличения покрытия и правилах eligibility. Ответы сравниваются с эталонными reference answers с помощью AI judging. В публичной версии доступны только агрегированные judge scores, pairwise Elo и win rate.

Авторы также утверждают, что используют анонимизированные данные и платформы без retention и logging. По их словам, это позволяет не раскрывать данные клиентов даже поставщикам моделей.

Ключевые факты

  • В задачах price estimation модели должны предсказывать диапазоны P10/P50/P90 для annual premium по umbrella-полисам.

  • Бенчмарк включает сценарии по underwriting, eligibility и coverage для брокеров и страховых агентов.

  • Для оценки прогнозов используются метрики Coverage, MAPE и Winkler loss.

  • Публичные результаты показывают aggregate judge scores, pairwise Elo и win rate без раскрытия raw prompts и model responses.