К содержанию
Новости

Исследование сравнило стратегии выборки для оценки качества данных в AI-пайплайнах

Исследование сравнило стратегии выборки для оценки качества данных в AI-пайплайнах

Исследователи представили бенчмарк методов progressive sampling для профилирования качества данных в data-centric AI-пайплайнах. В работе сравниваются девять стратегий выборки при расчёте доли пропусков, дубликатов, выбросов и нарушений functional dependency на датасетах разного масштаба, от сотен тысяч до миллионов строк.

Как сообщает arXiv cs.AI (Artificial Intelligence), авторы протестировали blind-подходы, среди них random uniform, geometric, Yamane и cluster sampling. Отдельно оценивались proxy-guided методы: Metropolis-Hastings, DAG, stratified и importance-weighted стратегии. Эксперименты проводили на NYC 311, NYPD arrests, UCI Adult, потоке IoT-сенсоров объёмом 2,3 млн строк, двух сверхкрупных реальных датасетах и синтетических данных до 5×10^6 строк.

По итогам тестов blind representative samplers стабильно показали более высокую точность профилирования. При бюджете выборки 5% метод random uniform получил среднюю относительную ошибку 0,49% на NYC 311. Для сравнения, DAG-guided MCMC показал 19,5%. На всех реальных датасетах DAG-подход оказался хуже в 11–49 раз. Различия авторы оценили с помощью теста Wilcoxon с параметрами W=0 и p=0,002.

Ключевые факты

  • В исследовании сравнивались девять стратегий выборки для профилирования качества данных.

  • Тестирование включало датасеты NYC 311, NYPD arrests, UCI Adult и IoT-поток объёмом 2,3 млн строк.

  • Синтетические данные масштабировались до 5×10^6 строк, а набор Ultra-Marathon Running, до 7,4 млн строк.

  • При 5% бюджете выборки random uniform показал 0,49% средней относительной ошибки на NYC 311 против 19,5% у DAG-guided MCMC.

Вопросы и ответы

Какие методы оказались точнее для оценки качества данных при ограниченном бюджете выборки?

Blind representative samplers показали лучшую точность на всех реальных датасетах. При бюджете выборки 5% random uniform дал 0,49% средней относительной ошибки на NYC 311 против 19,5% у DAG-guided MCMC, а DAG-подход в целом оказался хуже в 11–49 раз.

На каких объёмах данных проверяли стратегии выборки и насколько это близко к промышленным пайплайнам?

Тесты проводились на наборах от сотен тысяч до миллионов строк, включая IoT-поток на 2,3 млн записей, синтетические данные до 5×10^6 строк и Ultra-Marathon Running объёмом 7,4 млн строк.

Какие именно задачи качества данных сравнивали в исследовании?

Девять стратегий выборки сравнивали по точности расчёта доли пропусков, дубликатов, выбросов и нарушений functional dependency в data-centric AI-пайплайнах.

Контекст по теме