Исследование сравнило стратегии выборки для оценки качества данных в AI-пайплайнах
Исследователи представили бенчмарк методов progressive sampling для профилирования качества данных в data-centric AI-пайплайнах. В работе сравниваются девять стратегий выборки при расчёте доли пропусков, дубликатов, выбросов и нарушений functional dependency на датасетах разного масштаба, от сотен тысяч до миллионов строк.
Как сообщает arXiv cs.AI (Artificial Intelligence), авторы протестировали blind-подходы, среди них random uniform, geometric, Yamane и cluster sampling. Отдельно оценивались proxy-guided методы: Metropolis-Hastings, DAG, stratified и importance-weighted стратегии. Эксперименты проводили на NYC 311, NYPD arrests, UCI Adult, потоке IoT-сенсоров объёмом 2,3 млн строк, двух сверхкрупных реальных датасетах и синтетических данных до 5×10^6 строк.
По итогам тестов blind representative samplers стабильно показали более высокую точность профилирования. При бюджете выборки 5% метод random uniform получил среднюю относительную ошибку 0,49% на NYC 311. Для сравнения, DAG-guided MCMC показал 19,5%. На всех реальных датасетах DAG-подход оказался хуже в 11–49 раз. Различия авторы оценили с помощью теста Wilcoxon с параметрами W=0 и p=0,002.
Ключевые факты
В исследовании сравнивались девять стратегий выборки для профилирования качества данных.
Тестирование включало датасеты NYC 311, NYPD arrests, UCI Adult и IoT-поток объёмом 2,3 млн строк.
Синтетические данные масштабировались до 5×10^6 строк, а набор Ultra-Marathon Running, до 7,4 млн строк.
При 5% бюджете выборки random uniform показал 0,49% средней относительной ошибки на NYC 311 против 19,5% у DAG-guided MCMC.
Вопросы и ответы
- Какие методы оказались точнее для оценки качества данных при ограниченном бюджете выборки?
Blind representative samplers показали лучшую точность на всех реальных датасетах. При бюджете выборки 5% random uniform дал 0,49% средней относительной ошибки на NYC 311 против 19,5% у DAG-guided MCMC, а DAG-подход в целом оказался хуже в 11–49 раз.
- На каких объёмах данных проверяли стратегии выборки и насколько это близко к промышленным пайплайнам?
Тесты проводились на наборах от сотен тысяч до миллионов строк, включая IoT-поток на 2,3 млн записей, синтетические данные до 5×10^6 строк и Ultra-Marathon Running объёмом 7,4 млн строк.
- Какие именно задачи качества данных сравнивали в исследовании?
Девять стратегий выборки сравнивали по точности расчёта доли пропусков, дубликатов, выбросов и нарушений functional dependency в data-centric AI-пайплайнах.
Контекст по теме
- Исследователи предложили бенчмарк GAUGE для оценки финансовых моделей, созданных ИИ-агентами30 июля 2026 г.
- Исследователи связали выводы об ИИ-моделях с выбором метрик производительности2 июля 2026 г.
- Heuresis предлагает стратегии поиска идей для автономных AI‑агентов в научных исследованиях25 июня 2026 г.
- AgentFinVQA: многоагентный пайплайн для проверяемых ответов по финансовым графикам19 июня 2026 г.