Яндекс автоматизировал описание таблиц и за полгода задокументировал 15 тысяч наборов данных
В Яндексе рассказали, как отказались от ручного описания таблиц в пользу автоматизированного подхода. По данным компании, за год попыток мотивировать сотрудников документировать данные вручную удалось собрать описания только для 500 таблиц из примерно 40 тысяч востребованных.
Как пишет Habr, проблема касается не только сотрудников, работающих с аналитикой, но и ИИ-агентов. В компании поясняют: без описаний аналитики тратят больше времени на поиск нужных данных и заново собирают уже существующие наборы. Из-за нехватки информации о содержимом таблиц снижается и качество работы ИИ-систем.
Также в Яндексе сообщили, что внутри компании используются десятки миллионов таблиц с совокупным объёмом данных в экзабайты. После внедрения автоматизированного подхода за полгода удалось описать 15 тысяч таблиц, тогда как за предыдущий год ручной работы описания появились только у 500.
Ключевые факты
В Яндексе используют десятки миллионов таблиц с данными объёмом в экзабайты.
Ручное описание данных за год охватило только 500 таблиц из примерно 40 тысяч востребованных.
После перехода к автоматизированному подходу за полгода удалось описать 15 тысяч таблиц.
В компании отмечают, что отсутствие описаний ухудшает качество работы ИИ-агентов с данными.
Вопросы и ответы
- Насколько автоматизация ускорила документирование данных по сравнению с ручным подходом?
При ручном описании за год удалось задокументировать только 500 востребованных таблиц из примерно 40 тысяч. После автоматизации за полгода описали уже 15 тысяч таблиц.
- Какой практический эффект отсутствие описаний даёт для ИИ и аналитиков внутри компании?
Без описаний аналитики не могут быстро находить нужные данные и заново собирают уже существующие наборы. В Яндексе также отмечают, что из-за нехватки информации о содержимом таблиц ухудшается качество работы ИИ-агентов.
- Насколько масштабна проблема с данными в Яндексе?
Внутри компании используются десятки миллионов таблиц с совокупным объёмом данных в экзабайты, поэтому ручное документирование оказалось слишком медленным даже для 40 тысяч наиболее востребованных таблиц.
Контекст по теме
- Почему ИИ-агенты начинают ошибаться на крупных кодовых базах17 июля 2026 г.
- Yandex AI Studio добавила инструменты для создания ИИ-агентов под бизнес-задачи14 июля 2026 г.
- Логирование Codex от OpenAI может создавать огромную нагрузку на SSD23 июня 2026 г.
- Google обновила NotebookLM: инструмент для заметок может писать код и создавать таблицы10 июня 2026 г.