Яндекс: робот-документатор витрин данных на LLM
Описание проекта
Робот работает в четыре стадии. Сначала объективный сбор: пути и схемы таблиц, записи из внутреннего глоссария на Вики, существующая Вики-документация, связанные таблицы через граф в Memgraph и семантически близкие таблицы в тех же папках. Затем LLM не сочиняет с нуля, а дописывает поверх собранного роботом объективного контекста. Далее описания попадают в Data Catalog вместе с документацией на уровне полей и указанием источника. Одна модель генерирует, вторая независимо оценивает качество. Источники — YT (DWH, аналитика, сырые логи).
Вендор и технология: Яндекс, собственный робот на нескольких LLM плюс графовая БД Memgraph.
Задача
В компании оставались недокументированными 40 000 таблиц, а за год ручной работы аналитики описали лишь 500. Без описаний ИИ-агенты не могли находить и понимать данные через Data Catalog API, а аналитики не отличали доверенные источники от случайных.
Цели внедрения
-
Задокументировать десятки тысяч таблиц
-
дать ИИ-агентам машиночитаемое описание данных
-
подсветить доверенные источники для аналитиков
-
не заставлять людей писать с чистого листа, а давать черновик на правку
-
контролировать качество вторым независимым LLM
Результаты
-
Результаты
-
15 000 таблиц описано за полгода против 500 за предыдущий год
-
сэкономлено около 5 лет рабочего времени аналитиков (в среднем 2 часа на таблицу)
-
92% семантического совпадения сгенерированных описаний с проверенными человеком
-
71% полей перенесены без изменений после проверки человеком Финансы
-
Экономия около 5 человеко-лет работы аналитиков Нагрузка и масштаб
-
Более 40 000 отфильтрованных таблиц в DWH, аналитике и сырых логах Сроки
-
6 месяцев, публикация 29.07.2026
Стоимость проекта
Экономия около 5 человеко-лет работы аналитиков