Статья 30 августа 2026 2 минуты чтения

Как устроена архитектура enterprise Data Catalog

Разбираем техническую архитектуру корпоративного каталога данных: из каких компонентов он состоит и как они взаимодействуют.

Как устроена архитектура enterprise Data Catalog

Когда ИТ-архитектор оценивает каталог данных перед покупкой, его интересует не маркетинговое описание, а конкретные технические компоненты: как система собирает метаданные, где их хранит и как масштабируется при росте числа источников. Разбираем типовую архитектуру enterprise-класса каталога данных.

Краткий вывод: архитектура зрелого корпоративного каталога данных строится из четырёх слоёв — коннекторы к источникам, хранилище метаданных, поисковый индекс и веб-интерфейс с API; качество каждого слоя определяет реальную производительность системы при масштабе.

Слой 1. Коннекторы к источникам данных

Первый компонент — набор адаптеров для подключения к разным источникам: реляционным и колоночным СУБД, файловым хранилищам, BI-платформам, ETL-инструментам. Чем шире набор готовых коннекторов, тем быстрее происходит внедрение без написания собственной интеграции.

Слой 2. Хранилище метаданных

Собранные метаданные — схемы, статистика, связи — сохраняются в отдельном хранилище, обычно построенном на графовой или реляционной базе данных. Именно здесь строятся связи для Data Lineage и хранится история изменений бизнес-глоссария.

Слой 3. Поисковый индекс

Для быстрого полнотекстового поиска по бизнес-терминам и техническим названиям используется отдельный поисковый индекс, часто на базе движков типа Elasticsearch. Скорость и релевантность поиска напрямую влияют на удобство работы аналитиков с каталогом.

Слой 4. Веб-интерфейс и API

Финальный слой — интерфейс для пользователей (поиск, карточки данных, глоссарий) и API для интеграции с внешними системами: BI-инструментами, системами управления доступом, инструментами мониторинга качества данных.

Как это влияет на выбор платформы

Продукты на базе открытых стандартов, например Arenadata Catalog на базе OpenMetadata, унаследуют проверенную архитектуру сообщества и получают готовую экосистему коннекторов, что снижает риски при внедрении по сравнению с полностью проприетарными решениями с закрытой архитектурой.

Часто задаваемые вопросы

Можно ли развернуть каталог данных полностью on-premise? Да, большинство российских enterprise-решений поддерживают локальное развёртывание для соответствия требованиям безопасности.

Как архитектура влияет на скорость сканирования новых источников? Чем более параллельной и асинхронной сделана обработка метаданных, тем быстрее каталог обновляется при подключении крупных источников без нагрузки на сами системы-источники.