Skip to content
Neuronavt
Go back

Как MWS автоматизировала описание баз данных

Кейс8/10

Коротко

Сергей Третьяков, product owner MWS Data Scout, описывает систему, которая автоматически документирует таблицы БД, обогащая их схемы примерами данных, классами, доменными знаниями и документацией. На тестах оказалось, что больше контекста не всегда лучше: качество зависит от типа таблицы и комбинации блоков промпта; в продуктиве система описала 8180 таблиц менее чем за три дня.

Контекст

Автор — Сергей Третьяков, product owner MWS Data Scout. Проект начался с ручного описания витрин Resource Inventory: семь сотрудников за три месяца описали 310 витрин, тратя до шести часов на таблицу. В MWS более 600 баз данных только в одном кластере, поэтому ручная документация не успевала за ростом ландшафта. Простая передача модели схемы давала лишь пересказ названий и типов полей без бизнес-смысла.

Главное

Как сделано

Система берёт по 10 случайных строк каждой таблицы и сначала классифицирует её как Log, Transactional, Directory, Bridge или Summary. Затем добавляет доменный контекст: отраслевые модели eTOM для телекома и BIAN для финансов либо собственный глоссарий, построенный по данным. Документацию извлекают из Confluence, git и файлов PDF, DOCX, XLSX, MD, TXT и HTML; фрагменты хранят в Elasticsearch и находят гибридным полнотекстовым и векторным поиском.

Команда провела 1048 генераций для 93 таблиц из трёх источников на одной модели. Качество оценивала связка LLM-as-a-judge и CatBoost по шкале 1–5; влияние блоков анализировали парным t-тестом и регрессией с фиксированными эффектами. Блоки task и examples в среднем улучшали оценки на 0,60 и 0,51 соответственно (p<0,001); output_format снижал на 0,08 (p=0,012), documentation — на 0,11 (p=0,020). Поэтому вместо универсального промпта используют матрицу вариантов по классу таблицы и бизнес-домену.

Кроме описаний, Data Scout строит ER-диаграммы, в том числе предполагая скрытые связи по пересечениям данных, формирует бизнес-термины и синонимы и размечает персональные данные. Для этого используются LLM и классические ML-методы. Маскирование чувствительных полей выполняется сетевым шлюзом до доступа ИИ-агента; автор утверждает, что данные не покидают защищённый периметр.

Результаты

На продуктивных базах МТС описали 8180 таблиц из 7 СУБД менее чем за 3 дня; генерация занимает около 25 секунд на таблицу без учёта проверки человеком. По данным автора, около 80% работы автоматизировано, 95% описаний аналитики принимают без правок, а производительность сотрудника выросла с 30 до 2000 таблиц в месяц. В отдельных примерах система обработала 634 таблицы за 33 часа и 4653 таблицы за 1,75 часа чистого времени генерации. Также она строит ER-диаграммы, готовит термины и синонимы и ищет ПДн.

Ограничения

Результаты внедрения и показатели приёмки приводит сам автор; независимая проверка в статье не описана. Эксперименты с промптами охватывали 93 таблицы из трёх источников и одну модель, поэтому нельзя считать выводы универсальными для любых СУБД, доменов и моделей. Документация может быть устаревшей или относиться к соседней системе, а жёсткий формат и избыток блоков способны ухудшать ответы. Время обработки зависит от объёма контекста и не включает человеческую проверку. Локальное развёртывание требует GPU A100 и A40; оборудование создаёт фиксированные расходы и ограничивает масштабирование. Для разметки ПДн цена ошибки высока, а методика и точность классификации в статье подробно не приведены.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если нужны подробности о коннекторах, интеграциях, защите ПДн, статистической методике тестов или примеры реализации MWS Data Scout.