Коротко
Сергей Третьяков, product owner MWS Data Scout, описывает систему, которая автоматически документирует таблицы БД, обогащая их схемы примерами данных, классами, доменными знаниями и документацией. На тестах оказалось, что больше контекста не всегда лучше: качество зависит от типа таблицы и комбинации блоков промпта; в продуктиве система описала 8180 таблиц менее чем за три дня.
Контекст
Автор — Сергей Третьяков, product owner MWS Data Scout. Проект начался с ручного описания витрин Resource Inventory: семь сотрудников за три месяца описали 310 витрин, тратя до шести часов на таблицу. В MWS более 600 баз данных только в одном кластере, поэтому ручная документация не успевала за ростом ландшафта. Простая передача модели схемы давала лишь пересказ названий и типов полей без бизнес-смысла.
Главное
- Ручной пилот Resource Inventory: 7 сотрудников описали 310 витрин за 3 месяца; на таблицу могло уходить до 6 часов.
- В одном кластере MWS более 600 баз данных, а названия полей вроде status_2 не раскрывают их бизнес-смысл.
- Для контекста берут по 10 случайных записей и относят таблицы к типам Log, Transactional, Directory, Bridge или Summary.
- Для доменного слоя применяют eTOM в телекоме и BIAN в финансах; при отсутствии готовой модели продукт строит собственный глоссарий.
- Документацию собирают из Confluence, git и PDF, DOCX, XLSX, MD, TXT, HTML; поиск по фрагментам в Elasticsearch гибридный — полнотекстовый и векторный.
- Тест включал 1048 генераций для 93 уникальных таблиц из трёх источников; автоматическая оценка сочетала LLM-as-a-judge и CatBoost по шкале от 1 до 5.
- В среднем task дал +0,60, examples +0,51; output_format дал −0,08, documentation −0,11. Лучший результат зависит от сочетания блоков, поэтому промпты разделяют по классу таблицы и домену.
- В продуктиве МТС описаны 8180 таблиц из 7 СУБД менее чем за 3 дня; автор сообщает о 95% описаний без правок и росте выпуска с 30 до 2000 таблиц на сотрудника в месяц.
- Продукт также строит ER-диаграммы, выявляет неявные связи, формирует бизнес-термины и синонимы и размечает персональные данные.
- Модели развёрнуты внутри корпоративного контура на GPU A100 и A40; простые задачи переносят на классификаторы от логистической регрессии до DistilBERT.
Как сделано
Система берёт по 10 случайных строк каждой таблицы и сначала классифицирует её как Log, Transactional, Directory, Bridge или Summary. Затем добавляет доменный контекст: отраслевые модели eTOM для телекома и BIAN для финансов либо собственный глоссарий, построенный по данным. Документацию извлекают из Confluence, git и файлов PDF, DOCX, XLSX, MD, TXT и HTML; фрагменты хранят в Elasticsearch и находят гибридным полнотекстовым и векторным поиском.
Команда провела 1048 генераций для 93 таблиц из трёх источников на одной модели. Качество оценивала связка LLM-as-a-judge и CatBoost по шкале 1–5; влияние блоков анализировали парным t-тестом и регрессией с фиксированными эффектами. Блоки task и examples в среднем улучшали оценки на 0,60 и 0,51 соответственно (p<0,001); output_format снижал на 0,08 (p=0,012), documentation — на 0,11 (p=0,020). Поэтому вместо универсального промпта используют матрицу вариантов по классу таблицы и бизнес-домену.
Кроме описаний, Data Scout строит ER-диаграммы, в том числе предполагая скрытые связи по пересечениям данных, формирует бизнес-термины и синонимы и размечает персональные данные. Для этого используются LLM и классические ML-методы. Маскирование чувствительных полей выполняется сетевым шлюзом до доступа ИИ-агента; автор утверждает, что данные не покидают защищённый периметр.
Результаты
На продуктивных базах МТС описали 8180 таблиц из 7 СУБД менее чем за 3 дня; генерация занимает около 25 секунд на таблицу без учёта проверки человеком. По данным автора, около 80% работы автоматизировано, 95% описаний аналитики принимают без правок, а производительность сотрудника выросла с 30 до 2000 таблиц в месяц. В отдельных примерах система обработала 634 таблицы за 33 часа и 4653 таблицы за 1,75 часа чистого времени генерации. Также она строит ER-диаграммы, готовит термины и синонимы и ищет ПДн.
Ограничения
Результаты внедрения и показатели приёмки приводит сам автор; независимая проверка в статье не описана. Эксперименты с промптами охватывали 93 таблицы из трёх источников и одну модель, поэтому нельзя считать выводы универсальными для любых СУБД, доменов и моделей. Документация может быть устаревшей или относиться к соседней системе, а жёсткий формат и избыток блоков способны ухудшать ответы. Время обработки зависит от объёма контекста и не включает человеческую проверку. Локальное развёртывание требует GPU A100 и A40; оборудование создаёт фиксированные расходы и ограничивает масштабирование. Для разметки ПДн цена ошибки высока, а методика и точность классификации в статье подробно не приведены.
Что взять себе
- Не отправляйте модели одну схему в ожидании бизнес-описания: добавьте репрезентативные значения, тип таблицы и проверенный доменный словарь.
- Не перегружайте промпт автоматически найденными документами и жёстким форматом: сначала проверяйте, улучшают ли конкретные блоки результат на ваших данных.
- Подбирайте инструкции под класс таблицы и предметную область, а документацию проверяйте на актуальность и соответствие системе.
- Для автоматической маркировки чувствительных данных учитывайте цену ошибки, а маскирование выполняйте до того, как данные увидит ИИ-агент.
- Оценивайте не только скорость генерации, но и время проверки человеком, долю принятых описаний, качество и стоимость GPU-инфраструктуры.
Читать оригинал, если…
Откройте оригинал, если нужны подробности о коннекторах, интеграциях, защите ПДн, статистической методике тестов или примеры реализации MWS Data Scout.