Инструменты методики АЦТ, часть 42: управление данными (Data Governance), управление основными данными (Master Data Management) и хранилища данных (Data Warehouse)

Это сорок вторая статья цикла по инструментам методики «Аккордная цифровая трансформация». Открываем группу H «Данные и аналитика» подгруппой H1 «Управление данными» — инструменты H1-01, H1-02 и H1-03.

Три инструмента этой статьи составляют фундамент работы с данными на предприятии. Управление данными (H1-01) задает правила: кто отвечает за данные, кто имеет к ним доступ и по каким стандартам они ведутся. Управление основными данными (H1-02) удерживает единую достоверную версию ключевых сущностей — клиентов, поставщиков, товаров. Хранилища данных (H1-03) собирают сведения из разрозненных источников в единую структуру для анализа. Трудоемкость составляет 36 часов у управления данными, 42 у управления основными данными и 46 у хранилищ данных, все три отнесены методикой к сложным инструментам. В сумме 124 часа.

H1-01 — Управление данными (Data Governance)

Откуда появился инструмент. Профессиональное сообщество, занимающееся управлением данными, оформилось в 1980 году с основанием ассоциации DAMA International. Практика оставалась разрозненной вплоть до начала 2000-х годов: в 2002 году появился специализированный институт управления данными, а поворотным событием стал 2007 год, когда DAMA International опубликовала первое издание свода знаний по управлению данными, закрепившее общий словарь для профессионального сообщества. До этого момента отдельные предприятия выстраивали собственные, несовместимые между собой практики контроля качества данных, и общего понимания того, что именно следует считать управлением данными, не существовало.

Суть и механика. Управление данными — стратегический подход, который помогает организациям сделать данные надежными, безопасными и полезными. Это не просто технический процесс, а комплекс процессов и решений. Методика называет четыре основные цели: качество данных, при котором сведения остаются точными, полными и актуальными; безопасность, защищающую данные от утечек и злоупотреблений; соответствие требованиям, обеспечивающее соблюдение законов и внутренних стандартов; эффективность, упрощающую доступ к данным для принятия решений.

Цену отсутствия управления данными видно на потере, которую понес один из крупнейших банков мира.

Пример. В 2012 году подразделение JPMorgan Chase, отвечавшее за управление избыточным капиталом банка, потеряло 6,2 млрд долларов на операциях с производными финансовыми инструментами. Внутреннее расследование банка установило, что модель оценки риска опиралась на таблицы, которые сотрудники вели и правили вручную: формулы копировались между ячейками с ошибками, а один из расчетов делил показатель на сумму двух величин вместо их среднего значения, вдвое занижая итоговую оценку риска. Ни одна из этих таблиц не проходила независимую проверку и не имела закрепленного владельца, ответственного за корректность расчета. Комитет Сената США, расследовавший инцидент, назвал отсутствие контроля за такими таблицами одной из системных причин потерь.

Управление данными обходится предприятию значительно дешевле, чем последствия его отсутствия: закрепленная ответственность за один расчетный файл могла предотвратить потерю, исчисляемую миллиардами.

Границы применимости. Инструмент применим на любом предприятии, где решения принимаются на основе данных, а цена ошибки в этих данных велика: в финансовых организациях, промышленности с непрерывным производством, здравоохранении. По методике это сложный инструмент. Первое ограничение касается организационного охвата: управление данными затрагивает все подразделения, работающие с данными, и внедрение в отдельно взятом отделе не решает проблему в масштабе предприятия. Второе — баланс между контролем и удобством: избыточные ограничения на доступ к данным замедляют работу тех, кому эти данные нужны для повседневных решений. Третье — устойчивость во времени: правила управления данными требуют постоянного пересмотра по мере появления новых источников и новых способов работы с данными. Управление данными задает рамку для управления основными данными (H1-02) и хранилищ данных (H1-03), поскольку оба инструмента реализуют его принципы применительно к конкретным категориям сведений.

Чек-лист перед внедрением управления данными:

  • Определены категории данных, требующие наиболее строгого контроля, исходя из цены возможной ошибки.
  • Назначены владельцы данных, ответственные за качество и корректность каждой категории.
  • Установлен порядок независимой проверки расчетов, влияющих на существенные решения.
  • Определен баланс между контролем доступа и удобством работы для тех, кому данные нужны ежедневно.
  • Разработаны стандарты качества данных: точности, полноты, актуальности.
  • Предусмотрен регулярный пересмотр правил по мере появления новых источников данных.

Типовые ошибки:

  • Расчеты без владельца. Критически важные вычисления ведутся в файлах, за которые никто не отвечает. → Закреплять ответственного за каждый существенный расчет.
  • Внедрение в одном подразделении. Правила управления данными вводятся локально, не охватывая предприятие целиком. → Распространять управление данными на все подразделения, работающие с ними.
  • Контроль без учета удобства. Ограничения доступа делают работу с данными настолько сложной, что сотрудники ищут обходные пути. → Соразмерять строгость контроля с реальными потребностями пользователей.
  • Разовое внедрение правил. Стандарты устанавливают однажды и не пересматривают. → Регулярно обновлять правила по мере изменения источников данных.

H1-02 — Управление основными данными (Master Data Management, MDM)

Откуда появился инструмент. Происхождение и распространение дисциплины разобраны в сороковой статье цикла. Здесь стоит остановиться на технической механике: как именно разрозненные записи об одном и том же объекте сводятся в единую версию. В основе лежит процесс сопоставления и объединения записей, при котором система сравнивает сведения из разных источников по ключевым признакам — названию, адресу, идентификационным номерам — и определяет, что несколько записей относятся к одному и тому же объекту. Результат такого сопоставления называют эталонной записью: единственной версией сведений об объекте, которую признают достоверной все системы предприятия.

Суть и механика. Управление основными данными — централизованное управление ключевыми данными организации о клиентах, продуктах, поставщиках, работниках и других сущностях. Под основными данными понимаются критически важные сведения, которые используются на протяжении многих бизнес-процессов и систем. MDM охватывает процессы, инструменты, методы и регламенты, обеспечивающие единое представление о критически важной информации в разных бизнес-функциях. Методика называет четыре цели: согласованность и точность данных во всех системах; улучшенный процесс принятия решений за счет единой версии истины; операционная эффективность благодаря автоматизации отчетности и управления запасами; соответствие нормативным требованиям через точную регистрацию и аудит основных данных.

Значение единой эталонной записи для целей соответствия нормативным требованиям видно на проекте международной консалтинговой сети.

Пример. Компания KPMG, работающая в 143 странах со штатом свыше 270 тысяч человек, столкнулась с отсутствием централизованного управления данными между своими членскими организациями. Сведения о клиентах и финансовые данные дублировались и расходились между независимыми национальными фирмами сети, что затрудняло получение достоверной картины по клиенту, работающему сразу с несколькими подразделениями. Компания развернула централизованную программу управления основными данными, нацеленную на устранение дублирующихся и противоречивых записей о клиентах и приведение данных к единому стандарту. По сведениям отраслевого обзора, программа позволила устранить разрозненность данных о клиентах и повысить прозрачность отчетности между членскими организациями сети.

Единая эталонная запись важна не только для аналитики, но и для соответствия требованиям регуляторов: без нее сама постановка вопроса о совокупной ценности клиента для организации не имеет однозначного ответа.

Границы применимости. Инструмент применим там, где сведения об одних и тех же объектах поступают из нескольких источников и должны сводиться в единую картину: в холдингах с несколькими подразделениями, у международных сетей с независимыми национальными единицами, при работе с регулируемой отчетностью. По методике это сложный инструмент. Первое ограничение относится к качеству исходных данных. Сопоставление записей опирается на имеющиеся признаки, и при неполных или неточных исходных сведениях система либо объединяет разные объекты в один, либо не распознает совпадения. Второе — правила разрешения конфликтов: если для одного объекта в разных источниках указаны различающиеся сведения, требуется заранее определенное правило, какому источнику отдавать предпочтение. Третье — сопровождение изменений: эталонная запись должна обновляться по мере изменения сведений об объекте, иначе она устаревает быстрее источников, которые она призвана заменить. Управление основными данными опирается на управление данными (H1-01) как на общую рамку и служит источником сведений для хранилищ данных (H1-03).

Чек-лист перед внедрением управления основными данными:

  • Определены признаки, по которым записи из разных источников сопоставляются как относящиеся к одному объекту.
  • Установлены правила разрешения конфликтов при расхождении сведений между источниками.
  • Оценено качество исходных данных перед запуском процесса сопоставления.
  • Назначен порядок обновления эталонной записи при изменении сведений об объекте.
  • Определены категории основных данных, требующие внимания в первую очередь.
  • Предусмотрена проверка результатов сопоставления человеком на выборке записей.

Типовые ошибки:

  • Сопоставление без проверки. Записи объединяются автоматически, результат не проверяется на ошибочные совпадения. → Проверять выборку результатов сопоставления вручную.
  • Отсутствие правил разрешения конфликтов. При расхождении сведений между источниками нет заранее установленного порядка выбора. → Определять правила приоритета источников до запуска процесса.
  • Эталонная запись без обновления. Данные сведены однажды и не актуализируются. → Устанавливать регулярный порядок обновления эталонных записей.
  • Сопоставление на некачественных данных. Процесс запускают без предварительной оценки полноты и точности исходных сведений. → Оценивать качество данных до начала сопоставления.

H1-03 — Хранилища данных (Data Warehouse, DWH)

Откуда появился инструмент. Предшественником послужила концепция информационного хранилища, которую в 1988 году предложили Барри Девлин и Пол Мерфи из ирландского подразделения IBM. Оформление дисциплины связано с именем Билла Инмона. В 1992 году в книге «Building the Data Warehouse» он определил хранилище данных как предметно-ориентированный, интегрированный, неизменяемый и изменяющийся во времени набор данных для поддержки управленческих решений. В этой же книге он предложил централизованную архитектуру, при которой данные из разных систем сводятся в единое общекорпоративное хранилище. В 1996 году Ральф Кимбалл в книге «The Data Warehouse Toolkit» предложил противоположный подход: строить хранилище снизу вверх, от потребностей конкретных подразделений, через модель, ориентированную на измерения и факты. Спор между двумя архитектурами не завершен и по сей день, и большинство современных хранилищ сочетают элементы обоих подходов.

Суть и механика. Хранилища данных — методика хранения информации, направленная на централизованное хранение и управление большим объемом структурированных данных из различных источников. Цель — предоставить единую, согласованную и структурированную базу данных для анализа и принятия решений. В отличие от учетных систем, обслуживающих текущие операции, хранилище данных оптимизировано для запросов и анализа за длительные периоды и объединяет сведения, которые в оперативных системах хранятся раздельно.

Масштаб задачи по сведению разрозненных данных в единое хранилище виден на построении системы одной из крупнейших розничных сетей мира.

Пример. Компания Wal-Mart в 1990-е годы заключила контракт с NCR на развертывание хранилища данных на базе системы Teradata, утроив объем существовавшего хранилища с 7,5 до более чем 24 терабайт. Система обслуживала свыше 30 внутренних приложений и обрабатывала до 50 тысяч запросов в неделю. Компания предоставила поставщикам доступ к части хранилища через систему Retail Link, позволяющую им видеть данные о продажах собственной продукции в реальном времени и планировать поставки на основе фактического спроса, а не заявок торговой сети. Решение сделать хранилище частично доступным внешним партнерам оказалось необычным для того времени и связало поставщиков с компанией теснее, чем обычные договорные отношения.

Хранилище данных раскрывает свою ценность не только внутри компании: сведения, накопленные для собственного анализа, при должном разграничении доступа становятся инструментом координации с внешними партнерами.

Границы применимости. Инструмент применим там, где требуется анализ больших объемов исторических данных из нескольких источников: в розничной торговле, промышленности с множеством производственных площадок, финансовых организациях. По методике это сложный инструмент, самый трудоемкий в статье. Первое ограничение связано с выбором архитектуры. Централизованный подход Инмона обеспечивает согласованность в масштабе предприятия ценой более медленного внедрения, тогда как подход Кимбалла быстрее приносит результат отдельным подразделениям ценой риска несогласованности между ними. Второе — актуальность данных: традиционное хранилище обновляется периодически, а не в реальном времени, что ограничивает его применение там, где решения требуют свежих данных. Третье — стоимость поддержания: объем хранимых данных растет постоянно, и без регулярного пересмотра состава хранимой информации расходы на инфраструктуру растут быстрее полезности хранилища. Хранилища данных получают эталонные записи от управления основными данными (H1-02) и служат источником для инструментов визуализации данных (H2-01) и бизнес-аналитики (H2-02).

Чек-лист перед внедрением хранилища данных:

  • Определены источники данных, которые предстоит объединить, и порядок их регулярной загрузки.
  • Выбрана архитектура — централизованная или ориентированная на подразделения — исходя из масштаба и срочности задачи.
  • Установлены правила разграничения доступа, включая возможность предоставления данных внешним партнерам.
  • Оценена требуемая актуальность данных и сопоставлена с периодичностью обновления хранилища.
  • Предусмотрен регулярный пересмотр состава хранимых данных для контроля затрат на инфраструктуру.
  • Определены показатели, по которым оценивается полезность хранилища для принятия решений.

Типовые ошибки:

  • Выбор архитектуры без учета масштаба. Решение принимают без сопоставления скорости внедрения и требуемой согласованности данных. → Соотносить выбор архитектуры с реальным масштабом и срочностью задачи.
  • Ожидание данных в реальном времени. От традиционного хранилища ждут мгновенной актуальности, для которой оно не предназначено. → Оценивать требования к актуальности данных до выбора решения.
  • Рост без пересмотра состава данных. Хранилище накапливает данные без периодической очистки. → Регулярно пересматривать состав хранимой информации.
  • Закрытость от партнеров. Накопленные данные используются только внутри компании, хотя доступ к ним мог бы усилить координацию с поставщиками. → Оценивать возможность предоставления части данных внешним партнерам.

Резюме

Три инструмента этой статьи выстраивают работу с данными как последовательность: управление данными задает правила, управление основными данными приводит ключевые сущности к единой версии, хранилища данных собирают итоговый массив для анализа. Общее для всех трех состоит в том, что цена отсутствия дисциплины оказывается выше цены ее внедрения, и потеря JPMorgan Chase показывает это прямо: 6,2 млрд долларов были потеряны из-за формулы в неконтролируемой таблице, а не из-за сложной технологической проблемы. Управление основными данными продолжает эту логику на уровне конкретных объектов — клиента, поставщика, товара, — а хранилища данных превращают накопленную дисциплину в базу для анализа, которую в редких случаях можно открыть и внешним партнерам, как показал опыт Wal-Mart. Суммарная трудоемкость в 124 часа сопоставима с инфраструктурными инструментами сороковой статьи, что отражает общий характер задачи: построение фундамента для работы с данными требует такого же объема организационных усилий, что и выбор технологической платформы. Для промышленного предприятия отсюда следует практический вывод: три инструмента этой статьи стоит внедрять именно в указанном порядке, поскольку хранилище, построенное на несогласованных основных данных, воспроизводит прежнюю несогласованность в большем масштабе, а не устраняет ее.

В следующей статье цикла продолжим группу H подгруппой H2 «Аналитика и визуализация»: разберем инструменты визуализации данных, бизнес-аналитику и прогнозную аналитику.

Похожие записи