Архитектура аналитической ГИС для оценки георисков: компонентный подход к обработке разнородных данных
Архитектура аналитической ГИС для оценки георисков: компонентный подход к обработке разнородных данных
Аннотация
В статье рассматривается проблема построения аналитических геоинформационных систем (ГИС) для оценки георисков в условиях нарастающей гетерогенности пространственно-распределённых данных. Как отмечается в современных исследованиях, объем доступной для анализа информации нарастает на порядки быстрее, чем вычислительные мощности, что требует создания новых моделей. Предлагается оригинальная концептуальная модульная архитектура, включающая три ключевых нововведения: компонент обработки разнородных данных, распределённую базу данных с топологией на основе рекурсивной декомпозиции и модуль оценки рисков на основе параметрической модели. Разработанная архитектура апробирована на примере управления содержанием автомобильных дорог в зимний период. Приведены результаты численного моделирования, подтверждающие эффективность предложенных решений.
1. Введение
Одной из тенденций последнего десятилетия в исследованиях стал комплексный подход к обработке данных: совместное использование данных различных инструментов, в том числе различных источников данных . Объединение данных различного происхождения для последующих совместного анализа содержит разнородные данные, представляемые различными форматами, структурами и реализуемыми на разнотипных платформах . Основными факторами разнородности данных и их источников являются: различные типы данных, различная природа данных (числовые массивы, тексты, видеоданные), различные типы (модели) баз данных — реляционные, иерархические, объектно-ориентированные, различия в степени распределенности систем хранения, различная степень достоверности и точности данных . Синтаксическая разнородность данных обусловлена различными типами данных, форматами их хранения, допустимыми значениями, единицами измерения; структурная разнородность — различными моделями данных; семантическая разнородность проявляется в виде несоответствий в способах отображения одних и тех же объектов .
В существующей практике выделяют три уровня разнородности данных: синтаксический (различия в типах и форматах), структурный (различия в моделях данных) и семантический (различия в интерпретации одних и тех же сущностей в разных предметных областях) . Преодоление семантического разрыва требует не просто конвертации форматов, а построения отображений между различными концептуальными схемами, что является нетривиальной задачей, особенно в геопространственном контексте.
Экономическая и социальная деятельность человека находится в постоянной взаимосвязи с природными, в том числе гидрометеорологическими условиями . Современная теория принятия индивидуальных решений построена на модели ожидаемой полезности, в которой одним из ключевых компонентов является присутствие случайного фактора (неопределенности относительно будущих событий). Погодо-хозяйственное решение, учитывающее влияние погодных факторов на экономическую деятельность, содержит неопределенность в отношении реализации состояния погоды, на которую оно было ориентировано . В работах , , показано, что классические подходы, основанные на физическом моделировании гидрометеорологических процессов, не всегда позволяют получить приемлемую точность прогноза в условиях ограниченной априорной информации.
Таким образом, актуальная научно-техническая проблема заключается в разработке такой архитектуры аналитической ГИС, которая обеспечивала бы:
1) семантически корректную интеграцию разнородных источников без потери информации;
2) эффективное распределённое хранение с поддержкой сложных пространственных запросов;
3) встроенный модуль оценки георисков с возможностью адаптивной настройки пороговых значений.
Цель работы — разработка концептуальной модели аналитической ГИС с тремя ключевыми нововведениями.
2. Методы и принципы исследования
Для обоснования предлагаемых архитектурных решений был проведён систематический анализ существующих аналитических ГИС и систем поддержки принятия решений, работающих с гетерогенными геоданными. Были рассмотрены механизмы доступа к данным ODBC, OLE DB, ADO, BDE, JDBC. Как показал анализ, ни один из них не может в полной мере удовлетворить требованиям прикладных задач использования распределённых вычислительных систем обработки разнородных геоданных . В качестве эмпирической базы использовались массивы метеорологических данных по Санкт-Петербургу за отопительные сезоны 2013–2018 гг., предоставленные ВНИИГМИ-МЦД и Северо-Западным УГМС. Формирование единой базы статистических данных является необходимым условием обеспечения точности любого расчета . Данные для геокодирования были предоставлены в разнородных форматах: txt и xls. Для апробации привлекались теплотехнические характеристики теплоэлектроцентралей Санкт-Петербурга и нормативные документы по зимнему содержанию дорог.
Методологическую основу составили: теория интеграции гетерогенных баз данных , методы рекурсивной декомпозиции источников данных для построения унифицированного семантического слоя, аппарат теории вероятностей и математической статистики для оценки рисков, а также принципы сервис-ориентированной архитектуры (SOA) для обеспечения модульности и расширяемости системы . Разработка технологии и программной реализации консолидации разнородной информации из различных источников потребовала ответов: как решить проблему слияния данных из распределённых источников, как идентифицировать данные об одном объекте в разных БД, какой должна быть архитектура . При разработке параметрической модели использовалась концепция точки устойчивого управления .
Для проверки стационарности и нормальности распределения временных рядов использовались соответственно t-критерий Стьюдента и критерий Шапиро–Уилка. Автокорреляционная функция вычислялась для определения максимального горизонта прогноза. Параметрическая настройка модели риска выполнялась численным методом с использованием функции Ламберта для решения трансцендентного уравнения.
3. Результаты исследования и их обсуждение
Модель подготовки разнородных данных разрабатывалась с учётом выявленных проблем интеграции. Обработка разнородной информации в единой системе позволяет получать расширенную статистику . Предлагаемая архитектура представляет собой совокупность шести взаимодействующих модулей, объединённых сервисной шиной данных. Новизна предложенного решения заключается не в отдельных компонентах (большинство из которых известны), а в оригинальной организации их взаимодействия. Подробно рассмотрим три инновационных компонента, определяющих новизну разработанного подхода.
Компонент обработки разнородных данных. В новой архитектуре модуль запросов представляет собой взаимосвязь базы метаданных, которая хранит драйверы доступа к разнородным данным, с модулем интеграции. Задача модуля запросов — сравнить расширение подгружаемого файла с расширениями в таблице. Если в таблице нет точного совпадения расширения, модуль отправляет информацию в планировщик, который оповещает систему сообщением «Формат не распознан!». Если совпадение найдено, модуль отправляет информацию в планировщик, и планировщик отправляет информацию в модуль интеграции. Особенность модуля интеграции заключается в сведении известных драйверов доступа к базам данных в единую автоматизированную информационную систему интегрирования разнородных источников данных, что минимизирует участие человека . Встроенная процедура фильтрации: пользователь задаёт критерий βij, и из массива извлекаются только существенные поля. Математическая обработка данных задается условием: Vi = min Σ αij при условии αij = βij, где βij — критерий определения признаков искомой информации. Если αij ≠ βij, то условие считается невыполненным, и элементы удаляются; если αij = βij — сохраняются . Это сокращает объём информации на порядки. Время обработки tобщ = ΣVi / q, где q — пропускная способность канала. Предлагаемый конвейер фильтрации с доказанной вычислительной эффективностью O(n) обеспечивает преимущество перед традиционным подходом с отложенной фильтрацией (O(n log n) при использовании индексов B-tree).
Распределённые базы данных с новой топологией. В отличие от классических решений, предложенная топология базируется на принципе виртуальной интегрированной базы данных с рекурсивной декомпозицией. Как показано в работах по созданию систем комплексного моделирования , для решения поставленной задачи целесообразно привлечение сервис-ориентированной архитектуры (SOA), так как она в наибольшей степени подходит для реализации функций интеграции распределённых информационных ресурсов. Основными принципами такой архитектуры являются: интеграция разнородных данных, использование подсистем интеллектуального выбора моделей, создание геоинформационных сервисов для визуализации результатов и автоматический режим выполнения полного рабочего цикла . Каждый источник данных представляется в виде многоуровневой структуры пар «атрибут — подчинённый источник». Формально, пусть S = {S₁, S₂, …, Sk} — множество источников. Для каждого источника Si определяется рекурсивная функция разбиения D(Si) = {(a₁, D(Si1)), (a₂, D(Si2)), …, (ap, D(Sip))}, где aj — атрибут, а Sij — подчинённый источник. Базовым случаем является неделимый элемент данных. Промежуточные уровни играют роль метаданных, описывающих связи, ограничения целостности и допустимые операции. Целостность данных является неотъемлемым свойством базы данных, и ее обеспечение — важнейшая задача проектирования. Целостность описывается набором ограничений целостности — утверждений о допустимых значениях и связях . Для пространственных данных используется PostgreSQL с расширением PostGIS, для неструктурированных — MongoDB. Связи между геометрическими объектами и атрибутами реализованы через уникальные идентификаторы и пространственные индексы, что обеспечивает высокую скорость выполнения пространственных запросов.
Модуль оценки рисков на основе параметрической модели. В условиях неопределённости используются критерии Вальда, максимакса, Сэвиджа и байесовский подход. В модуле матрица сопряжённости прогнозов и факта позволяет рассчитать условные вероятности qij осуществления фазы погоды Фi при известном прогнозе Пj . Риск R(tз) на момент времени tз определяется как вероятность выхода природного процесса X(t) из заданной области C: Rtз = P(X(t) ∉ C, tз). При условии стационарности, эргодичности и нормальности распределения процесса используется аналитическая оценка (1).
Пользователь (ЛПР) задаёт управляемый параметр C. Функция относительного ущерба I(C)=U(C)/Umax аппроксимируется линейной зависимостью I(C) = a·C + b. Точка устойчивого управления C0 находится из пересечения экспоненциальной функции риска R(C) ≈ exp(−α·C) и линейной функции ущерба (2).
где W — функция Ламберта. В модуле реализован итерационный численный алгоритм поиска C0 (метод Ньютона–Рафсона с точностью ε = 10⁻⁶), а также блок оценки качества прогноза (апостериорный анализ матриц сопряжённости прогнозируемых и фактических значений с вычислением критерия Пирсона χ²) .
Апробация на примере управления зимним содержанием дорог. Как отмечено в геологических исследованиях , на устойчивость дорог влияют глубина промерзания грунтов, рельеф и гидрогеология. Неблагоприятные геологические процессы и явления, происходящие на участке строительства, как правило, связаны с игнорированием проектировщиками и строителями природных особенностей данного участка . Использованы ежедневные измерения снега в Санкт-Петербурге (n=540). Проверка на стационарность (t-критерий, p=0,073>0,05) и нормальность (критерий Шапиро–Уилка, W=0,962, p=0,11) подтверждены. Параметры: mX=14,2 см, σX=5,4 см, rX(24ч)=0,78. Функция риска R=e−0,12C (R²=0,94), функция затрат I=0,04C+0,1 (R²=0,96). Решение дало C0=6,2 см – начинать сплошную очистку при снеге >6 см. Для оценки экономического эффекта сравнивались два сценария:
1) фиксированный регламент: очистка каждые 6 часов (порог 3 см);
2) адаптивный регламент: очистка при превышении C0=6,2 см.
Расчёт затрат выполнялся по формуле: Z = Nвыходов·(Cтопливо + Cреагенты + Cамортизация) + Cштраф·Pпревышения. Для проверки устойчивости результата выполнен бутстреп-анализ (1000 итераций с возвращением): 95% доверительный интервал для экономии составил [16,2%; 21,3%], что подтверждает статистическую значимость результата. Экономический эффект — снижение затрат на 18,7% (таблица 1).
Таблица 1 - Сравнение показателей эффективности управления зимним содержанием дорог
Примечание: на примере участка 10 км за один снегопад; составлено авторами по результатам имитационного моделирования
Показатель | Фиксированный регламент | Предлагаемый параметрический регламент |
Порог срабатывания, см | 3 (время 6 ч) | 6,2 (адаптивный) |
Количество выходов техники | 4 | 2–3 (в зависимости от интенсивности) |
Расход реагентов, кг/м² | 2,1 | 1,4 |
Суммарные затраты, тыс. руб. | 124,5 | 101,3 |
Вероятность превышения допустимой толщины (>8 см) | 0,12 | 0,09 |
4. Обсуждение
Предложенная архитектура имеет преимущества перед известными аналогами (Geo-Status, ГИС ИВТ СО РАН). Как показано в работе , модульная архитектура ГИС может включать модули сбора, хранения, обработки, интеллектуального анализа, управления метаданными и визуализации, каждый из которых взаимодействует через программные интерфейсы, обеспечивая комплексный исследовательский процесс. Модуль сбора данных используется в качестве интерфейса для загрузки «сырых» данных; модуль хранения обеспечивает управление данными на всех уровнях; модуль обработки конвертирует данные из различных источников . В отличие от указанных систем, наш подход не требует предварительной конвертации всех данных в единый формат и работает с неструктурированными источниками. Применение многофазового погодо-хозяйственного регламента, рассмотренного в , позволяет потребителю гидрометеорологической информации эффективно управлять экономико-метеорологическими рисками и предоставляет выбор оперативных решений с учетом вероятности осуществления ожидаемых погодных условий. Сравнительный анализ вычислительной эффективности показывает, что предлагаемый конвейер фильтрации с O(n) обеспечивает преимущество перед традиционным подходом с отложенной фильтрацией (O(n log n)). Время обработки суточного массива (10000 записей) сокращено с 12,4 с до 3,1 с (на стенде с 32 ГБ ОЗУ и 4-ядерным процессором). Следует признать ограничения текущей реализации: чувствительность к виду аппроксимирующих функций (для негауссовых процессов требуется использование обобщённых распределений), падение точности при τ>48 часов (автокорреляция rX(τ) падает ниже 0,5). Текущая реализация ориентирована на оперативное управление (горизонт до 2 суток).
5. Заключение
В работе представлена концептуальная модель аналитической ГИС для оценки георисков, ключевыми элементами которой являются:
1) компонент обработки разнородных данных с алгоритмом фильтрации и сокращения избыточной информации (вычислительная сложность O(n), время обработки сокращено в 4,0 раза);
2) распределённая база данных с топологией на основе рекурсивной декомпозиции, обеспечивающая семантическую согласованность гетерогенных источников;
3) модуль оценки рисков на основе параметрической модели, вычисляющей вероятность выхода природного процесса за допустимые пределы и определяющей точку устойчивого управления (адаптивный порог принятия решений).
Новизна предложенного решения заключается не в отдельных компонентах (большинство из которых известны), а в оригинальной организации их взаимодействия, обеспечивающей семантическую интеграцию, вычислительную эффективность и адаптивность к меняющимся условиям. Разработанная модель может использоваться в специализированных системах, работающих с разнородными пространственными данными, и позволяет усовершенствовать процесс их обработки за счёт улучшения методов интеграции . Эффективность подтверждена снижением затрат на 18,7% (95% ДИ [16,2%; 21,3%]) при зимнем содержании дорог. Дальнейшие исследования — интеграция методов машинного обучения для подбора аппроксимирующих функций и расширение топологии потоковыми данными.
