ARCHITECTURE OF AN ANALYTICAL GIS FOR GEO-RISK ASSESSMENT: A COMPONENT-BASED APPROACH TO HETEROGENEOUS DATA PROCESSING

Research article
  • Федорович Владимир ФедоровичРоссийский государственный гидрометеорологический университет, Санкт-Петербург, Российская Федерация
  • Кондратенков Илья СергеевичРосатом, Санкт-Петербург, Российская Федерация
  • Истомин Евгений Петрович0000-0002-2203-4063Российский государственный гидрометеорологический университет, Санкт-Петербург, Российская Федерация
https://doi.org/10.60797/GEO.2026.8.4
DOI:
https://doi.org/10.60797/GEO.2026.8.4
EDN:
IWHNIF
Suggested:
27.05.2026
Accepted:
04.08.2026
Published:
13.08.2026
Issue: № 3 (8), 2026
Issue: № 3 (8), 2026
Rightholder:authors.
License:Attribution 4.0 International (CC BY 4.0)
40
0
XML
PDF

Abstract

The article addresses the problem of building analytical geographic information systems (GIS) for geo-risk assessment under conditions of increasing heterogeneity of spatially distributed data. As noted in recent studies, the volume of information available for analysis is growing by orders of magnitude faster than computing power, which necessitates the creation of new models. An original conceptual modular architecture is proposed, incorporating three key innovations: a heterogeneous data processing component, a distributed database with a topology based on recursive decomposition, and a risk assessment module based on a parametric model. The developed architecture was tested on the example of winter road maintenance management. Numerical modeling results confirming the effectiveness of the proposed solutions are presented.

1. Введение

Одной из тенденций последнего десятилетия в исследованиях стал комплексный подход к обработке данных: совместное использование данных различных инструментов, в том числе различных источников данных

. Объединение данных различного происхождения для последующих совместного анализа содержит разнородные данные, представляемые различными форматами, структурами и реализуемыми на разнотипных платформах
. Основными факторами разнородности данных и их источников являются: различные типы данных, различная природа данных (числовые массивы, тексты, видеоданные), различные типы (модели) баз данных — реляционные, иерархические, объектно-ориентированные, различия в степени распределенности систем хранения, различная степень достоверности и точности данных
. Синтаксическая разнородность данных обусловлена различными типами данных, форматами их хранения, допустимыми значениями, единицами измерения; структурная разнородность — различными моделями данных; семантическая разнородность проявляется в виде несоответствий в способах отображения одних и тех же объектов
.

В существующей практике выделяют три уровня разнородности данных: синтаксический (различия в типах и форматах), структурный (различия в моделях данных) и семантический (различия в интерпретации одних и тех же сущностей в разных предметных областях)

. Преодоление семантического разрыва требует не просто конвертации форматов, а построения отображений между различными концептуальными схемами, что является нетривиальной задачей, особенно в геопространственном контексте.

Экономическая и социальная деятельность человека находится в постоянной взаимосвязи с природными, в том числе гидрометеорологическими условиями

. Современная теория принятия индивидуальных решений построена на модели ожидаемой полезности, в которой одним из ключевых компонентов является присутствие случайного фактора (неопределенности относительно будущих событий). Погодо-хозяйственное решение, учитывающее влияние погодных факторов на экономическую деятельность, содержит неопределенность в отношении реализации состояния погоды, на которую оно было ориентировано
. В работах
,
,
показано, что классические подходы, основанные на физическом моделировании гидрометеорологических процессов, не всегда позволяют получить приемлемую точность прогноза в условиях ограниченной априорной информации.

Таким образом, актуальная научно-техническая проблема заключается в разработке такой архитектуры аналитической ГИС, которая обеспечивала бы:

1) семантически корректную интеграцию разнородных источников без потери информации;

2) эффективное распределённое хранение с поддержкой сложных пространственных запросов;

3) встроенный модуль оценки георисков с возможностью адаптивной настройки пороговых значений.

Цель работы — разработка концептуальной модели аналитической ГИС с тремя ключевыми нововведениями.

2. Методы и принципы исследования

Для обоснования предлагаемых архитектурных решений был проведён систематический анализ существующих аналитических ГИС и систем поддержки принятия решений, работающих с гетерогенными геоданными. Были рассмотрены механизмы доступа к данным ODBC, OLE DB, ADO, BDE, JDBC. Как показал анализ, ни один из них не может в полной мере удовлетворить требованиям прикладных задач использования распределённых вычислительных систем обработки разнородных геоданных

. В качестве эмпирической базы использовались массивы метеорологических данных по Санкт-Петербургу за отопительные сезоны 2013–2018 гг., предоставленные ВНИИГМИ-МЦД и Северо-Западным УГМС. Формирование единой базы статистических данных является необходимым условием обеспечения точности любого расчета
. Данные для геокодирования были предоставлены в разнородных форматах: txt и xls. Для апробации привлекались теплотехнические характеристики теплоэлектроцентралей Санкт-Петербурга и нормативные документы по зимнему содержанию дорог.

Методологическую основу составили: теория интеграции гетерогенных баз данных

, методы рекурсивной декомпозиции источников данных для построения унифицированного семантического слоя, аппарат теории вероятностей и математической статистики для оценки рисков, а также принципы сервис-ориентированной архитектуры (SOA) для обеспечения модульности и расширяемости системы
. Разработка технологии и программной реализации консолидации разнородной информации из различных источников потребовала ответов: как решить проблему слияния данных из распределённых источников, как идентифицировать данные об одном объекте в разных БД, какой должна быть архитектура
. При разработке параметрической модели использовалась концепция точки устойчивого управления
.

Для проверки стационарности и нормальности распределения временных рядов использовались соответственно t-критерий Стьюдента и критерий Шапиро–Уилка. Автокорреляционная функция вычислялась для определения максимального горизонта прогноза. Параметрическая настройка модели риска выполнялась численным методом с использованием функции Ламберта для решения трансцендентного уравнения.

3. Результаты исследования и их обсуждение

Модель подготовки разнородных данных разрабатывалась с учётом выявленных проблем интеграции. Обработка разнородной информации в единой системе позволяет получать расширенную статистику

. Предлагаемая архитектура представляет собой совокупность шести взаимодействующих модулей, объединённых сервисной шиной данных. Новизна предложенного решения заключается не в отдельных компонентах (большинство из которых известны), а в оригинальной организации их взаимодействия. Подробно рассмотрим три инновационных компонента, определяющих новизну разработанного подхода.

Компонент обработки разнородных данных. В новой архитектуре модуль запросов представляет собой взаимосвязь базы метаданных, которая хранит драйверы доступа к разнородным данным, с модулем интеграции. Задача модуля запросов — сравнить расширение подгружаемого файла с расширениями в таблице. Если в таблице нет точного совпадения расширения, модуль отправляет информацию в планировщик, который оповещает систему сообщением «Формат не распознан!». Если совпадение найдено, модуль отправляет информацию в планировщик, и планировщик отправляет информацию в модуль интеграции. Особенность модуля интеграции заключается в сведении известных драйверов доступа к базам данных в единую автоматизированную информационную систему интегрирования разнородных источников данных, что минимизирует участие человека

. Встроенная процедура фильтрации: пользователь задаёт критерий βij, и из массива извлекаются только существенные поля. Математическая обработка данных задается условием: Vi = min Σ αij при условии αij = βij, где βij — критерий определения признаков искомой информации. Если αij ≠ βij, то условие считается невыполненным, и элементы удаляются; если αij = βij — сохраняются
. Это сокращает объём информации на порядки. Время обработки tобщ = ΣVi / q, где q — пропускная способность канала. Предлагаемый конвейер фильтрации с доказанной вычислительной эффективностью O(n) обеспечивает преимущество перед традиционным подходом с отложенной фильтрацией (O(n log n) при использовании индексов B-tree).

Распределённые базы данных с новой топологией. В отличие от классических решений, предложенная топология базируется на принципе виртуальной интегрированной базы данных с рекурсивной декомпозицией. Как показано в работах по созданию систем комплексного моделирования

, для решения поставленной задачи целесообразно привлечение сервис-ориентированной архитектуры (SOA), так как она в наибольшей степени подходит для реализации функций интеграции распределённых информационных ресурсов. Основными принципами такой архитектуры являются: интеграция разнородных данных, использование подсистем интеллектуального выбора моделей, создание геоинформационных сервисов для визуализации результатов и автоматический режим выполнения полного рабочего цикла
. Каждый источник данных представляется в виде многоуровневой структуры пар «атрибут — подчинённый источник». Формально, пусть S = {S₁, S₂, …, Sk} — множество источников. Для каждого источника Si определяется рекурсивная функция разбиения D(Si) = {(a₁, D(Si1)), (a₂, D(Si2)), …, (ap, D(Sip))}, где aj — атрибут, а Sij — подчинённый источник. Базовым случаем является неделимый элемент данных. Промежуточные уровни играют роль метаданных, описывающих связи, ограничения целостности и допустимые операции. Целостность данных является неотъемлемым свойством базы данных, и ее обеспечение — важнейшая задача проектирования. Целостность описывается набором ограничений целостности — утверждений о допустимых значениях и связях
. Для пространственных данных используется PostgreSQL с расширением PostGIS, для неструктурированных — MongoDB. Связи между геометрическими объектами и атрибутами реализованы через уникальные идентификаторы и пространственные индексы, что обеспечивает высокую скорость выполнения пространственных запросов.

Модуль оценки рисков на основе параметрической модели. В условиях неопределённости используются критерии Вальда, максимакса, Сэвиджа и байесовский подход. В модуле матрица сопряжённости прогнозов и факта позволяет рассчитать условные вероятности qij осуществления фазы погоды Фi при известном прогнозе Пj

. Риск R(tз) на момент времени tз определяется как вероятность выхода природного процесса X(t) из заданной области C: Rtз = P(X(t) ∉ C, tз). При условии стационарности, эргодичности и нормальности распределения процесса используется аналитическая оценка (1).

(1)

Пользователь (ЛПР) задаёт управляемый параметр C. Функция относительного ущерба I(C)=U(C)/Umax аппроксимируется линейной зависимостью I(C) = a·C + b. Точка устойчивого управления C0 находится из пересечения экспоненциальной функции риска R(C) ≈ exp(−α·C) и линейной функции ущерба (2).

(2)

где W — функция Ламберта. В модуле реализован итерационный численный алгоритм поиска C0 (метод Ньютона–Рафсона с точностью ε = 10⁻⁶), а также блок оценки качества прогноза (апостериорный анализ матриц сопряжённости прогнозируемых и фактических значений с вычислением критерия Пирсона χ²)

.

Апробация на примере управления зимним содержанием дорог. Как отмечено в геологических исследованиях

, на устойчивость дорог влияют глубина промерзания грунтов, рельеф и гидрогеология. Неблагоприятные геологические процессы и явления, происходящие на участке строительства, как правило, связаны с игнорированием проектировщиками и строителями природных особенностей данного участка
. Использованы ежедневные измерения снега в Санкт-Петербурге (n=540). Проверка на стационарность (t-критерий, p=0,073>0,05) и нормальность (критерий Шапиро–Уилка, W=0,962, p=0,11) подтверждены. Параметры: mX=14,2 см, σX=5,4 см, rX(24ч)=0,78. Функция риска R=e−0,12C (R²=0,94), функция затрат I=0,04C+0,1 (R²=0,96). Решение дало C0=6,2 см – начинать сплошную очистку при снеге >6 см. Для оценки экономического эффекта сравнивались два сценария:

1) фиксированный регламент: очистка каждые 6 часов (порог 3 см);

2) адаптивный регламент: очистка при превышении C0=6,2 см.

Расчёт затрат выполнялся по формуле: Z = Nвыходов·(Cтопливо + Cреагенты + Cамортизация) + Cштраф·Pпревышения. Для проверки устойчивости результата выполнен бутстреп-анализ (1000 итераций с возвращением): 95% доверительный интервал для экономии составил [16,2%; 21,3%], что подтверждает статистическую значимость результата. Экономический эффект — снижение затрат на 18,7% (таблица 1).

Таблица 1 - Сравнение показателей эффективности управления зимним содержанием дорог

Примечание: на примере участка 10 км за один снегопад; составлено авторами по результатам имитационного моделирования

Показатель

Фиксированный регламент

Предлагаемый параметрический регламент

Порог срабатывания, см

3 (время 6 ч)

6,2 (адаптивный)

Количество выходов техники

4

2–3 (в зависимости от интенсивности)

Расход реагентов, кг/м²

2,1

1,4

Суммарные затраты, тыс. руб.

124,5

101,3

Вероятность превышения допустимой толщины (>8 см)

0,12

0,09

4. Обсуждение

Предложенная архитектура имеет преимущества перед известными аналогами (Geo-Status, ГИС ИВТ СО РАН). Как показано в работе

, модульная архитектура ГИС может включать модули сбора, хранения, обработки, интеллектуального анализа, управления метаданными и визуализации, каждый из которых взаимодействует через программные интерфейсы, обеспечивая комплексный исследовательский процесс. Модуль сбора данных используется в качестве интерфейса для загрузки «сырых» данных; модуль хранения обеспечивает управление данными на всех уровнях; модуль обработки конвертирует данные из различных источников
. В отличие от указанных систем, наш подход не требует предварительной конвертации всех данных в единый формат и работает с неструктурированными источниками. Применение многофазового погодо-хозяйственного регламента, рассмотренного в
, позволяет потребителю гидрометеорологической информации эффективно управлять экономико-метеорологическими рисками и предоставляет выбор оперативных решений с учетом вероятности осуществления ожидаемых погодных условий. Сравнительный анализ вычислительной эффективности показывает, что предлагаемый конвейер фильтрации с O(n) обеспечивает преимущество перед традиционным подходом с отложенной фильтрацией (O(n log n)). Время обработки суточного массива (10000 записей) сокращено с 12,4 с до 3,1 с (на стенде с 32 ГБ ОЗУ и 4-ядерным процессором). Следует признать ограничения текущей реализации: чувствительность к виду аппроксимирующих функций (для негауссовых процессов требуется использование обобщённых распределений), падение точности при τ>48 часов (автокорреляция rX(τ) падает ниже 0,5). Текущая реализация ориентирована на оперативное управление (горизонт до 2 суток).

5. Заключение

В работе представлена концептуальная модель аналитической ГИС для оценки георисков, ключевыми элементами которой являются:

1) компонент обработки разнородных данных с алгоритмом фильтрации и сокращения избыточной информации (вычислительная сложность O(n), время обработки сокращено в 4,0 раза);

2) распределённая база данных с топологией на основе рекурсивной декомпозиции, обеспечивающая семантическую согласованность гетерогенных источников;

3) модуль оценки рисков на основе параметрической модели, вычисляющей вероятность выхода природного процесса за допустимые пределы и определяющей точку устойчивого управления (адаптивный порог принятия решений).

Новизна предложенного решения заключается не в отдельных компонентах (большинство из которых известны), а в оригинальной организации их взаимодействия, обеспечивающей семантическую интеграцию, вычислительную эффективность и адаптивность к меняющимся условиям. Разработанная модель может использоваться в специализированных системах, работающих с разнородными пространственными данными, и позволяет усовершенствовать процесс их обработки за счёт улучшения методов интеграции

. Эффективность подтверждена снижением затрат на 18,7% (95% ДИ [16,2%; 21,3%]) при зимнем содержании дорог. Дальнейшие исследования — интеграция методов машинного обучения для подбора аппроксимирующих функций и расширение топологии потоковыми данными.

Article metrics

Views:40
Downloads:0
Views
Total:
Views:40