Оптимізація структури гетерогенних даних в Big Data
Loading...
Date
Authors
Кириченко, Євген Олександрович
Journal Title
Journal ISSN
Volume Title
Publisher
Чернівецький національний університет імені Юрія Федьковича
DOI
Abstract
Дисертаційна робота присвячена розробленню та практичній реалізації інформаційної технології оптимізації структури гетерогенних даних у Big Data шляхом побудови типо-орієнтованих компактних представлень табличних наборів даних, використання зваженої метрики структурної подібності та формування графових і деревоподібних структур подібності, що дозволяє підвищити ефективність порівняння, класифікації та організації великих корпусів даних за умов невідомої або слабо документованої схеми. У роботі здійснено аналіз існуючих підходів до порівняння гетерогенних табличних наборів даних та виявлено їх обмеження щодо роботи з різнотипними змінними, великими обсягами даних і відсутністю повної інформації про джерела. Запропоновано та реалізовано уніфікований типо-орієнтований підхід конструювання компактних представлень даних для числових, категоріальних, часових і текстових змінних, що забезпечило збереження інформативних статистичних і структурних характеристик без необхідності зберігання або передачі повних наборів записів. Розроблено нову зважену метрику структурної подібності даних, яка ґрунтується на агрегуванні відстаней Геллінґера, Вассерштейна, повної варіації, L1/L2, а також показників MAE/MAPE для числових зведень, що дало змогу забезпечити обґрунтоване порівняння характеристик гетерогенних змінних у межах єдиного підходу. Удосконалено підхід до кластеризації гетерогенних даних на основі компактних представлень і матриць суміжності із застосуванням спектрального аналізу стохастичних матриць, що забезпечило стійкість до шуму та підвищило масштабованість аналізу. Крім того, розроблено хмарну масштабовану архітектуру інформаційної системи на базі Apache Spark, AWS S3, Glue, Athena та Airflow для розподіленої побудови компактних представлень, зберігання, обробки та аналітичного опрацювання великих корпусів табличних даних. Експериментальні дослідження підтвердили зменшення обсягів даних для зберігання і передачі, а також прискорення обробки приблизно на 40–60 % порівняно з традиційними підходами повного сканування таблиць. Отримані результати можуть бути застосовані в інформаційних системах аналізу великих даних, хмарних аналітичних платформах, системах штучного інтелекту, машинного навчання, кластерного аналізу та програмних комплексах підтримки прийняття рішень.
Description
Citation
Кириченко Є. О. Оптимізація структури гетерогенних даних в Big Data. – Кваліфікаційна наукова праця на правах рукопису. Дисертація на здобуття наукового ступеня доктора філософії за спеціальністю 121 – «Інженерія програмного забезпечення» – Чернівецький національний університет імені Юрія Федьковича, Чернівці, 2026.