Оптимізація структури гетерогенних даних в Big Data

dc.contributor.authorКириченко, Євген Олександрович
dc.date.accessioned2026-03-29T18:13:17Z
dc.date.available2026-03-29T18:13:17Z
dc.date.issued2026-03-29
dc.description.abstractДисертаційна робота присвячена розробленню та практичній реалізації інформаційної технології оптимізації структури гетерогенних даних у Big Data шляхом побудови типо-орієнтованих компактних представлень табличних наборів даних, використання зваженої метрики структурної подібності та формування графових і деревоподібних структур подібності, що дозволяє підвищити ефективність порівняння, класифікації та організації великих корпусів даних за умов невідомої або слабо документованої схеми. У роботі здійснено аналіз існуючих підходів до порівняння гетерогенних табличних наборів даних та виявлено їх обмеження щодо роботи з різнотипними змінними, великими обсягами даних і відсутністю повної інформації про джерела. Запропоновано та реалізовано уніфікований типо-орієнтований підхід конструювання компактних представлень даних для числових, категоріальних, часових і текстових змінних, що забезпечило збереження інформативних статистичних і структурних характеристик без необхідності зберігання або передачі повних наборів записів. Розроблено нову зважену метрику структурної подібності даних, яка ґрунтується на агрегуванні відстаней Геллінґера, Вассерштейна, повної варіації, L1/L2, а також показників MAE/MAPE для числових зведень, що дало змогу забезпечити обґрунтоване порівняння характеристик гетерогенних змінних у межах єдиного підходу. Удосконалено підхід до кластеризації гетерогенних даних на основі компактних представлень і матриць суміжності із застосуванням спектрального аналізу стохастичних матриць, що забезпечило стійкість до шуму та підвищило масштабованість аналізу. Крім того, розроблено хмарну масштабовану архітектуру інформаційної системи на базі Apache Spark, AWS S3, Glue, Athena та Airflow для розподіленої побудови компактних представлень, зберігання, обробки та аналітичного опрацювання великих корпусів табличних даних. Експериментальні дослідження підтвердили зменшення обсягів даних для зберігання і передачі, а також прискорення обробки приблизно на 40–60 % порівняно з традиційними підходами повного сканування таблиць. Отримані результати можуть бути застосовані в інформаційних системах аналізу великих даних, хмарних аналітичних платформах, системах штучного інтелекту, машинного навчання, кластерного аналізу та програмних комплексах підтримки прийняття рішень.
dc.identifier.citationКириченко Є. О. Оптимізація структури гетерогенних даних в Big Data. – Кваліфікаційна наукова праця на правах рукопису. Дисертація на здобуття наукового ступеня доктора філософії за спеціальністю 121 – «Інженерія програмного забезпечення» – Чернівецький національний університет імені Юрія Федьковича, Чернівці, 2026.
dc.identifier.urihttps://archer.chnu.edu.ua/xmlui/handle/123456789/14244
dc.publisherЧернівецький національний університет імені Юрія Федьковича
dc.subjectнабори даних
dc.subjectмодель
dc.subjectмоделювання
dc.subjectкласифікація
dc.subjectточність
dc.subjectмашинне навчання
dc.subjectаналіз даних
dc.subjectштучний інтелект
dc.subjectінформаційні технології / системи
dc.subjectпрограмне забезпечення
dc.subjectпрограмна система
dc.subjectнейронні мережі
dc.subjectPython
dc.subjectхмарна платформа
dc.subjectкластерний аналіз
dc.titleОптимізація структури гетерогенних даних в Big Datauk_UA
dc.typeThesis

Files

Original bundle

Now showing 1 - 2 of 2
Loading...
Thumbnail Image
Name:
дисертаційне дослідження Кириченко Є.О. (2).pdf
Size:
5.87 MB
Format:
Adobe Portable Document Format
Description:
Loading...
Thumbnail Image
Name:
дисертаційне дослідження Кириченко Є.О._Validation_Report (1).pdf
Size:
49.75 KB
Format:
Adobe Portable Document Format
Description:

License bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
license.txt
Size:
1.8 KB
Format:
Item-specific license agreed upon to submission
Description: