Detailansicht
Introducing spatial heterogeneity via regionalization methods in machine learning models for geographical prediction
a spatially conscious paradigm.
Lukas Bögl
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Geowissenschaften, Geographie und Astronomie
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Kartographie und Geoinformation
Betreuer*in
Ourania Kounadi
DOI
10.25365/thesis.76859
URN
urn:nbn:at:at-ubw:1-25179.11792.652160-6
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
In den letzten Jahren haben sich die Fähigkeiten von Modellen des maschinellen Lernens rasant verbessert. Diese Arbeit zielt darauf ab, einen neuartigen Ansatz für Vorhersa- gemodelle vorzustellen, wodurch diese in der Lage sind, räumliche Heterogenität zu berücksichtigen, sowie verschiedene Ansätze zur Lösung dieses Problems zu bewerten. Dies geschieht durch die Inklusion von Regionalisierungsmethoden in einem Vorverarbei- tungsschritt des praktischen Teils dieser Arbeit. Es werden fünf verschiedene Region- alisierungsmethoden getestet: WARD, AZP, KMEANS, SKATER und MAXP, die auf zwei Datensätze unterschiedlicher Größe angewandt werden, was ein weiterer interess- anter Aspekt dieser Untersuchung ist. Der verwendete Datensatz ist das „California Housing Dataset“, die abhängige Variable ist der Median des Immobilienpreises in einem Gebiet. Der vorgeschlagene Ansatz wird als RegRF bezeichnet, der sich in drei Model- lierungsstrategien unterteilen lässt: RegRF_CN, RegRF_SEP, und RegRF_CN-W. Die erste Strategie, RegRF_CN, ist ein herkömmlicher Random Forest mit dem Zusatz, dass die Regionsnummer als zusätzliche unabhängige Variable verwendet wird. RegRF_SEP erstellt für jede Region ein separates Modell, das nur die Daten aus dieser Region verwen- det. RegRF_CN-W ist eine Mischung aus beiden Ansätzen: Es wird für jede Region ein eigenes Modell erstellt, wobei jedoch alle Trainingsdaten der anderen Regionen verwendet werden. Die Regionenspezifität ergibt sich daraus, dass die Trainingsdaten aus der Region, für die das Modell trainiert wird, stärker gewichtet werden. Die Gewichtung hängt von der Größe der Region ab, was bedeutet, dass größere Regionen stärker gewichtet werden. RegRF wird mit drei etablierten vorhersagenden Modellierungsmethoden verglichen: Ran- dom Forest, Geographically Weighted Regression und Geographically Weighted Random Forest. Die Implementierung von RegRF hat gezeigt, dass es die Leistung der Vorhersa- gemodelle im Vergleich zu „nicht-räumlichen“ Random-Forest-Modellen erheblich steigern kann (zwischen 5% und 18% Steigerung der R2-Werte), während die Berechnung nur wenige Sekunden länger dauert. In einigen Szenarien konnte RegRF mit der bewährten Geographically Weighted Regression konkurrieren (zwischen 1% besser und 4% schlechter, je nach Situation, gemessen an den R2-Werten), während es nur einen Bruchteil des Rechenaufwands erforderte. Der dritte Ansatz, Geographically Weighted Random Forest, konnte bei der Modellierung des kleineren Datensatzes nicht übertroffen werden (zwischen 1% und 7% schlechtere R2-Werte), aber in dieser Arbeit war diese Methode nicht in der Lage, die Berechnungen für den größeren Datensatz abzuschließen. Diese Ergebnisse zeigen deutlich, dass die Leistung von Modellen des maschinellen Lernens gesteigert werden kann, wenn räumliche Phänomene berücksichtigt werden. In Anbetracht der Tatsache, dass RegRF nicht explizit für die vorliegenden Daten optimiert ist, sind weitere Verbesserungen hinsichtlich seiner Leistung möglich.
Abstract
(Englisch)
Recent years have seen a rapid increase in the capabilities of machine learning models. In this realm, this thesis aims to present a novel approach for predictive modeling which is able to take spatial heterogeneity into account, as well as evaluate various approaches to solving this problem. This is done by introducing regionalization methods in a preprocessing step of the practical workflow. Five different regionalizaton methods are tested: WARD, AZP, KMEANS, SKATER, and MAXP, which are applied to two datasets of varying size, which is another aspect of interest to this research. The dataset in use is the "California Housing Dataset", and the dependent variable is the median house price in an area. The proposed approach is termed RegRF, which can be further divided into three modeling strategies: RegRF_CN, RegRF_SEP, and RegRF_CN-W. The first strategy, RegRF_CN, is a conventional Random Forest with the addition of using the region number as an additional independent variable. RegRF_SEP creates a separate model for each region, that uses only the data from that region. RegRF_CN-W is a mix of both approaches: It creates a separate model for each region, but with the distinction that it uses all of the training data from the other regions. The region-specifity stems from putting more weight on the training data from the region the model is being trained for. The weight depends on the size of the region, meaning that bigger regions will be weighted more heavily. RegRF is compared to three established predictive modeling methods: Random Forest, Geographically Weighted Regression, and Geographically Weighted Random Forest. The implementation of RegRF has shown its ability to significantly increase the performance of the predictive models in comparison to "non-spatial" Random Forest models (between 5% and 18% increase in R2 values), while only taking a few seconds longer to compute. In some scenarios, RegRF was able to compete with the well established Geographically Weighted Regression (between 1% better and 4% worse judging from the R2 values, depending on the situation), while only requiring a fraction of the computational effort. The third approach, Geographically Weighted Random Forest, was not able to be outperformed when modeling the smaller dataset (between 1% and 7% decrease in R2 values), but in this work this method was not able to finish computation for the larger scale dataset. These results clearly show the potential for the performance of machine learning models to increase when taking spatial phenomena into account. Given the fact that RegRF is not explicitly optimized for the data at hand, further improvements regarding its performance are possible.
Schlagwörter
Schlagwörter
(Deutsch)
räumliche heterogenität regionalisierung räumliches clustering geographische modellierung maschinelles lernen
Schlagwörter
(Englisch)
spatial heterogeneity regionalization spatial clustering geographical modelling machine learning
Autor*innen
Lukas Bögl
Haupttitel (Englisch)
Introducing spatial heterogeneity via regionalization methods in machine learning models for geographical prediction
Hauptuntertitel (Englisch)
a spatially conscious paradigm.
Publikationsjahr
2024
Umfangsangabe
xi, 161 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Ourania Kounadi
Klassifikationen
54 Informatik > 54.80 Angewandte Informatik ,
74 Geographie > 74.48 Geoinformationssysteme
AC Nummer
AC17347407
Utheses ID
72151
Studienkennzahl
UA | 066 | 856 | |
