Detailansicht
Political leaning prediction of newspaper articles
Benedikt Köhler
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Wirtschaftsinformatik
Betreuer*in
Benjamin Roth
DOI
10.25365/thesis.78499
URN
urn:nbn:at:at-ubw:1-14360.82777.827343-8
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Extremismus, unabhängig davon, ob er aus dem linken oder rechten politischen Spektrum stammt, ist zu einer ernsthaften Herausforderung geworden, mit der viele Länder weltweit zu kämpfen haben. Dies ist unter anderem auch beeinflusst durch meinungsbildender Berichterstattung. Insbesondere Krisen wie die Finanzkrise 2008, Corona oder der jüngste Krieg zwischen der Ukraine und Russland scheinen einen enormen Einfluss auf die politisch motivierte Berichterstattung zu haben. [Peterson and Allamong, 2022] Diese Arbeit untersucht, wie man mithilfe von Natural Language Processing (NLP) die politische Ausrichtung eines Nachrichtenartikels vorhersagen kann. Wir fragen uns dabei, wie können wir NLP und Pre-trained Language Models nutzen, um die politische Ausrichtung von Zeitungsartikeln zu erkennen? Und wie können wir die Vorhersagen optimieren? Wir wenden dabei die Methode der Weak Supervision mit Cross-Validation an. Durch den Einsatz von Pre-trained Language Models wie DistilBERT und einer innovativen Anpassung von Label Gewichtungen während des Trainings, versuchen wir die Genauigkeit unseres Modelles zu verbessern. Durch eine Reihe von verschiedenen Experimenten zeigen wir, dass sich mit unserem Ansatz - Label während des Trainings eine Gewichtung mitzugeben - die Genauigkeit eines Modells verbessern kann. Zeitgleich zeigen wir auch auf, dass man mit unserem Ansatz schnell auf Schwierigkeiten mit Rechenressourcen treffen kann. Dementsprechend kann die Arbeit ein Grundstein für weitere Forschungsarbeiten im Zusammenhang von politischer Ausrichtungserkennung der Nachrichtenartikel bilden, basierend auf Weak Supervision und Cross-Validierungsmethoden. In dieser Arbeit wird dargestellt, dass wenn man gewichtete Labels während des Trainings nutzen möchte, aussagekräftigere Gewichtungen zu besseren Erfolgen führen, als wenn man Gewichtungen nutzt, die sich sehr ähnlich sind. Dies haben wir durch das Anwenden von k-fold Cross Validierungsmethoden herausgefunden, bei welchen wir die Validierungsscores für die Artikel im ausgelassenen k-fold als Gewichtung für die Labels genutzt haben und diese bei einem finalen Training angewendet haben. Nachdem wir die Gewichtungen aussagekräftiger gemacht haben und zum Beispiel dadurch, dass wir die minimalste errechnete Gewichtung auf 0%, die maximalst errechnete Gewichtung auf 100% gesetzt haben und alles zwischendrin proportional angepasst haben, haben wir die besten Resultate erhalten. Mit einem anderen Experiment (Leave-one-out), welches als Fold einen kompletten Nachrichtenverlag genutzt hat, haben wir weniger gute Resultate erhalten und lagen sogar deutlich unter unserer Pre-Trained Language Model Baseline. Dies könnte darauf zurückzuführen sein, dass unserer Datensatz eine sehr große Varianz an totalen Nachrichtenartikeln pro Nachrichtenverlag aufweist. Zusammenfassend konnten wir feststellen, dass es noch viel Potenzial gibt, um die politische Ausrichtungserkennung zu verbessern und dass der Einsatz von Pre-Trained Language Models in jedem Fall einen deutlichen Vorteil bringt im Vergleich zu anderen Methoden wie zum Beispiel Logistic Regression. Zudem können durch weitere Methoden, wie beispielsweise das Anpassen von Gewichtung pro Label, die Modelle noch weiter verbessert werden.
Abstract
(Englisch)
Political extremism, whether it is of far-left or far-right ideology, has become a critical issue faced by many countries worldwide. This, of course, is also the result of opinion-forming media coverage. Especially crises like the financial crisis in 2008, Corona or the recent Ukraine-Russia war seem to have an enormous influence on political motivated news coverage.[Peterson and Allamong, 2022] This thesis looks at using advanced natural language processing (NLP) techniques to predict the political biases in newspaper articles. How can we make use of NLP and pre-trained language models to detect the political leaning of news paper articles? And how can we optimize the prediction? To answer these research questions, we focus on a weak supervision approach and cross-validation methods to enhance prediction accuracy. With the help of pre-trained language models like DistilBERT, combined with innovative weight adjustment strategies, we aim at improving the classification of political leanings. Our research focuses on issues such as the different ways political language is used by various news outlets and the necessity of efficient computing methods. With the help of several experiments, we show that our approach of adding weight to labels can improve the classification accuracy of a model. At the same time, we also show that our approach can quickly address difficulties with computing resources, because of very resource intensive algorithms. Therefore, this work sets the foundation for further development in this area which can lead to more reliable and efficient automated systems for political leaning detection. This research shows that if you want to use weighted labels during training, more meaningful weights lead to better results than weights that are very similar. We found this by applying k-fold cross-validation methods, from which we used the validation scores for the articles in the left-out k-fold as weights for the labels and applied them to a final training. After making the weights more meaningful, for example by setting the minimum calculated weight to 0%, the maximum calculated weight to 100% and adjusting everything in between proportionally, we obtained the best results. With another experiment (leave-one-out), which used a complete news publisher as a fold, we obtained less good results and were even significantly below our pre-trained language model baseline. This could be due to the fact that our dataset has a very large variance in total news articles per news publisher. We found that there is still a lot of potential to improve political orientation detection and that the use of pre-trained language models offers a clear advantage over other methods such as logistic regression.
Schlagwörter
Schlagwörter
(Deutsch)
Politsche Ausrichtunserkennung Weak Supervision Machine Learning für Politische Nachrichtenartikel
Schlagwörter
(Englisch)
Political stance detection Prediction of political newspaper articles Machine Learning for political articles
Autor*innen
Benedikt Köhler
Haupttitel (Englisch)
Political leaning prediction of newspaper articles
Publikationsjahr
2025
Umfangsangabe
vi, 51 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Benjamin Roth
Klassifikation
54 Informatik > 54.74 Maschinelles Sehen
AC Nummer
AC17548251
Utheses ID
75559
Studienkennzahl
UA | 066 | 926 | |
