Detailansicht

Leveraging large language models to identify disinformation on Mastodon
Artur Khaialiev
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Informatik
Betreuer*in
Peter Reichl
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.80249
URN
urn:nbn:at:at-ubw:1-28519.29310.948776-3
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Desinformation in sozialen Medien ist ein wachsendes Problem, aber ihre Erkennung auf dezentralen Plattformen wie Mastodon ist besonders herausfordernd. Im Gegensatz zu zentralisierten Netzwerken, bei denen ein Unternehmen die Moderation kontrolliert, besteht Mastodon aus Tausenden unabhängiger Server, was die Implementierung konsistenter Erkennungssysteme erschwert. Ziel dieser Masterarbeit ist es zu untersuchen, wie Large Language Models (LLMs) Desinformation auf Mastodon identifizieren können, mit Schwerpunkt auf dem Vergleich der Leistung verschiedener Modelle bei denselben Daten. Diese Studie implementiert einen föderierten Feed-Parser zur Erfassung von Beiträgen mehrerer Mastodon-Server in Echtzeit unter Verwendung des ActivityPub-Protokolls. Der Erkennungsansatz kombiniert Inhaltsanalyse mit verhaltensbasierten Heuristiken, die auf Kontomerkmalen wie Kontoalter, Follower-Anzahl und Posting-Mustern basieren. Diese Heuristiken dienen als Vorfilter-Mechanismus, um das Volumen der Inhalte zu reduzieren, die eine kostspielige LLM-Analyse erfordern, wodurch der Ansatz für ressourcenbeschränkte Instanzen praktikabel wird. Der Hauptbeitrag dieser Arbeit ist eine systematische vergleichende Analyse von vier hochmodernen LLM-Architekturen: OpenAIs GPT-4o-mini, Anthropics Claude Sonnet 4, Googles Gemini 2.5 Flash Lite und Metas Llama 3.3 70B, die anhand identischer Mastodon-Datensätze aus der öffentlichen föderierten Timeline evaluiert wurden. Jedes Modell analysiert dieselben markierten Beiträge und liefert Konfidenzwerte sowie Klassifizierungsentscheidungen, was einen direkten Vergleich ihrer Ausgaben ermöglicht. Dieser Multi-Modell-Ansatz zeigt, wie verschiedene LLMs denselben Inhalt interpretieren, und identifiziert Muster in ihrer Übereinstimmung und Uneinigkeit. Die Ergebnisse zeigen eine erhebliche Übereinstimmung zwischen den Modellen, wobei die meisten Beiträge konsistente Klassifizierungen über alle vier Modelle hinweg erhalten. Der verhaltensbasierte Filteransatz reduzierte die Analysearbeitslast erheblich, obwohl diese Studie ohne Ground-Truth-Labels die Modellkonsistenz statt der Erkennungsgenauigkeit misst. Wichtig ist, dass dieses System als Entscheidungsunterstützungswerkzeug konzipiert ist, um menschliche Moderatoren zu unterstützen, nicht zu ersetzen. Alle automatisierten Klassifizierungen dienen als Empfehlungen zur menschlichen Überprüfung und helfen Moderatoren, ihre Bemühungen zu priorisieren, während die menschliche Aufsicht über alle Moderationsmaßnahmen erhalten bleibt. Diese Arbeit bietet praktische Anleitungen für Mastodon-Administratoren, die automatisierte Inhaltsanalyse implementieren möchten, etabliert Benchmarks für den Vergleich LLM-basierter Erkennungssysteme in dezentralen sozialen Netzwerken und trägt zum breiteren Verständnis bei, wie verschiedene KI-Architekturen Herausforderungen der Inhaltsmoderation angehen. Das in dieser Arbeit entwickelte Vergleichsframework kann für andere föderierte Plattformen angepasst und zur Evaluierung zukünftiger LLM-Modelle erweitert werden.
Abstract
(Englisch)
Disinformation on social media is a growing problem, but detecting it on decentralized platforms like Mastodon is particularly challenging. Unlike centralized networks where one company controls moderation, Mastodon consists of thousands of independent servers, making it difficult to implement consistent detection systems. The goal of this master thesis is to explore how Large Language Models (LLMs) can identify disinformation on Mastodon, with a focus on comparing how different models perform on the same data. This study implements a federated feed parser to collect posts from multiple Mastodon servers in real-time using the ActivityPub protocol. The detection approach combines content analysis with behavioral heuristics based on account characteristics such as account age, follower counts and posting patterns. These heuristics serve as a pre-filtering mechanism to reduce the volume of content requiring expensive LLM analysis, making the approach feasible for resource-constrained instances. The main contribution of this work is a systematic comparative analysis of four state-of-the-art LLM architectures: OpenAI's GPT-4o-mini, Anthropic's Claude Sonnet 4, Google's Gemini 2.5 Flash Lite and Meta's Llama 3.3 70B, evaluated on identical Mastodon datasets collected from the public federated timeline. Each model analyzes the same flagged posts and provides confidence scores and classification decisions, allowing for direct comparison of their outputs. This multi-model approach reveals how different LLMs interpret the same content and identifies patterns in their agreement and disagreement. Results show substantial inter-model agreement, with most posts receiving consistent classifications across all four models. The behavioral filtering approach significantly reduced the analysis workload, though without ground truth labels, this study measures inter-model consistency rather than detection accuracy. Importantly, this system is designed as a decision-support tool to assist human moderators rather than replace them. All automated classifications serve as recommendations for human review, helping moderators prioritize their efforts while maintaining human oversight of all moderation actions. This thesis provides practical guidance for Mastodon administrators seeking to implement automated content analysis, establishes benchmarks for comparing LLM-based detection systems in decentralized social networks and contributes to the broader understanding of how different AI architectures approach content moderation challenges. The comparative framework developed in this work can be adapted for other federated platforms and extended to evaluate future LLM models.

Schlagwörter

Schlagwörter
(Deutsch)
mastodon Decentralized Social Media LLM Large Language Model Federated Networks Desinformation
Schlagwörter
(Englisch)
mastodon Decentralized Social Media LLM Large Language Model Federated Networks Desinformation
Autor*innen
Artur Khaialiev
Haupttitel (Englisch)
Leveraging large language models to identify disinformation on Mastodon
Publikationsjahr
2025
Umfangsangabe
xv, 83 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Peter Reichl
Klassifikationen
54 Informatik > 54.00 Informatik. Allgemeines ,
54 Informatik > 54.08 Informatik in Beziehung zu Mensch und Gesellschaft
AC Nummer
AC17773013
Utheses ID
78983
Studienkennzahl
UA | 066 | 921 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1