Detailansicht
A hybrid system for Serbian natural language processing with large language models
Ivan Cvetanović
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Informatik
Betreuer*in
Werner Winiwarter
DOI
10.25365/thesis.81927
URN
urn:nbn:at:at-ubw:1-22841.80196.225089-9
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Serbisch ist für die maschinelle Sprachverarbeitung (NLP) eine ressourcenarme Sprache, die von aktuellen Werkzeugen und Modellen unterrepräsentiert wird, da diese hauptsächlich für das Englische entwickelt und daran evaluiert werden. Die vorliegende Arbeit untersucht die Grenzen aktueller Werkzeuge, stimmt ein großes Sprachmodell (LLM) mit offenen Gewichten für die maschinelle Sprachverarbeitung des Serbischen fein ab und entwickelt eine einheitliche Webanwendung, die diese Fähigkeiten in ein hybrides System integriert. Das Modell wird auf einem im Instruktionsformat vorliegenden serbischen Datensatz mit 24.601 Beispielen über fünf Aufgaben hinweg feinabgestimmt und anschließend mittels automatischer Benchmarks, aufgabenspezifischer Metriken und einer Nutzerstudie mit Muttersprachlern evaluiert. Die Wahl der Evaluationsmethode beeinflusst die gemessene Leistung erheblich. Dasselbe Basismodell erreichte auf demselben Benchmark etwa 34 % bei Log-Wahrscheinlichkeits-Bewertung, jedoch etwa 76 % bei chatbasierter Generierung. Die Feinabstimmung verbesserte die Leistung bei mehreren aufgabenspezifischen Metriken sowie beim Befolgen von Anweisungen. Die Studie ergab jedoch, dass Muttersprachler die feinabgestimmten Ausgaben insgesamt nicht bevorzugten und bei der Zusammenfassung die Ausgaben des Basismodells deutlich vorzogen. Automatische Metriken und menschliches Urteil wichen erheblich voneinander ab. Obwohl sich die automatische Metrik verbesserte, beurteilten die Bewertenden die feinabgestimmten Zusammenfassungen als schlechter, da sie kürzer und der Quelle weniger treu waren. Die Arbeit liefert ein feinabgestimmtes serbisches Modell mit offenen Gewichten und eine lokal eigenständig betreibbare Anwendung. Ihr zentraler Befund ist jedoch methodischer Natur. Eine detaillierte Prüfung ressourcenarmer Sprachen erfordert mehrere komplementäre Methoden, da die Schlussfolgerungen stark von der gewählten Methode abhängen.
Abstract
(Englisch)
Serbian is a low-resource language for NLP, underrepresented by current tools and models, which are mainly built for and evaluated on English. This thesis investigates the limitations of current tools, fine-tunes an open-weight large language model for Serbian NLP, and develops a unified web application that integrates these capabilities in a hybrid system. The model is fine-tuned on an instruction-formatted Serbian dataset of 24,601 examples across five tasks, and is then evaluated through automatic benchmarks, task-specific metrics, and a user study with native speakers. The choice of evaluation method substantially affects the measured performance. The same base model scored ≈34% under log-probability scoring but ≈76% under chat-based generation on the identical benchmark. Fine-tuning improved performance on multiple task-specific metrics and on instruction following, but the study found that native speakers did not prefer the fine-tuned outputs overall, and for summarization they strongly preferred the base model's outputs. Automatic metrics and human judgement diverged substantially. Although the automatic summarization metric improved, the raters judged the fine-tuned summaries worse, because they were shorter and less faithful. The work contributes a fine-tuned open-weight Serbian model and a locally self-deployable application, but its central finding is methodological. Detailed testing of low-resource languages requires multiple complementary methods, since conclusions depend heavily on the chosen method.
Schlagwörter
Schlagwörter
(Deutsch)
Serbisch Maschinelle Sprachverarbeitung Große Sprachmodelle Feinabstimmung von Sprachmodellen Ressourcenarme Sprachen Evaluierungsmethoden Nutzerstudie Webanwendung
Schlagwörter
(Englisch)
Serbian Natural Language Processing Large Language Models Fine-Tuning Low-Resource Languages Evaluation Methodology User Study Web Application
Autor*innen
Ivan Cvetanović
Haupttitel (Englisch)
A hybrid system for Serbian natural language processing with large language models
Paralleltitel (Deutsch)
Ein hybrides System für die maschinelle Sprachverarbeitung des Serbischen mit großen Sprachmodellen
Publikationsjahr
2026
Umfangsangabe
xviii, 73 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Werner Winiwarter
Klassifikationen
54 Informatik > 54.72 Künstliche Intelligenz ,
54 Informatik > 54.75 Sprachverarbeitung
AC Nummer
AC18026525
Utheses ID
82191
Studienkennzahl
UA | 066 | 921 | |
