Detailansicht
Automatic error correction of bibliographic references in academic writing
Elizaveta Ziulkova
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Joint-Masterstudium Multilingual Technologies
Betreuer*in
Dagmar Gromann
DOI
10.25365/thesis.79148
URN
urn:nbn:at:at-ubw:1-21061.85027.808155-1
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Bisherige Ansätze der automatischen Fehlerkorrektur (AEC) konzentrierten sich vorrangig auf allgemeine Grammatik- und Rechtschreibfehler. Akademische Fachbereiche stellen jedoch spezifische Anforderungen, insbesondere hinsichtlich Grammatik, Satzstruktur und Zitierweise. Aufgrund des Mangels an geeignet annotierten Datensätzen für Fehler im Bereich der Zitierweise ist dieses Themenfeld bislang unzureichend erforscht. Um diese Forschungslücke zu adressieren, widmet sich die vorliegende Arbeit der Generierung synthetischer Trainingsdaten zur Fehlerkorrektur bei Quellenangaben. Im Besonderen werden zwei Strategien zur Datensatzerstellung untersucht: die Erstellung synthetischer Daten sowie die gezielte Einbringung synthetischer Fehler. Die Ergebnisse verdeutlichen die jeweiligen Stärken und Schwächen beider Ansätze und zeigen, dass ein feinabgestimmtes T5-Modell mithilfe von synthetisch erzeugten und kombinierten (generierten und korrupierten) Datensätze in der Lage ist, Fehler in Quellenangaben in echten Beispielsätzen von Masterarbeiten effektiv zu korrigieren.
Abstract
(Englisch)
Existing approaches to Automatic Error Correction (AEC) have primarily focused on general grammar and spelling mistakes. However, academic domains face unique challenges, with strict requirements for grammar, sentence structure, and referencing. Due to the scarcity of suitable annotated data for referencing errors, this area remains underexplored. To address this gap, this thesis focuses on constructing a synthetic parallel referencing error corpus using a Large Language Model (LLM). Specifically, this study explores the effectiveness of two dataset creation strategies: synthetic data generation and synthetic error corruption. Additionally, this thesis investigates the development of an error type specification based on the textual Centre for Translation Studies (CTS) guidelines, which is used to guide the model in synthetic data generation and corruption pipelines. Experimental results show that a fine-tuned T5 model trained on a combination of synthetically generated and corrupted datasets achieves strong performance on real-world referencing error correction tasks, with an F0.5 score of 72.85. However, the ability of a model to generalize to unseen error types remains limited, emphasizing the need for developing approaches for a more diverse and representative error type taxonomy. These findings contribute to the further development of robust academic error correction models and highlight future directions for research, such as exploring methods to expand error type coverage and improve the generalization of models to unseen errors.
Schlagwörter
Schlagwörter
(Deutsch)
automatischen Fehlerkorrektur
Schlagwörter
(Englisch)
Automatic Error Correction AEC
Autor*innen
Elizaveta Ziulkova
Haupttitel (Englisch)
Automatic error correction of bibliographic references in academic writing
Publikationsjahr
2025
Umfangsangabe
9, 84 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Dagmar Gromann
Klassifikation
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC17627982
Utheses ID
77328
Studienkennzahl
UA | 066 | 587 | |
