Detailansicht

Evaluating sarcasm preservation in machine translation from English to Russian and its impact on automatic sarcasm detection
Arina Antonova
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Joint-Masterstudium Multilingual Technologies
Betreuer*in
Dagmar Gromann
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.81969
URN
urn:nbn:at:at-ubw:1-22841.82821.110373-3
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Sarcasmus ist eine Form bildlicher Sprache, bei der sich die beabsichtigte Bedeutung eines Satzes von seiner wörtlichen Interpretation unterscheidet und häufig verwendet wird, um Spott, Humor oder Kritik auszudrücken. Aufgrund seiner impliziten und kontextabhängigen Natur stellt Sarcasmus eine Herausforderung für Natural Language Processing (NLP) dar, insbesondere in der Sentimentanalyse, maschinellen Übersetzung (MT) und automatischen Sarkasmuserkennung. Obwohl Sarkasmuserkennung in monolingualen Settings gut untersucht ist, bleibt der Einfluss von MT auf die Bewahrung von Sarkasmus vergleichsweise wenig erforscht. Diese Masterarbeit untersucht die Beziehung zwischen englisch-russischer MT und automatischer Sarkasmuserkennung. Sie analysiert, wie MT die Bewahrung sarkastischer Bedeutung sowie die Erkennungsleistung beeinflusst und welche Übersetzungsstrategien bei sarkastischen Inhalten verwendet werden. Die Arbeit verwendet ein multilingual trainiertes XLM-R Modell, das auf englischen und russischen Sarkasmus-Datasets in vier Konfigurationen fine-tuned wird: Englisch-only, Russisch-only, kombiniert Englisch-Russisch sowie sequentielles Englisch-zu-Russisch-Training, bei dem das Modell zunächst auf Englisch und anschließend auf Russisch fine-tuned wird. Der englische Testset wird mit dem NLLB-System ins Russische übersetzt und anschließend mit dem bestperformenden kombinierten Modell ausgewertet. Eine qualitative Analyse ergänzt die Untersuchung der verwendeten Übersetzungsstrategien im Kontext der Sarkasmusbewahrung. Die Ergebnisse zeigen einen deutlichen Rückgang der Sarkasmuserkennung auf maschinell übersetzten Daten im Vergleich zu den ursprünglichen englischen und russischen Testsets. Obwohl die Übersetzungen moderate BERTScore- und COMET-QE-Werte erreichen, wird nur ein kleiner Teil der sarkastischen Segmente als sarkastisch korrekt erkannt. Dies deutet darauf hin, dass MT pragmatische Hinweise für die Sarkasmuserkennung abschwächen kann, selbst wenn die semantische Bedeutung erhalten bleibt. Insgesamt zeigt die Studie die Herausforderungen der Sarkasmuserkennung in multilingualen NLP-Szenarien und untersucht den Einfluss von MT auf Sarkasmusbewahrung, Erkennungsleistung und Übersetzungsstrategien.
Abstract
(Englisch)
Sarcasm is a form of figurative language in which the intended meaning of a sentence differs from its literal interpretation and is often used to express mockery, humor or critique. Due to its implicit and context-dependent nature, sarcasm remains a challenge for Natural Language Processing (NLP), particularly in sentiment analysis, machine translation (MT), and automatic sarcasm detection. Although sarcasm detection has been widely studied in monolingual settings, the impact of MT on sarcasm preservation remains rather underexplored. This master's thesis studies the relationship between English-Russian MT and automatic sarcasm detection. It investigates how MT affects the preservation of sarcastic meaning and its impact on automatic sarcasm detection, as well as which translation strategies are used during MT of sarcastic content. This thesis uses a multilingual XLM-R model fine-tuned on English and Russian sarcasm datasets using four training configurations: English-only, Russian-only, combined English-Russian, and sequential English-to-Russian training, where the model is first fine-tuned on English and then further fine-tuned on Russian. The English test set is translated into Russian using the NLLB MT system and evaluated using the combined model, which is the best-performing sarcasm detection model among the four training configurations. A qualitative analysis further examines translation techniques in relation to sarcasm preservation. The results show a significant drop in sarcasm detection performance on machine-translated data compared to the original English and Russian test sets. Although the translated texts achieve moderate BERTScore and COMET-QE, only a small proportion of sarcastic segments are correctly identified as sarcastic after MT. These findings suggest that MT may weaken pragmatic cues necessary for sarcasm detection, even when general semantic content is preserved. Overall, the study highlights the challenges of sarcasm detection in multilingual NLP and investigates how MT affects sarcasm preservation, detection performance, and translation strategies in sarcastic content.

Schlagwörter

Schlagwörter
(Deutsch)
Sarkasmuserkennung Maschinelle Übersetzung Natural Language Processing Englisch-Russisch Übersetzungsstrategien NLP
Schlagwörter
(Englisch)
Sarcasm Detection Machine Translation Natural Language Processing English-Russian Translation Techniques NLP
Autor*innen
Arina Antonova
Haupttitel (Englisch)
Evaluating sarcasm preservation in machine translation from English to Russian and its impact on automatic sarcasm detection
Publikationsjahr
2026
Umfangsangabe
13, 74 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Dagmar Gromann
Klassifikation
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC18030561
Utheses ID
82192
Studienkennzahl
UA | 066 | 587 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1