Detailansicht
CS-backdoor attack
exploiting code-switching as a textual backdoor attack
Anna Katharina Lackner
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Joint-Masterstudium Multilingual Technologies
Betreuer*in
Dagmar Gromann
DOI
10.25365/thesis.81403
URN
urn:nbn:at:at-ubw:1-22564.44327.786548-2
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Während große Sprachmodelle (engl. Large Language Models (LLMs)) bemerkenswerte Fähigkeiten für eine Vielzahl von Aufgaben zeigen, bleiben sie anfällig für feindliche Angriffe. Da LLM-basierte Anwendungen in der Praxis zunehmend eingesetzt werden, ist die Gewährleistung ihrer sicheren Nutzung zu einem zentralen Anliegen geworden. Insbesondere Backdoor-Angriffe stellen ein erhebliches Sicherheitsrisiko dar, da sie ein Modell dauerhaft kompromittieren und dabei schwer zu erkennen sind. Diese Masterarbeit untersucht CS-Backdoor Attack, einen neuartigen Backdoor-Angriff, der Sprachwechsel (engl. Code-Switching (CS)) als textuellen Trigger verwendet. Sprachwechsel ist ein weit verbreitetes Phänomen, das die Grammatikalität, Flüssigkeit und semantische Bedeutung des zugrundeliegenden Textes erhält. Darüber hinaus haben jüngste Publikationen im Bereich von Backdoor-Angriffen gezeigt, dass Sprache selbst als effektiver Backdoor-Trigger eingesetzt werden kann. Dadurch erscheint Sprachwechsel als ein vielversprechender Trigger für einen effektiven und unauffälligen Backdoor-Angriff. Acht verschiedene Trigger basierend auf intrasententiellem und intersententiellem Sprachwechsel wurden anhand von drei multilingualen Sprachmodellen, Qwen 2.5 1.5B, Gemma 3 4B und Llama 3 8B, auf dem Stanford Sentiment Treebank 2 (SST-2) und MuLtilingual Question Answering (MLQA) Datensatz evaluiert. Die Ergebnisse zeigen, dass die untersuchten Modelle anfällig für CS-Backdoor Attack sind und für bestimmte Triggerarten nahezu perfekte Angriffsraten (engl. Attack Success Rates) erzielen. Darüber hinaus zeigt die Evaluierung von zwei Verteidigungsmethoden eine hohe Wirksamkeit gegen den Angriff auf dem MLQA Datensatz, wohingegen der Angriff auf dem SST-2 Datensatz nicht effektiv verteidigt werden konnte. Die Ergebnisse dieser Masterarbeit verdeutlichen die Anfälligkeit von Sprachmodellen gegenüber sprachbasierten Backdoor-Angriffen, die Sprachwechsel als Trigger nutzen.
Abstract
(Englisch)
While Large Language Models (LLMs) demonstrate remarkable capabilities across a wide range of downstream tasks, they remain susceptible to adversarial attacks. As LLM applications are increasingly deployed, ensuring their safe and secure usage has become a critical concern. Among various threats, textual backdoor attacks pose a particularly serious risk, as they permanently compromise a model’s behavior while remaining stealthy. This thesis proposes CS-Backdoor Attack, a novel textual backdoor attack that leverages Code-Switching (CS) as a trigger pattern. CS is a common phenomenon that preserves grammaticality, fluency, and semantic meaning of the underlying text. Moreover, recent publications have shown that language itself can serve as an effective backdoor trigger, making CS a promising candidate for a stealthy and effective attack. Eight trigger patterns based on intra-sentential and inter-sentential CS are evaluated across three MLLMs, Qwen 2.5 1.5B, Gemma 3 4B, and Llama 3 8B, on the Stanford Sentiment Treebank 2 (SST-2) and MuLtilingual Question Answering (MLQA) datasets. The results demonstrate that the victim models are susceptible to CS-Backdoor Attack, yielding near-perfect Attack Success Rates (ASRs) for certain CS trigger patterns on both datasets. Moreover, the attack proves particularly effective on SST-2, where even a low poisoning rate achieves high ASR scores. In addition, the evaluated defense methods demonstrated variable effectiveness across datasets, successfully mitigating the attack on MLQA but failing to fully defend against it on the SST-2 dataset. The results of this thesis emphasize the vulnerability of MLLMs to language-based backdoor attacks that leverage CS as a trigger.
Schlagwörter
Schlagwörter
(Deutsch)
Backdoor-Angriff Large Language Models Sprachwechsel Natürliche Sprachverarbeitung Maschinelles Lernen Code-Switching
Schlagwörter
(Englisch)
Large Language Models Backdoor Attack Code-Switching Pre-Trained Language Models Natural Language Processing Artificial Intelligence Security Data Poisoning Machine Learning
Autor*innen
Anna Katharina Lackner
Haupttitel (Englisch)
CS-backdoor attack
Hauptuntertitel (Englisch)
exploiting code-switching as a textual backdoor attack
Publikationsjahr
2026
Umfangsangabe
14, 109 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Dagmar Gromann
Klassifikation
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC17913725
Utheses ID
81260
Studienkennzahl
UA | 066 | 587 | |
