Detailansicht
Comparing supervised fine-tuning and direct preference optimization for terminology-aware English-to-French medical machine translation
Sandra Pörnbacher
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Joint-Masterstudium Multilingual Technologies
Betreuer*in
Miguel Angel Rios Gaona
DOI
10.25365/thesis.81816
URN
urn:nbn:at:at-ubw:1-15038.77200.857596-2
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Die maschinelle Übersetzung im medizinischen Bereich birgt Risiken, die bei Übersetzungen in allgemeinen Bereichen nicht bestehen. Eine flüssige, aber terminologisch falsche Übersetzung kann medizinischem Personal und Patient:innen falsche Informationen vermitteln, und solche Fehler werden leicht übersehen, weil der gesamte Text durch die natürliche Sprache korrekt wirkt. Die genannten Fehler können sogar bis zum Tod führen und unterstreichen, wie wichtig es ist, dieses Thema zu untersuchen und zu erforschen. Die vorliegende Arbeit untersucht, ob Direct Preference Optimization (DPO) die Genauigkeit der medizinischen Terminologieübersetzung bei der maschinellen Übersetzung vom Englischen ins Französische im Vergleich zu Supervised Fine-Tuning (SFT) allein verbessert. Der Ansatz ist empirisch und vergleichend angelegt, da dieselben Daten und dasselbe Bewertungsverfahren auf drei mehrsprachige Decoder-only-Sprachmodelle angewendet werden, nämlich TowerInstruct-7B, Ministral-8B-Instruct und Qwen3-8B. Jedes Modell wird zunächst mit einem Zero-Shot-Ansatz als Baseline evaluiert und durchläuft anschließend SFT, eine terminologie-angereicherte SFT-Variante und eine terminologie-gestützte DPO-Variante, sodass beobachtete Unterschiede dem jeweils veränderten Schritt zugeschrieben werden können. Die Modelle werden mit Parameter-Efficient Fine-Tuning (PEFT)-Methoden (QLoRA) auf dem englisch-französischen Parallelkorpus EMEA v3 feinabgestimmt. Dieses Korpus wird durch heuristische und semantische Filter von rund 1,09 Millionen Satzpaaren auf etwa 287.000 reduziert und anschließend in 20.000 Trainings-, 1.000 Validierungs- und 1.000 Testpaare aufgeteilt. Zusätzlich ist der TICO-19-Benchmark vollständig als zentraler Testdatensatz reserviert. Medizinische Begriffe werden aus dem englischen Text mit einem klinischen Named-Entity Recogniser extrahiert und führen über eine Abfrage im Unified Medical Language System (UMLS) zur bevorzugten französischen Übersetzung. Diese Begriffe werden als Glossar in den Instruction Prompt eingefügt und bilden so die mit Terminologie angereicherte SFT-Variante. Für DPO wird zunächst der Adapter in das Basismodell integriert und ein neuer Adapter angehängt. Anschließend werden Präferenzpaare aus acht generierten Hypothesen gebildet und gereiht, wobei die Präferenzstärke über einen Sweep ausgewählt wird. Die Evaluierung kombiniert BLEU, ChrF und COMET mit einer Berechnung der Terminologiegenauigkeit, gepaarten Bootstrap-Signifikanztests und einer manuellen Inspektion der Systemausgaben. Das zentrale Ergebnis ist ein deutlich negatives Resultat für DPO. Über alle drei Modelle und beide Testdatensätze hinweg unterscheidet sich das terminologie-bewusste DPO-System vom terminologie-angereicherten SFT-System höchstens um wenige Tausendstel für COMET, und die Wahl der Präferenzstärke hat wenig Einfluss. Bei Qwen erzeugen das überwachte und das präferenzoptimierte System häufig sehr ähnliche Ausgaben. SFT hat einen größeren Effekt. Im Vergleich zur Zero-Shot-Baseline verbessert es COMET für Tower und Qwen auf dem EMEA-Testset, sinkt jedoch für alle Modelle auf dem TICO-19-Testset unter die Werte der Baseline. Terminologieanreicherung verändert die Werte über beide Testsets hinweg inkonsistent und liefert keine verlässliche Verbesserung. BLEU und ChrF unterscheiden sich von COMET in ihrem Verhalten, was dafür spricht, eine neuronale Metrik für die primäre Messung zu verwenden. Die Arbeit präsentiert reproduzierbare Zero-Shot-, SFT- und DPO-Systeme für die medizinische Englisch-Französisch-Übersetzung sowie die methodischen Schritte, die erforderlich sind, um DPO stabil auf parameter-effizienten Modellen zu trainieren. Die weitergehende Folge ist, dass die Wahl des Basismodells und dessen Stärke für die terminologische Genauigkeit wichtiger sind als die hier untersuchte Präferenzoptimierungsphase und dass verlässliche Genauigkeit in bezug auf die korrekte Terminologieübersetzung wahrscheinlich Mechanismen erfordern wird, die die Verwendung korrekter Begriffe erzwingen, statt sie nur zu suggerieren.
Abstract
(Englisch)
Machine Translation (MT) in the medical domain carries risks that general-domain translation does not. A fluent but terminologically incorrect translation can mislead clinicians and patients, and such errors are easily overlooked because the surrounding text sounds natural. The named errors can even be fatal and underline the importance of studying and investigating this topic. This Master's thesis investigates whether Direct Preference Optimization (DPO) improves the accuracy of medical terminology translation in English-to-French MT beyond what Supervised Fine-Tuning (SFT) alone achieves. The work is empirical and comparative as it applies the same data and evaluation procedure to three multilingual decoder-only language models, namely TowerInstruct-7B, Ministral-8B-Instruct, and Qwen3-8B. Each model is first evaluated with a zero-shot approach as the baseline and then taken through SFT, a terminology-enriched SFT variant, and a terminology-aware DPO variant, so that any observed difference can be attributed to the specific step that was changed. The models are fine-tuned with Parameter-Efficient Fine-Tuning (PEFT) methods (QLoRA) on the EMEA v3 English-French parallel corpus, which is reduced from roughly 1.09 million raw sentence pairs to about 287,000 through heuristic and semantic filtering and then down-sampled to 20,000 training, 1,000 validation, and 1,000 held-out test pairs. Additionally, the TICO-19 benchmark is reserved entirely as the main test set. Medical terms are extracted from the English source with a clinical named-entity recogniser and resolved to their French preferred terms through the Unified Medical Language System (UMLS) lookup, and these terms are injected as a glossary into the instruction prompt to form the terminology-enriched variant. For DPO, the supervised adapter is first merged into the base model and a fresh adapter is attached. Preference pairs are then built from eight hypotheses generated per source sentence and ranked with the preference strength selected through a sweep. Evaluation combines BLEU, ChrF, and COMET with a terminology-accuracy measure, paired bootstrap significance testing, and a manual inspection of system outputs. The central finding is a clear negative result for DPO. Across all three models and both test sets, the terminology-aware preference-optimised system differs from the terminology-enriched supervised system by at most a few thousandths of COMET, and the choice of preference strength has little effect. For Qwen, the supervised and preference-optimised systems frequently produce really similar outputs. SFT has a larger effect. In comparison to the zero-shot baseline it improves COMET for Tower and Qwen on the EMEA test set but falls below the baseline for all models on the TICO-19 test set. Terminology enrichment changes the scores inconsistently across both test sets and does not return a reliable improvement. The surface-level metrics and the semantic metric differ, which argues for reporting a neural metric as the primary measurement. The thesis contributes reproducible zero-shot, SFT and DPO systems for medical English-to-French translation, as well as the methodological steps required to train DPO stably on parameter-efficient models. Its broader implication is that the choice of base model and the strength of the base model matter more for terminological accuracy than the preference-optimisation stage studied here, and that reliable term adherence will likely require mechanisms that enforce, rather than only encourage, the use of correct terms.
Schlagwörter
Schlagwörter
(Deutsch)
Maschinelle Übersetzung Medizinische Übersetzung Supervised Fine-Tuning (SFT) Direct Preference Optimization (DPO) Parameter-Efficient Fine-Tuning (PEFT) Terminologie Large Language Models
Schlagwörter
(Englisch)
Machine Translation Medical Translation Supervised Fine-Tuning (SFT) Direct Preference Optimization (DPO) Parameter-Efficient Fine-Tuning (PEFT) Terminology Large Language Models
Autor*innen
Sandra Pörnbacher
Haupttitel (Englisch)
Comparing supervised fine-tuning and direct preference optimization for terminology-aware English-to-French medical machine translation
Publikationsjahr
2026
Umfangsangabe
11, 78 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Miguel Angel Rios Gaona
Klassifikationen
17 Sprach- und Literaturwissenschaft > 17.45 Übersetzungswissenschaft ,
54 Informatik > 54.82 Textverarbeitung
AC Nummer
AC18003313
Utheses ID
81953
Studienkennzahl
UA | 066 | 587 | |
