Detailansicht

Before the engine: combining writing for machine translation and post-editing of the source-text to improve neural machine translation output quality
Matilde Maria Boldrin
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Translation Italienisch Deutsch
Betreuer*in
Dragos Ioan Ciobanu
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.79239
URN
urn:nbn:at:at-ubw:1-21889.63402.917379-4
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Diese Arbeit untersucht, ob eine zweistufige Bearbeitung des Originaltextes – (i) Pre-Editing auf der Grundlage der Regeln von „Writing for Machine Translation“ und (ii) Post-editing of the source text (Post-Editing des Ausgangstextes)– die Übersetzbarkeit eines italienischen Inputs erhöhen und damit die Qualität der maschinellen neuronalen Übersetzung (NMT) ins Deutsche (DE) und Englische (UK) verbessern kann. Unter Pre-Editing versteht man die gezielte Anwendung einer Reihe von Regeln, die aus dem Kompendium von Translation Centre for the Bodies of the European Union (2021) und von Hardin et al. (2020) stammen; die zweite Phase folgt dem von Somers (1997) formulierten Prozess “Post-editing of the source text”. Es gibt zwei Forschungsfragen: (RQ1) Sind die NMT-Ergebnisse eines in zwei Schritten bearbeiteten Originaltextes – Vorbearbeitung plus Nachbearbeitung des Ausgangstextes – besser als die Ergebnisse, die mit dem unbearbeiteten Text erzielt werden? (RQ2) Ist der Qualitätsgewinn bei IT→EN (UK) und IT→DE ähnlich oder variiert er je nach Sprachpaar? Für das Experiment wurde ein italienischer Auszug (ethnografischer Text) ausgewählt, der zwei Bearbeitungsphasen durchlaufen hat. Für jede Version – unbearbeitet (V1) und zweimal bearbeitet (V2) – werden die Übersetzungen ins Englische (UK) und Deutsche (DE) mit DeepL (kostenlose Version, ohne Glossare) außerhalb von Matecat erstellt und dann segmentweise importiert. Zehn Teilnehmer (selbst erklärte Sprachkenntnisse ≥ C1 in IT/EN/DE) überprüfen jeweils vier Projekte (X_V1_EN, X_V1_DE, X_V2_EN, X_V2_DE) ausschließlich in Matecat, wobei MT/TM-Vorschläge deaktiviert sind. Die Fehlerannotation folgt einem von MQM inspirierten Profil (Stil; Übersetzungsfehler; Terminologiekonsistenz; Sprachqualität) mit festen Schweregraden (Neutral = 0; Geringfügig = 0,5; Schwerwiegend = 2). Das primäre quantitative Ergebnis ist der Qualitätswert (Quality score) von Matecat (Errors per Thousand words, EPT); zusätzlich werden die Summen nach Schweregrad angegeben, um das Fehlerprofil zu skizzieren. Unmittelbar nach jeder Überarbeitung werden in einem kurzen Fragebogen qualitative Bewertungen zu Genauigkeit (accuracy), Flüssigkeit (fluency) und Treue (fidelity) sowie offene Kommentare erfasst. Die Analyse vergleicht V2 mit V1 für jeden Teilnehmer und stellt die beiden Zielsprachen gegenüber. Die Erwartung ist ein niedrigerer EPT und weniger schwerwiegende Fehler in V2, mit übereinstimmenden Ergebnissen in den Fragebögen. Die Ergebnisse zeigen, dass die Bearbeitung des Originaltextes – durch eine Kombination aus Pre-Editing und Post-Editing des Ausgangstextes vor der Übertragung in NMT – die Qualität der Ausgabe systematisch verbessert. In beiden Richtungen (IT→EN und IT→DE) sinken die Qualitätswerte und die Bewertungen zeigen eine höhere Genauigkeit, Flüssigkeit und Treue; in vielen Fällen erreicht die Ausgabe bereits ohne weitere Nachbearbeitung die Akzeptanzschwelle.
Abstract
(Englisch)
This thesis examines whether a two-stage editing process on the original text — (i) pre-editing based on the rules of Writing for Machine Translation, and (ii) post-editing of the proposed source text — can increase the translatability of an Italian input and, consequently, improve the quality of neural machine translation (NMT) output into German (DE) and English (UK). Pre-editing refers to the targeted application of a set of rules drawn from the compendium of the Translation Centre for the Bodies of the European Union (2021) and Hardin et al. (2020); the second phase follows the post-editing process of the source text formulated by Somers (1997). There are two research questions: (RQ1) Do NMT outputs from a source edited in two steps—(i) pre-editing and (ii) post-editing of the source text—outperform outputs from the unedited source? And (RQ2) is this NMT quality gain similar for IT-EN (UK) and IT-DE, or does it differ by language pair? For the purposes of the experiment, an Italian extract (ethnographic text) was chosen and subjected to two stages of editing. For each version — unedited (V1) and twice edited (V2) — translations into English (UK) and German (DE) were produced using DeepL (free version, without glossaries) outside of Matecat and then imported segment by segment. Ten participants (self-declared ≥ C1 in IT/EN/DE) reviewed four projects each (X_V1_EN, X_V1_DE, X_V2_EN, X_V2_DE) exclusively in Matecat, with MT/TM suggestions disabled. Error annotation follows a profile inspired by MQM (Style; Translation Errors; Terminology Consistency; Language Quality) with fixed severity levels (Neutral = 0; Minor = 0.5; Major = 2). The primary quantitative outcome is Matecat's quality score (Errors per Thousand words, EPT); in addition, the sums by severity are reported to outline the error profile. Immediately after each revision, a short questionnaire collects qualitative judgements on accuracy, fluency and fidelity, as well as open comments. The analysis compares V2 with V1 for each participant and compares the two target languages. The expectation is a lower EPT and fewer serious errors in V2, with consistent findings in the questionnaires. The results indicate that intervening on the original text — combining pre-editing and post-editing of the source text before translating with NMT — systematically improves the quality of the output. In both directions (IT→EN and IT→DE), quality scores decrease and evaluations report greater accuracy, fluency and fidelity; in many cases, the output already reaches the acceptability threshold without further post-editing.

Schlagwörter

Schlagwörter
(Deutsch)
neurale maschinelle Übersetzung Pre-Editing Writing for Machine Translation Post-editing of the source text
Schlagwörter
(Englisch)
Neural Machine Translation Post-editing of the source text Writing for Wachine Translation Pre-editing
Autor*innen
Matilde Maria Boldrin
Haupttitel (Englisch)
Before the engine: combining writing for machine translation and post-editing of the source-text to improve neural machine translation output quality
Publikationsjahr
2025
Umfangsangabe
112 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Dragos Ioan Ciobanu
Klassifikation
17 Sprach- und Literaturwissenschaft > 17.45 Übersetzungswissenschaft
AC Nummer
AC17637637
Utheses ID
77345
Studienkennzahl
UA | 070 | 348 | 331 |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1