Detailansicht
Spanish and German legal translation performance of large language models and neural machine translation
Lorenz Albert Alex Hochmair
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Translation Deutsch Spanisch
Betreuer*in
Dagmar Gromann
DOI
10.25365/thesis.82157
URN
urn:nbn:at:at-ubw:1-10870.98872.929341-5
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Der Übersetzungsberuf war seit jeher sowohl von begrenzter gesellschaftlicher Sichtbarkeit als auch von mangelnder Anerkennung am Arbeitsmarkt geprägt. Durch die neuesten Fortschritte im Bereich der künstlichen Intelligenz stellt sich erneut die Frage nach der zukünftigen Relevanz des Berufsbildes von Übersetzer*innen. Vor diesem Hintergrund besteht ein stetiger Bedarf an Qualitätsbewertungen, die menschliche und maschinelle Übersetzung miteinander vergleichen, um die jeweiligen Stärken und Schwächen sichtbar zu machen. Die vorliegende Masterarbeit untersucht diese Frage anhand einer systematischen Qualitätsbewertung im Bereich der Rechtsübersetzung und vergleicht menschliche und maschinelle Übersetzung. Konkret bewerteten fünf professionelle Übersetzer*innen Übersetzungen spanischer Strafrechtstexte ins Deutsche. Die menschliche Übersetzung wurde von einem Rechtsexperten angefertigt, welcher auch die spanischen Rechtstextpassagen bereitstellte, während die maschinellen Übersetzungen von DeepL sowie von ChatGPT (GPT-5.1) mithilfe einer naiven Prompt-Strategie und eines ausführlichen Prompts generiert wurden. Die Bewertung erfolgte zweiteilig. Zuerst wurde eine vergleichende Qualitätsbewertung mittels Best-Worst Scaling, basierend auf der Methodik von Hiebl und Gromann (2024), durchgeführt, gefolgt von einer kriterienbasierten Bewertung, bei der die jeweils ausgewählten besten und schlechtesten Übersetzungen zusätzlich hinsichtlich Inhalt, Terminologie, Textfunktion sowie Grammatik und Syntax beurteilt wurden. Auf Basis der Summen- und Durchschnittswerte zeigte die Umfrage, dass die Humanübersetzung insgesamt am besten bewertet wurde, während DeepL am schlechtesten abschneidet und zudem niedriger eingestuft wurde als die ChatGPT-Übersetzung mit naivem Prompt; die Übersetzung mit dem ausführlichen Prompt übertraf wiederum jene mit dem naiven Prompt. Die Ergebnisse der kategoriebasierten Bewertung relativierten dieses Ranking jedoch. Weder die Humanübersetzung noch eine der maschinellen Übersetzungen belegten in allen vier Qualitätskategorien den ersten Platz. Die Humanübersetzung übertraf alle maschinellen Übersetzungen in sprachlicher Genauigkeit, insbesondere in Terminologie, Grammatik und Syntax, während die Übersetzung mit dem ausführlichen GPT-Prompt in den Kategorien Inhalt und Textfunktion führend war. Aufgrund der geringen Teilnehmerzahl sind die Ergebnisse lediglich als möglicher Trend zu interpretieren und als explorativ zu verstehen. Zukünftige Forschung sollte eine größere Stichprobe anstreben und das Design der Erhebung verbessern, etwas durch Reduzieren der kognitiven Belastung und die Durchführung der Befragung vor Ort statt online. Die vergleichende Qualitätsbewertung mittels Best-Worst Scaling war ursprünglich als zeiteffiziente, kognitiv wenig belastende Methode zur Übersetzungsbewertung konzipiert. Die zusätzliche kategoriebasierte Bewertung erhöhte jedoch den Gesamtaufwand der Umfrage deutlich. Zukünftige Forschung muss daher Effizienz und Detailtiefe der Bewertung gegeneinander abwägen.
Abstract
(Englisch)
The translation profession has been marked by both limited societal visibility and limited acknowledgment in the labor market. With recent advances in artificial intelligence, the same question about the future role of translators has re-emerged. Against this background, there is a constant demand for quality assessment that compares human and machine translation, to make each strength and weakness more transparent. Building upon this demand, the present master’s thesis investigates this question through a systematic quality assessment comparing human and machine translation in the legal translation domain. More specifically, five professional translators assessed and rated translations of Spanish criminal law excerpts into German, including those provided and translated by a legal expert, those generated by DeepL, and two translations generated by ChatGPT (GPT-5.1) using a naïve and a detailed prompt. The evaluation consisted of a two-part structure. The first part was a comparative quality assessment with Best-Worst Scaling, based on the methodology of Hiebl and Gromann (2024), following a criteria-based evaluation, in which the chosen best and worst translations were further assessed based on content, terminology, text function, and grammar and syntax. Based on the sum and average ratings, the survey revealed that human translation was rated best overall, while DeepL was rated worst and ranked lower than ChatGPT’s translation with a naïve prompt; the long-prompt GPT translation surpassed its naïve-prompt translation. The results of the quality criteria-based evaluations put these rankings further into perspective: neither the human translation nor the machine translations ranked first in all four quality categories. Human translation surpassed all machine translations, prevailing in linguistic accuracy, more precisely in terminology, grammar, and syntax, while the long-prompt GPT translation was leading in the categories content and text function. Due to the low number of participants, the results shall be interpreted only as a possible trend and are to be understood as exploratory. Future research could aim for a larger sample size and improve the survey design, for instance by reducing cognitive load and conducting the survey in person rather than online. Comparative quality assessment using Best-Worst Scaling was initially intended as a time-efficient, cognitively undemanding method for translation assessment. The added criteria-based evaluation, however, significantly increased the survey's total effort. Therefore, future research needs to weigh up efficiency and the level of detail in the assessment.
Schlagwörter
Schlagwörter
(Deutsch)
Large Language Models Neuronale Maschinelle Übersetzung Humanübersetzung Rechtssprache Rechtsübersetzung Maschinelle Übersetzung Best-Worst Scaling
Autor*innen
Lorenz Albert Alex Hochmair
Haupttitel (Englisch)
Spanish and German legal translation performance of large language models and neural machine translation
Publikationsjahr
2026
Umfangsangabe
138 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Dagmar Gromann
Klassifikation
17 Sprach- und Literaturwissenschaft > 17.45 Übersetzungswissenschaft
AC Nummer
AC18053840
Utheses ID
82374
Studienkennzahl
UA | 070 | 331 | 351 |
