Detailansicht
Visuelle Aufmerksamkeit während des Simultandolmetschens mit durch automatische Spracherkennung (ASR) erzeugten visuellen Inputs
eine experimentelle Studie mit Eyetracking
Sara Pasini
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Translation Italienisch Deutsch
Betreuer*in
Franz Pöchhacker
DOI
10.25365/thesis.75895
URN
urn:nbn:at:at-ubw:1-11089.70341.176990-3
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Diese Arbeit befasst sich mit dem Simultandolmetschen mit ASR-gestützten Anwendungen. Das setzt ein multimodales Dolmetschsetting mit visuellen Inputs der ASR und mündlichen Inputs der Ausgangsrede voraus. Ziel der Arbeit ist es, die Wirkung der Anwendung Augmented Interpreter - CAI v 1.1 auf die Verteilung der visuellen Aufmerksamkeit beim Simultandolmetschen und auf die Richtigkeit der gedolmetschten Zahlen zu untersuchen. Im ersten Teil werden technologische Lösungen für Dolmetscher*innen vorgestellt und die Entwicklung der automatischen Spracherkennung bis zur Integration von ASR in CAI-Tools thematisiert. Für das Experiment wurde eine Rede von ca. 7 Minuten erstellt, wobei Zahlen automatisch erkannt und mit einem Genauigkeitswert von ca. 95,24 % von der Software Augmented Interpreter angezeigt wurden. Die Dolmetschleistungen von neun Dolmetschstudierenden wurden anhand der Wiedergabe der Zahlen ausgewertet. Durchschnittlich 64,4 % der in der Ausgangsrede erwähnten Zahlen und 95,2 % ihrer Referenten wurden korrekt wiedergegeben, obwohl die Ergebnisse je nach Teilnehmerin stark variierten (von 41,67% bis zu 96,7 % für Zahlen). Die Auswertung der Eyetracking-Daten der Studienteilnehmerinnen in einer Heatmap zeigte, dass die am meisten beobachteten Bereichen auf dem Bildschirm das Gesicht der Rednerin und die letzten angezeigten Zahlen waren. Anhand der einzelnen Interessensgebiete (Areas of Interest, abgekürzt AOI) auf dem Gesicht der Rednerin und auf den einzelnen Zahlen wurden dann die Dauer und die Anzahl der Fixationen gemessen. Die Auswertung der Eyetracking-Daten zeigt, dass die höchsten Werte in Bezug auf die Dauer und Anzahl der Fixationen für die AOI der Rednerin verzeichnet wurden. Viele Fixationen wurden auch außerhalb der festgelegten AOI, d. h. auf anderen Elementen der Benutzerschnittstelle, verzeichnet, während große Unterschiede unter den verschiedenen AOI der Zahlen erkennbar sind. Zwischen den Eyetracking-Daten und der Widergabe der Zahlen, die für zwei Studienteilnehmerinnen ausführlich analysiert wurden, konnte ein Muster erkannt werden. Zahlen, die länger betrachtet wurden bzw. eine höhere Anzahl an Fixationen verzeichneten, wurden in der Mehrheit der Fälle richtig wiedergegeben und in ihren Kontext eingebettet. Diese waren jedoch einzelne Beispiele, die nicht verallgemeinert werden können. Diese Studie legt die Grundlagen für eine eingehendere Untersuchung mit mehr Teilnehmer*innen und Messungsindikatoren, um aussagekräftigere Daten zu diesem Thema zu erhalten.
Abstract
(Englisch)
This paper investigates the topic of Automatic Speech Recognition (ASR) tools for interpreters, which implies a multimodal interpreting setting based on visual inputs of the ASR and oral inputs of the source speech. The objective of this research is to assess the impact of the Augmented Interpreter tool on visual attention during interpreting and on the accuracy of the interpretation of numbers. The first part presents technological solutions for interpreters and discusses the development of Automatic Speech Recognition up to the integration of ASR in CAI tools. For the experiment, a speech of approx. 7 minutes was created, displaying numbers automatically and with an accuracy rate of approx. 95% by the software. The interpreting accuracy of the nine study participants was analyzed based on the numbers displayed. On average, 95.2% of the speakers and 64.44% of the numbers mentioned in the initial speech were reproduced correctly, although the results varied significantly depending on the participant (from 41.67% to 96.67% for numbers). The analysis of the eye-tracking data of the study participants in form of a heat map showed that the most fixated areas on the screen were the speaker's face and the last numbers. The single areas of interest (AOI) on the speaker's face and the individual numbers were then used to measure the dwell time and fixation count. The analysis of the eye tracking data revealed that the highest values in terms of dwell time and the fixation count were recorded for the speaker's AOI. Many fixations were also recorded outside the defined AOI, i.e. on other elements of the user interface, while large differences are also recognizable between the various AOIs of the numbers. A pattern could be identified between the eye-tracking data and the interpretation of the numbers, which were analyzed in detail for two study participants. Numbers that were looked at for longer or had a higher number of fixations were accurately reproduced in the majority of cases and embedded in their context. However, these were individual examples that cannot be generalized. Even so, this study lays the foundations for more in-depth research with more participants and measurement indicators to obtain more meaningful data on the topic.
Schlagwörter
Schlagwörter
(Deutsch)
Automatische Spracherkennung Simultandolmetschen Visuelle Aufmerksamkeit Eyetracking CAI-Tools Multimodalität Zahlen Computer Assisted Interpreting tools ASR
Schlagwörter
(Englisch)
Automatic Speech Recognition (ASR) Simultaneous Interpreting Visual attention Eye-tracking CAI tools Multimodality Numbers Computer Assisted Interpreting tools ASR Problem triggers
Autor*innen
Sara Pasini
Haupttitel (Deutsch)
Visuelle Aufmerksamkeit während des Simultandolmetschens mit durch automatische Spracherkennung (ASR) erzeugten visuellen Inputs
Hauptuntertitel (Deutsch)
eine experimentelle Studie mit Eyetracking
Paralleltitel (Englisch)
Visual attention during Simultaneous Interpreting (SI) with visual inputs generated by Automatic Speech Recognition (ASR)
Paralleluntertitel (Englisch)
an experimental study with eye-tracking
Publikationsjahr
2024
Umfangsangabe
166 Seiten : Illustrationen
Sprache
Deutsch
Beurteiler*in
Franz Pöchhacker
Klassifikation
17 Sprach- und Literaturwissenschaft > 17.45 Übersetzungswissenschaft
AC Nummer
AC17193145
Utheses ID
71349
Studienkennzahl
UA | 070 | 348 | 331 |
