Detailansicht

Investigating LLM-as-a-judge for explanation evaluation
Vanessa Urban
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Physik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Computational Science
Betreuer*in
Benjamin Roth
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.81736
URN
urn:nbn:at:at-ubw:1-14690.41213.998035-2
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Erklärungen für große Sprachmodelle können nur dann vertrauenswürdig sein, wenn sie die interne Logik des Modells getreu widerspiegeln. Simulierbarkeit, also das Ausmaß, in dem ein Beobachter das Verhalten eines Modells nach Erhalt einer Erklärung vorhersagen kann, bietet eine systematische Methode zur Messung dieser Genauigkeit (faithfulness). Herkömmliche Studien zur Simulierbarkeit basieren auf menschlichen Probanden, was ihre Skalierbarkeit und Reproduzierbarkeit einschränkt. Diese Arbeit untersucht, ob der menschliche Beobachter bei einer komplexen generativen Aufgabe durch ein LLM-as-a-Judge ersetzt werden kann und ob Input-Feature-Attributionen die Fähigkeit des Judges verbessern, das Verhalten eines Zielmodells zu simulieren. Wir formulieren das Problem als eine Summary-Attribution-Aufgabe auf dem XSum-Datensatz, bei der der Judge die vom Zielmodell DistilBART-xsum-12-6 erzeugte Zusammenfassung identifizieren muss, und zwar aus vier alternativen Kandidaten. Als Judge dient Selene-1-Mini-Llama-3.1-8B, und die Feature-Attributionen werden mit dem Multi-Level Explanations for Generative Language Models (MExGen) Framework sowohl auf Satz- als auch auf Phrasenebene erzeugt. Ein zweiphasiges experimentelles Design vergleicht die Attributionsgenauigkeit ohne Erklärungen (Phase 1) mit der Genauigkeit unter Einbeziehung von Erklärungen (Phase 2) und isoliert so den Effekt der Erklärungen. Über alle experimentellen Variationen hinweg konnten Input-Feature-Attributionen die Attributionsgenauigkeit des Judges nicht signifikant verbessern und verschlechterten sie in einigen Konfigurationen sogar aktiv. Der Judge wählte durchgängig den flüssigsten Kandidaten anstelle des Zielmodells. Dieses Verhalten wird durch Quality Bias, sykophantisches Alignment und Post-Hoc-Rationalisierung bedingt. Weiterführende Analysen identifizieren Lead Bias auf Satzebene und Content Overlap auf Phrasenebene als zwei spezifische Fehlermodi von Input-Feature-Attributionen in der Nachrichtenzusammenfassung. Diese Ergebnisse legen nahe, dass effektive Erklärungen für die Modellzuordnung in generativen Aufgaben den Stil eines Modells charakterisieren müssen statt den Inhalt der Eingabe.
Abstract
(Englisch)
Explanations for large language models can only be trustworthy if they faithfully reflect the model’s internal reasoning. Simulatability, which is the extent to which an observer can predict a model’s behavior after seeing an explanation, offers a principled way to measure this faithfulness. Traditional simulatability studies rely on human subjects, which limits their scalability and reproducibility. This thesis investigates whether a human observer can be replaced by an LLM-as-a-Judge on a complex generative task, and whether input-level feature attributions improve the Judge’s ability to simulate a target model’s behavior. We formulate the problem as a five-way summary attribution task on the XSum dataset, in which the Judge must identify a target summary produced by DistilBART-xsum-12-6 from among four alternative candidates. Selene-1-Mini-Llama-3.1-8B serves as the Judge, and feature-based explanations are generated using the Multi-Level Explanations for Generative Language Models (MExGen) framework at both sentence and phrase level. A two-phase experimental design compares attribution accuracy without explanations (Phase 1) against accuracy with explanations (Phase 2), isolating the effect of the explanations directly. Across all experimental variations, input feature attributions failed to meaningfully improve the Judge’s attribution accuracy and in several configurations actively degraded it. The Judge consistently defaulted to the most fluent candidate rather than the Target Model. This behavior is driven by quality bias, sycophantic alignment, and post-hoc rationalization. Further analysis identifies lead bias at the sentence level and content overlap at the phrase level as two specific failure modes of input-level attributions in news summarization. These findings suggest that effective explanations for model attribution in generative tasks must characterize model style rather than input content.

Schlagwörter

Schlagwörter
(Deutsch)
Automatische Evaluation Erklärbare KI Sprachmodell Textzusammenfassung
Schlagwörter
(Englisch)
Large Language Model LLM-as-a-Judge Explainable AI Automatic Evaluation Natural Language Processing Evaluation Bias Text Summarization
Autor*innen
Vanessa Urban
Haupttitel (Englisch)
Investigating LLM-as-a-judge for explanation evaluation
Publikationsjahr
2026
Umfangsangabe
xii, 51 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Benjamin Roth
Klassifikationen
17 Sprach- und Literaturwissenschaft > 17.46 Mathematische Linguistik ,
54 Informatik > 54.72 Künstliche Intelligenz ,
54 Informatik > 54.75 Sprachverarbeitung
AC Nummer
AC17973443
Utheses ID
80709
Studienkennzahl
UA | 066 | 910 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1