Detailansicht
Evaluating explanation quality through LLM-based forward simulation
a study on verbalization strategies
Antonio Innocenti
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Philologisch-Kulturwissenschaftliche Fakultät
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Digital Humanities
Betreuer*in
Benjamin Roth
DOI
10.25365/thesis.81880
URN
urn:nbn:at:at-ubw:1-28558.90297.659626-1
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Diese Arbeit untersucht den Einsatz von Large Language Models (LLMs) als Ersatz für menschliche Evaluatoren, indem ihr Verhalten als Richter bei einer Aufgabe zur Bewertung von Erklärungsqualität beobachtet wird. Auf Basis eines bestehenden Forward-Simulation-Frameworks wird gemessen, ob ein LLM-Richter das Verhalten eines Black-Box-Sentiment-Klassifikators für Filmrezensionen genauer vorhersagt, wenn ihm Erklärungen bereitgestellt werden, im Vergleich zu einer Baseline ohne Erklärungen. Die untersuchten Erklärungsmethoden sind die merkmalsbasierten Methoden LIME und SHAP sowie aufmerksamkeitsbasierte Scores, die aus dem Selbstaufmerksamkeitsmechanismus des Klassifikators extrahiert werden. Erklärungen werden durch acht Verbalisierungsformate in natürliche Sprache umgewandelt, die Merkmalszuschreibungs-Scores auf unterschiedliche Weise darstellen.Drei open-source LLMs werden als Richter evaluiert. Die Ergebnisse deuten darauf hin, dass Erklärungen die Genauigkeit der LLM-Richter weitgehend nicht verbessern oder inkonsistente Ergebnisse liefern. Unter den drei Richtern profitiert Llama am stärksten von Erklärungen, während Qwen und M-Prometheus kaum oder keine Verbesserung zeigen. Labelbasierte Verbalisierungsformate --- bei denen einflussreiche Wörter als \texttt{POSITIVE} oder \texttt{NEGATIVE} markiert werden, anstatt ihnen einen numerischen Score zuzuweisen --- übertreffen scorbasierte Formate durchgängig, was darauf hindeutet, dass prägnante kategorische Darstellungen effektiver sind als ausführliche numerische. Interessanterweise scheint das Verbalisierungsformat relevanter zu sein als die Erklärungsmethode selbst, was darauf hindeutet, dass \textit{wie} Erklärungen dem Richter präsentiert werden, wichtiger ist als \textit{welche} Erklärungsmethode verwendet wird. Die Richter erzielten jedoch bereits ohne Erklärungen eine hohe Ausgangsgenauigkeit, was darauf hindeutet, dass ein Deckeneffekt den potenziellen Nutzen von erklärungsbasiertem Prompting eingeschränkt haben könnte.
Abstract
(Englisch)
This thesis explores the use of Large Language Models (LLMs) as surrogate evaluators in place of human participants, observing their behavior when used as judges in an explanation quality assessment task. Adopting an existing forward simulation framework, the present study measures whether an LLM judge predicts the behavior of a black-box sentiment classifier of movie reviews more accurately when provided with explanations, compared to a no-explanation baseline. The explanation methods under investigation are the feature attribution methods LIME and SHAP, as well as attention-based scores extracted from the classifier's self-attention mechanism. Explanations are converted into natural language through eight verbalization formats designed to present feature attribution scores in different ways. Three open-source LLMs are evaluated as judges. The results suggest that explanations are largely unhelpful or inconsistent in improving LLM judge accuracy. Among the three judges, Llama benefits most from explanations, while Qwen and M-Prometheus show little or no improvement. Label-based verbalization formats --- in which influential words are marked as \texttt{POSITIVE} or \texttt{NEGATIVE} rather than being assigned a numerical score --- consistently outperform score-based ones, suggesting that concise categorical representations are more effective than verbose numerical ones. Perhaps more interestingly, the verbalization format appears to be more relevant than the explanation type itself, suggesting that \textit{how} explanations are presented to the judge matters more than \textit{which} explanation method is used. However, the judges already achieved high baseline accuracy without explanations, suggesting that a ceiling effect may have limited the potential benefit of explanation-based prompting.
Schlagwörter
Schlagwörter
(Deutsch)
Explainable Artificial Intelligence (XAI) LLM als Richter Forward Simulation Merkmalszuschreibung Verbalisierung Sentiment-Klassifikation LIME SHAP Attention Scores
Schlagwörter
(Englisch)
Explainable Artificial Intelligence (XAI) LLM-as-a-Judge Forward Simulation Feature Attribution Verbalization Sentiment Classification LIME SHAP Attention Scores
Autor*innen
Antonio Innocenti
Haupttitel (Englisch)
Evaluating explanation quality through LLM-based forward simulation
Hauptuntertitel (Englisch)
a study on verbalization strategies
Publikationsjahr
2026
Umfangsangabe
xi, 63 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Benjamin Roth
AC Nummer
AC18017109
Utheses ID
81345
Studienkennzahl
UA | 066 | 647 | |
