Detailansicht

Identifying influences on language model trustworthiness
Yuxi Xia
Art der Arbeit
Dissertation
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Doktoratsstudium der technischen Wissenschaften Informatik
Betreuer*innen
Benjamin Roth ,
Claudia Plant
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.81423
URN
urn:nbn:at:at-ubw:1-26536.05747.293667-7
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Der zunehmende Einsatz von Sprachmodellen in sicherheitskritischen Anwendungsbereichen rückt deren Vertrauenswürdigkeit in den Mittelpunkt. Dazu zählen insbesondere Datenschutz, die verlässliche Kommunikation von Unsicherheit sowie robuste Generalisierungsfähigkeit. Trotz ihrer hohen Leistungsfähigkeit zeigen diese Modelle systematische Schwächen in allen drei Bereichen, die häufig durch externe Einflussfaktoren verursacht werden, welche in Standardbewertungen oft übersehen oder unterschätzt werden. Diese Dissertation untersucht Einflüsse auf die Vertrauenswürdigkeit von Sprachmodellen in drei miteinander verknüpften Bereichen: Datenschutz, Konfidenzschätzung und Kalibrierung sowie Generalisierung unter Verteilungsverschiebung. Die zentrale Erkenntnis besteht darin, dass Vertrauenswürdigkeitsprobleme häufig durch kontextuelle Faktoren wie sprachliche Variation entstehen. Im Bereich Datenschutz analysiert die Arbeit prompt-induzierte Memorisation in für Named Entity Recognition feinabgestimmten Masked Language Models und zeigt, dass Privacy Leakage stark von der Promptformulierung abhängt und nicht als feste Modelleigenschaft betrachtet werden kann. Im Bereich Konfidenz und Kalibrierung untersucht die Dissertation Konfidenzschätzung in großen Sprachmodellen und entwickelt Kalibrierungsverfahren auf Basis von Modellübereinstimmung sowie zusätzlicher Konfidenzschätzer. Über die numerische Kalibrierung hinaus zeigt die Arbeit, dass Konfidenzschätzungen häufig instabil gegenüber Prompt-Variationen sind und nur unzureichend auf semantische Veränderungen in Antwortalternativen reagieren. Weiterführende Analysen des Einflusses von Trainingsdaten deuten darauf hin, dass Modelle verbalisierte Sicherheit eher aus sprachlichen Mustern als aus inhaltlich begründeter Evidenz ableiten. Im Bereich Generalisierung analysiert die Arbeit Detektoren für KI-generierte Texte und zeigt deutliche Leistungsabfälle unter Prompt-, Modell- und Domänenverschiebungen. Sprachwissenschaftliche Analysen führen diese Generalisierungsprobleme auf Veränderungen syntaktischer und stilistischer Oberflächenmerkmale zurück und legen nahe, dass solche Detektoren häufig fragile Hinweise statt robust generalisierbarer Signale nutzen. Insgesamt zeigt diese Dissertation, dass die Vertrauenswürdigkeit von Sprachmodellen stark von externen Einflüssen wie Promptstrategien, sprachlicher Variation und linguistischen Merkmalen abhängt. Durch die Identifikation und Analyse dieser Einflussfaktoren liefert sie Ansätze für robustere Evaluationsverfahren und eine vertrauenswürdigere Anwendung von Sprachmodellen.
Abstract
(Englisch)
The growing deployment of language models in high-stakes applications places trustworthiness at the forefront, including aspects such as privacy preservation, reliable confidence communication, and robust generalization. Despite strong performance, those models exhibit systematic failures along these dimensions, often driven by external factors that are overlooked or underestimated in standard performance evaluation. This thesis investigates influences on language model trustworthiness across three interrelated areas: privacy, confidence estimation and calibration, and generalization under distribution shift. The unifying insight is that trustworthiness failures frequently arise from contextual factors such as linguistic variation. For privacy, the thesis examines prompt-induced memorization in masked language models fine-tuned for named entity recognition, showing that privacy leakage varies substantially with prompt formulation and cannot be treated as a fixed model property. For confidence and calibration, the thesis studies confidence estimation in large language models, proposing calibration methods based on model agreement and auxiliary confidence estimators. Beyond calibration, the thesis reveals that confidence estimates are often unstable under prompt perturbation and insensitive to semantic changes in estimated responses. Further analysis of training data influence indicates that models may learn to express verbalized confidence from linguistic patterns rather than from content-based evidence. For generalization, the thesis analyzes AI-text detectors, demonstrating sharp generalization degradation under cross-prompt, cross-model, and cross-domain shifts. Linguistic analysis links these failures to shifts in surface-level syntactic and stylistic features, suggesting that those detectors may rely on fragile cues rather than robust generalizable signals. Overall, this thesis shows that language model trustworthiness is highly sensitive to external influences such as prompt strategies, language variations and linguistic features. By identifying and analyzing these influences, it provides guidance for more robust evaluation and more trustworthy deployment of language models.

Schlagwörter

Schlagwörter
(Deutsch)
Sprachmodell Privatsphäre Unsicherheit Generalisierung Vertrauenswürdigkeit
Schlagwörter
(Englisch)
Trusworthiness Privacy Uncertainty Generalization Language Model
Autor*innen
Yuxi Xia
Haupttitel (Englisch)
Identifying influences on language model trustworthiness
Publikationsjahr
2026
Umfangsangabe
11, 161 Seiten, 24 ungezählte Seiten : Illustrationen
Sprache
Englisch
Beurteiler*innen
Christian Hardmeier ,
Torsten Zesch
Klassifikation
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC17914556
Utheses ID
80197
Studienkennzahl
UA | 786 | 880 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1