Detailansicht

Enhancing language-model pre-training datasets
data augmentation inspired by human language acquisition
Alexander Tampier
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Wirtschaftsinformatik
Betreuer*in
Benjamin Roth
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.79855
URN
urn:nbn:at:at-ubw:1-28908.92104.532516-3
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Große Sprachmodelle basieren oft auf Hunderten von Milliarden Wörtern aus hochwertigen Trainingsdaten. Im Gegensatz dazu ist der Spracherwerb beim Menschen wesentlich e!zienter und nutzt sprachspezifische Muster. Angesichts dieser Diskrepanzen wurde RecombiText Augmentation eingeführt. RecombiText Augmentation ist eine neuartige, nicht-neuronale, korpusabhängige Methode zur kompositorischen Datenanreicherung, mit der Trainingsdatensätze für Sprachmodelle in ressourcenarmen Szenarien ausschließlich anhand von Korpusstatistiken erweitert werden können. Inspiriert vom menschlichen Spracherwerb und genetischen Algorithmen generiert es synthetische Sätze durch kompositorische Rekombination des verfügbaren Textes. Die Methode identifiziert ähnliche Sätze innerhalb eines Korpus auf der Grundlage eines Suchsatzes unter Verwendung gemeinsamer Wörter und Bedeutungen durch einen hybriden Suchprozess. Anschließend wendet sie mit Hilfe eines semantischen Kontextfensters eine Rekombination zwischen den beiden Sätzen an, um neuartige augmentierte Sätze zu generieren. Zwei Transformer-Sprachmodellarchitekturen werden auf einem ressourcenarmen domänenspezifischen Datensatz von 10 Millionen Wörtern trainiert. Eine Basislinie wird mit den ursprünglichen Trainingsdaten und sechs gemischten Varianten definiert, die jeweils einen Teil der ursprünglichen Trainingsdaten und einen generierten erweiterten Teil enthalten. Die Wirksamkeit der vorgeschlagenen Methode wird auf zwei Arten bewertet. Erstens wird die Datenqualität durch Quantifizierung der Vorhersagbarkeit und Vielfalt des generierten Textes bewertet. Zweitens wird die Leistung des Sprachmodells anhand von linguistischen Zero-Shot- und Fine-Tuning-Aufgaben bewertet. Die Experimente zeigen Verbesserungen bei den Benchmarks für morphologische Generalisierung, im Tracking von Entitätszuständen, Lesen und grammatikalischem Verständnis. Die verfügbaren Trainingsdaten können verdoppelt oder sogar vervierfacht werden, ohne die Leistung des Sprachmodells zu beeinträchtigen. In einigen Fällen werden damit sogar bessere Ergebnisse in Benchmarks erzielt als mit den Originaldaten allein. Insgesamt ist RecombiText Augmentation in der Lage, Trainingsdatensätze für Sprachmodelle in Szenarien mit geringen Ressourcen zu erweitern.
Abstract
(Englisch)
Large language models often rely on hundreds of billions of words of available high-quality training data. In contrast, human language acquisition is significantly more e!cient and utilizes patterns inherent to the language. Motivated by these discrepancies, RecombiText Augmentation is introduced. RecombiText Augmentation is a novel non-neural corpus-dependent compositional data augmentation method for expanding language model training datasets in low-resource scenarios using only corpus statistics. Inspired by human language acquisition and genetic algorithms, it generates synthetic sentences through compositional recombination of the available text. The method identifies similar sentences within a corpus based on a query sentence using common words and meanings through a hybrid search process. It then applies, with the help of a semantic context window, a recombination between the two sentences to generate novel augmented sentences. Two transformer language model architectures are trained on a low-resource domain-specific dataset of 10 million words. A baseline is defined with the original training data and six mixed variants, each with a sample portion of the original training data and a generated augmented portion. The effectiveness of the proposed method is evaluated in two primary ways. First, the data quality is assessed by quantifying the predictability and diversity of the generated text. Second, the language model performance is evaluated on linguistic zero-shot and fine-tuning tasks. The experiments demonstrate improvements in morphological generalization, entity state tracking, reading, and grammatical understanding benchmarks. The available training data can be doubled or even quadrupled without compromising the performance of the language model. In some cases, this even achieves better results in benchmarks than with the original data alone. Overall, RecombiText Augmentation is capable of augmenting language model training datasets in low-resource scenarios.

Schlagwörter

Schlagwörter
(Deutsch)
Datenvergrößerung geringe Ressourcen Vortraining Sprachmodellierung menschlicher Spracherwerb Transformer genetische Algorithmen Verarbeitung natürlicher Sprache
Schlagwörter
(Englisch)
Data augmentation low-resource pre-training language modeling human language acquisition transformer genetic algorithms natural language processing
Autor*innen
Alexander Tampier
Haupttitel (Englisch)
Enhancing language-model pre-training datasets
Hauptuntertitel (Englisch)
data augmentation inspired by human language acquisition
Publikationsjahr
2025
Umfangsangabe
xiii, 81 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Benjamin Roth
Klassifikationen
54 Informatik > 54.62 Datenstrukturen ,
54 Informatik > 54.72 Künstliche Intelligenz ,
54 Informatik > 54.75 Sprachverarbeitung
AC Nummer
AC17732535
Utheses ID
77957
Studienkennzahl
UA | 066 | 926 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1