Detailansicht
Generating reliable process event Streams and time series data based on neural networks
Tobias Harald Herbert
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Informatik
Betreuer*in
Stefanie Rinderle-Ma
DOI
10.25365/thesis.70507
URN
urn:nbn:at:at-ubw:1-11220.64225.843711-5
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Zeitreihen sind in fast allen gewerblichen Bereichen vorhanden und reichen von Sensordaten, Verkaufsdaten, Aktienkursen, Klimadaten bis hin zu Astrophysik. Mit dem Aufkommen vernetzter Geräte, die sich in Häusern und im öffentlichen Raum befinden, waren noch nie so viele Zeitreihen Daten verfügbar. Die Kombination der Datenfülle mit der rasanten Entwicklung und Leistungssteigerung von Machine-Learning-Modellen ermöglicht es, die Daten zum Auffinden von Mustern, zur Effizienzsteigerung bestehender Prozesse und zu wissenschaftlichen Entdeckungen zu nutzen. Was aber, wenn all diese Techniken zur Verfügung stehen, aber Prozessen sich oft ändern und daher nie große Datenmengen produzieren? Das Problem, mit dem wir konfrontiert sind, ist ein Mangel an Trainingsdaten für die Machine-Learning-Modelle, was zu einer geringen Qualität der Modelle führt. Das Ziel, ist eine Möglichkeit, die Größe des Datensatzes mit aussagekräftigen Daten zu erhöhen. Eine Möglichkeit besteht darin, eine Verteilung zu ermitteln, die die Daten gut repräsentiert. Dies erfordert jedoch entweder viel Handarbeit und Domänen-Know-how oder einen komplexen Aufbau mit umfangreicher Parametrierung. Der Aufwand hierfür muss wiederholt werden, wenn ein neuer Prozess eingeführt oder ein bestehender Prozess geändert wird. Das Ziel der vorgeschlagenen Technik besteht darin, einen kleinen Datensatz als Eingabe zu verwenden, die Eigenschaften der Daten zu lernen und den Datensatz möglichst automatisiert auf eine gewünschte Größe zu erhöhen. Darüber hinaus sollte es modular sein und die Verwendung verschiedener Machine-Learning-Modelle und Schnittstellen ermöglichen, sowie unterschiedliche Eingangsdaten akzeptieren und verschiedene Ausgabedaten erzeugen zu können. Zusätzlich sollte es möglich sein, Verarbeitungsschritte hinzuzufügen oder zu entfernen. Der vorgeschlagene Ansatz ist eine Pipeline, die Ereignisströme in Form von Logdaten als Eingabe verwendet, Vorverarbeitungsschritte durchführt, Machine-Learning-Modelle trainiert, Zeitreihen generiert und diese wiederum in die ursprüngliche Logdaten einbettet. Der Ansatz konzentriert sich auf die Automatisierung aus wirtschaftlicher Sicht und bietet ein Bewertungstool, das Forschungseinblicke zu den Auswirkungen verschiedener Eingabedaten, Machine-Learning-Modelle, Qualität und Ressourcenbeanspruchung liefert. Die Ergebnisse zeigen, dass es möglich ist, sehr kleine Datensätze zu nutzen und sie mit minimalen menschlichen Eingriffen mit sinnvollen Daten aufzuwerten, indem ein Recurrent Neural Network (RNN) verwendet wird, um effizient qualitativ hochwertige Daten zu erzeugen.
Abstract
(Englisch)
Time series data is present in almost every domain and ranges from sensor data, sales data, stock data, climate data to astrophysics. The rise of connected devices in homes and the public space creates an abundance of time series data waiting to be utilized. Combining the abundance of data with the rapid development and increase in performance of machine learning models, makes it possible to utilize the data to find patterns, optimize existing processes and make scientific discoveries. However, one of the biggest challenges in machine learning is a lack of high quality data, and obtaining more data can be prohibitively expensive or due to the nature of context simply not possible. As a result, either a machine learning model can only be used at a later stage when more data is available or in other cases it is simply not feasible to use a machine learning model at all. The problem is a lack of quantity of training data for the machine learning models, which results in a low performance of the models. The goal is to boost small data sets with data that represents the underlying distribution. One way is to try to test out distributions that approximate the data well. However, this requires either a lot of manual labour and domain expertise, or a complex setup with vast parameterization and the effort needs to be repeated whenever a new process is introduced or an existing process changes. The goal of the proposed technique is to take a small data set as input, learn the characteristics of the data using machine learning and boost the data set to a desired size with minimal intervention and manual labour. Additionally, the solution should be modular and allow the usage of different machine learning architectures and interfaces that can accept different inputs and produce different outputs as well as the ability to add and remove processing steps. The proposed approach is a pipeline that takes event streams as log files as its input, perform pre-processing steps, train machine learning models, generate time series data and re-embed it into the originating log file. It focuses on automation from a business standpoint and provides an evaluation tool that provides research insights on the effects of different input data, machine learning models, overall performance and resource intensiveness. The results show that it is possible to take very small data sets and boost them with reliable data with minimal human intervention by using a recurrent neural network (RNN) to produce high quality data efficiently.
Schlagwörter
Schlagwörter
(Englisch)
Time-Series Data-Generation Reliable-Data Process-Event-Stream Recurrent-Neural-Network Generative-Adversarial-Network Machine-Learning
Schlagwörter
(Deutsch)
Zeitreihendaten Neuronale-Netze Machinelles-Lernen Datengenerierung Recurrent-Neural-Network Generative-Adversarial-Network
Autor*innen
Tobias Harald Herbert
Haupttitel (Englisch)
Generating reliable process event Streams and time series data based on neural networks
Paralleltitel (Deutsch)
Generieren zuverlässiger Prozessereignisströme und Zeitreihendaten basierend auf neuronalen Netzen
Publikationsjahr
2021
Umfangsangabe
xv, 72 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Stefanie Rinderle-Ma
AC Nummer
AC16487451
Utheses ID
60679
Studienkennzahl
UA | 066 | 921 | |
