Detailansicht

Scientific workflows, data provenance management and data anonymization in context of the Genome Austria Tissue Bank
Konrad Stark
Art der Arbeit
Dissertation
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Betreuer*in
Johann Eder
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.30061
URN
urn:nbn:at:at-ubw:1-29786.68829.181263-5
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Medizinische Forschung findet in einem stark interdisziplinären Umfeld statt und ist von Faktoren wie Expertenwissen aus verschiedensten Domänen, Abhängigkeit von biologischen Proben, verteilten Datenquellen und verteilten datenverarbeitenden Prozessoren geprägt. In den letzten Jahren haben sich Biobanken als forschungsunterstützende Zentren im medizinischen Bereich etabliert, in denen Wissenschaftern Zugriff auf Sammlungen von biologischen Proben und den damit verbundenen medizinischen Daten ermöglicht wird. Um die Forschungsaktivitäten effizient durchführen zu können, bedarf es einer adäquaten IT Infrastruktur, die Kollaborationen in Forschungsprojekten erlaubt und Forschungsprozesse in einer verteilten Systemlandschaft umsetzen kann. Die vorliegende Doktorarbeit befasst sich mit dem Design und der Realisierung eines IT-Systems zur Unterstützung von medizinischen Forschungsaktivitäten im Kontext einer Biobank. Das entworfene IT-System ermöglicht sowohl computerunterstützte Gruppenarbeit in medizinischen Forschungsprojekten als auch die Ausführung und Überwachung sogenannter Scientifc Workfows. Diese werden für die Durchführung von virtuellen Experimenten benötigt und dienen der Überprüfung von Forschungshypothesen. Für die Validierung und Nachvollziehbarkeit von Forschungsergebnissen ist eine exakte Protokollierung aller involvierten Daten und verarbeitenden Prozessoren essentiell. Die Rückverfolgbarkeit von generierten Daten, auch als Data Provenance bezeichnet, stellt einen bedeutenden Aspekt dieser Arbeit dar. Hierfür wurde ein Data Provenance Modell entwickelt, mit dessen Hilfe forschungsrelevante Abfragen bezüglich des Entstehungsprozesses von Forschungsergebnissen beantwortet werden können. Weiters kann über das Provenance Modell festgestellt werden, wenn Änderungen in Eingabedaten von Prozessen zu invaliden Forschungsergebnissen führen. Bei Verwendung von sensiblen, personenbezogenen Daten in medizinischen Forschungsprojekten müssen Datenschutzaspekte berücksichtigt werden. In dieser Arbeit wird ein innovativer Anonymisierungsalgorithmus vorgestellt, der, basierend auf dem Konzept der k-Anonymität, eine zu veröffentlichende Menge an Datensätzen anonymisiert. Der Algorithmus bezieht Benutzeranforderungen sehr stark mit ein und gewährleistet einen minimalen Informationsverlust durch die Anonymisierung und dass die anonymisierten Daten brauchbar für die Weiterverarbeitung und Folgeanalysen sind.
Abstract
(Englisch)
Medical research is characterized by a highly interdisciplinary environment, expert knowledge of various domains, dependency on biological material, distributed data repositories and computational resources. Biobanks have been established in recent years as biological resource centres, providing access to collections of specimens and associated biomedical data. In order to support complex medical research activities efficiently, biobanks require an adequate IT-infrastructure for enabling collaboration in research projects and executing research processes in a distributed environment. This thesis is concerned with the design and implementation of an IT system fulfilling manifold requirements for the medical research at a biobank. The developed IT system was realized as a multipurpose research platform for supporting collaborative activities and for enacting and monitoring scientific workflows, which are used for executing virtual experiments in order to proof or reject hypotheses. In order to guarantee the validity and traceability of research results, recording the provenance of data is of great importance. A fine-grained semantic data provenance model is presented in this thesis that is capable of answering research-relevant queries concerning the creation process of research results. The model allows to verify research results and is capable of identifying the impacts of changes in input data of scientific workflows. When using sensitive, patient-related data in research projects, data protection issues do have to be considered. Therefore, a novel anonymization algorithm based on the principle of k-anonymity is presented. The algorithm takes into account user-specific requirements and guarantees that an anonymized data set has a minimal information loss and is applicable to further processing in medical research projects.

Schlagwörter

Schlagwörter
(Englisch)
Scientific Workflows k-anonymity CSCW system data provenance biobanks
Schlagwörter
(Deutsch)
Scientific Workflows k-Anonymität CSCW System Datenprovenienz Biobanken
Autor*innen
Konrad Stark
Haupttitel (Englisch)
Scientific workflows, data provenance management and data anonymization in context of the Genome Austria Tissue Bank
Paralleltitel (Deutsch)
Scientific Workflows, Management von Datenprovenienz und Datenanonymisierung im Kontext der Biobank GATiB
Publikationsjahr
2013
Umfangsangabe
277 S. : graph. Darst.
Sprache
Englisch
Beurteiler*innen
Johann Eder ,
Erich Schikuta
Klassifikationen
54 Informatik > 54.39 Systemarchitektur: Sonstiges ,
54 Informatik > 54.80 Angewandte Informatik
AC Nummer
AC11745391
Utheses ID
26803
Studienkennzahl
UA | 786 | 881 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1