Detailansicht

Amino acid sequence toolkit (AASTK)
Marcel Rennig
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Bioinformatik
Betreuer*in
Thomas Rattei
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.81353
URN
urn:nbn:at:at-ubw:1-26839.59883.850498-0
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Fortschritte in Hochdurchsatzsequenzierung und Metagenomik haben zu einer massiven Zunahme verfügbarer mikrobieller Genomdaten geführt, während die experimentelle Charakterisierung mikrobieller Proteine weiterhin begrenzt ist. Dadurch basiert die funktionelle Charakterisierung zunehmend auf sequenzhomologiebasierten Ansätzen, die bei hochdiversen mikrobiellen Proteinsuperfamilien häufig an ihre Grenzen stoßen. Im Rahmen dieser Arbeit wurde das Amino Acid Sequence Toolkit (AASTK) entwickelt, eine skalierbare Software zur komparativen Analyse homologer mikrobieller Proteindatensätze. AASTK wurde mit der mikrobiellen Genomdatenbank GlobDB über ein SQLite-basiertes Backend integriert, wodurch eine effiziente großskalige Analyse konservierter genomischer Kontexte und genomassoziierter Metadaten über mehr als 300.000 mikrobielle Genome ermöglicht wird. Die implementierten Workflows kombinieren homologe Datensatzverfeinerung, Proteinclustering und genomische Kontextanalyse zur Untersuchung potenzieller Nitratreduktasen innerhalb der MopB-Superfamilie, einer der funktionell vielseitigsten Gruppen bioenergetischer Enzyme. In Kombination mit Struktur- und Lokalisationvorhersagen ermöglichten diese Ansätze eine systematische Charakterisierung Nitratreduktase-assoziierter Proteinarchitekturen über große mikrobielle Genomdatensätze hinweg. Die Analysen reproduzierten bekannte Nitratreduktasesysteme als Konzeptnachweis und identifizierten zusätzlich mehrere potenziell neuartige Nitratreduktase-assoziierte Architekturen mit unterschiedlichen vorhergesagten Untereinheitenzusammensetzungen und Lokalisationen. Insgesamt zeigt diese Arbeit, wie skalierbare komparative Genomik-Workflows traditionelle sequenzhomologiebasierte Ansätze ergänzen und zur Untersuchung mikrobieller Proteindiversität sowie zur Hypothesengenerierung für zukünftige experimentelle Charakterisierung beitragen können.Fortschritte in Hochdurchsatzsequenzierung und Metagenomik haben zu einer massiven Zunahme verfügbarer mikrobieller Genomdaten geführt, während die experimentelle Charakterisierung mikrobieller Proteine weiterhin begrenzt ist. Dadurch basiert die funktionelle Charakterisierung zunehmend auf sequenzhomologiebasierten Ansätzen, die bei hochdiversen mikrobiellen Proteinsuperfamilien häufig an ihre Grenzen stoßen. Im Rahmen dieser Arbeit wurde das Amino Acid Sequence Toolkit (AASTK) entwickelt, eine skalierbare Software zur komparativen Analyse homologer mikrobieller Proteindatensätze. AASTK wurde mit der mikrobiellen Genomdatenbank GlobDB über ein SQLite-basiertes Backend integriert, wodurch eine effiziente großskalige Analyse konservierter genomischer Kontexte und genomassoziierter Metadaten über mehr als 300.000 mikrobielle Genome ermöglicht wird. Die implementierten Workflows kombinieren homologe Datensatzverfeinerung, Proteinclustering und genomische Kontextanalyse zur Untersuchung potenzieller Nitratreduktasen innerhalb der MopB-Superfamilie, einer der funktionell vielseitigsten Gruppen bioenergetischer Enzyme. In Kombination mit Struktur- und Lokalisationvorhersagen ermöglichten diese Ansätze eine systematische Charakterisierung Nitratreduktase-assoziierter Proteinarchitekturen über große mikrobielle Genomdatensätze hinweg. Die Analysen reproduzierten bekannte Nitratreduktasesysteme als Konzeptnachweis und identifizierten zusätzlich mehrere potenziell neuartige Nitratreduktase-assoziierte Architekturen mit unterschiedlichen vorhergesagten Untereinheitenzusammensetzungen und Lokalisationen. Insgesamt zeigt diese Arbeit, wie skalierbare komparative Genomik-Workflows traditionelle sequenzhomologiebasierte Ansätze ergänzen und zur Untersuchung mikrobieller Proteindiversität sowie zur Hypothesengenerierung für zukünftige experimentelle Charakterisierung beitragen können.
Abstract
(Englisch)
Advances in high-throughput sequencing and metagenomics have led to a massive expansion of available microbial genome data while experimental characterization of microbial proteins remains limited. As a consequence, functional characterization increasingly relies on sequence homology-based approaches which often become insufficient for highly diverse microbial protein superfamilies. In this thesis I developed the Amino Acid Sequence Toolkit (AASTK), a scalable software suite for comparative analysis of homologous microbial protein datasets. AASTK was integrated with the GlobDB microbial genome database through an SQLite-based backend enabling efficient large-scale analysis of conserved genomic context and genome-associated metadata across more than 300,000 microbial genomes. The implemented workflows combine homolog dataset refinement, protein clustering and genomic context analysis to investigate putative nitrate reductases within the MopB superfamily, one of the most functionally versatile groups of bioenergetic enzymes known. Combined with downstream structure and subcellular localization prediction, these approaches enabled systematic characterization of nitrate reductase-associated protein architectures across large microbial genome collections. The analyses recovered well-characterized nitrate reductase systems as proof of concept while additionally identifying multiple potentially novel nitrate reductase-associated architectures with distinct predicted subunit compositions and localization patterns. Overall, this work demonstrates how scalable comparative genomics workflows can complement traditional sequence homology-based approaches in the investigation of microbial protein diversity and support informed hypothesis generation for future experimental characterization.Advances in high-throughput sequencing and metagenomics have led to a massive expansion of available microbial genome data while experimental characterization of microbial proteins remains limited. As a consequence, functional characterization increasingly relies on sequence homology-based approaches which often become insufficient for highly diverse microbial protein superfamilies. In this thesis I developed the Amino Acid Sequence Toolkit (AASTK), a scalable software suite for comparative analysis of homologous microbial protein datasets. AASTK was integrated with the GlobDB microbial genome database through an SQLite-based backend enabling efficient large-scale analysis of conserved genomic context and genome-associated metadata across more than 300,000 microbial genomes. The implemented workflows combine homolog dataset refinement, protein clustering and genomic context analysis to investigate putative nitrate reductases within the MopB superfamily, one of the most functionally versatile groups of bioenergetic enzymes known. Combined with downstream structure and subcellular localization prediction, these approaches enabled systematic characterization of nitrate reductase-associated protein architectures across large microbial genome collections. The analyses recovered well-characterized nitrate reductase systems as proof of concept while additionally identifying multiple potentially novel nitrate reductase-associated architectures with distinct predicted subunit compositions and localization patterns. Overall, this work demonstrates how scalable comparative genomics workflows can complement traditional sequence homology-based approaches in the investigation of microbial protein diversity and support informed hypothesis generation for future experimental characterization.

Schlagwörter

Schlagwörter
(Deutsch)
Bioinformatik Softwareentwicklung Nitratreduktasen Proteinfamilien Mikrobielle Genomik
Schlagwörter
(Englisch)
Bioinformatics Software development Nitrate reductases Protein families Microbial Genomics
Autor*innen
Marcel Rennig
Haupttitel (Englisch)
Amino acid sequence toolkit (AASTK)
Publikationsjahr
2026
Umfangsangabe
80 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Thomas Rattei
Klassifikationen
42 Biologie > 42.30 Mikrobiologie ,
54 Informatik > 54.89 Angewandte Informatik. Sonstiges
AC Nummer
AC17912336
Utheses ID
81320
Studienkennzahl
UA | 066 | 875 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1