Detailansicht
Peptidome-DB - a proteogenomic database to annotate the peptidome
Sebastian Didusch
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Physik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Computational Science
Betreuer*in
Thomas Rattei
DOI
10.25365/thesis.60943
URN
urn:nbn:at:at-ubw:1-10833.07206.747263-9
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Die Proteogenomik nutzt Next Generation Sequencing (DNA, RNA) und Massenspektrometrie (MS)-basierende Proteomikdaten, um bestehende Genmodelle zu verfeinern und neue Genmodelle zu identifizieren, einschließlich offener Leserahmen (ORF), die für bioaktive Peptide kodieren, z. B. small ORFs (smORFs). Jüngste Schätzungen deuten darauf hin, dass Hunderttausende dieser ORFs im gesamten Lebensbaum existieren könnten, die das bekannte Peptidom erheblich erweitern würden. Computer-basierte Methoden zur Vorhersage von smORFs sind jedoch besonders schwierig und Referenzproteindatenbanken enthalten nur wenige Einträge.
Zur Verbesserung der strukturellen Annotation von eukaryotischen Genomen wurde eine integrierte Pipeline erstellt, die nicht annotierte Peptide und eine komplementäre Suchdatenbank zu Ensembl ausgibt. Peptidome-DB ist eine integrierte Java-Pipeline, die Datenvorverarbeitung, Peptid-Mapping, ORF-Clustering und proteogenomische Klassifizierung umfasst. Ein Web-Prototyp ermöglicht es Benutzern, Ergebnisse von Proteomik-Suchmaschinen und der entsprechenden Proteinsequenzdatenbank hochzuladen. Die Pipeline führt ein exaktes String-Matching (Aho-Corasick-Algorithmus) für die Peptide aus der Suchmaschine zu ihren Sequenzdatenbankeinträgen durch. BLAST und Exonerate gleichen Einträge mit Ensembl-Datenbanken verschiedener molekularer Typen (PEP, cDNA, ncRNA, DNA) ab. Single-Linkage Clustering (SLC) gruppiert ORFs von nicht annotierten Loci mit Exons von Ensembl PEP zusammen. Ein optimaler SLC-Distanzwert aus der intragenen und intergenen Distanzverteilung von Ensembl und ein Entscheidungsbaum klassifizieren jeden ORF eines unannotierten Peptids in ein intragenes oder intergenes Ereignis.
Ich habe eine Pipeline entwickelt, Peptidome-DB, zur Aufnahme und Kuratierung proteogenomischer Daten. Peptidome-DB verwendet Genom-Assemblies von Ensembl, um Genmodelle zu verfeinern und das Peptidom zu erforschen.
Abstract
(Englisch)
Proteogenomics leverages next generation sequencing (DNA, RNA) and mass spectrometry (MS)-based proteomics data to refine existing gene models and identify novel gene models, including open reading frames (ORF) encoding bioactive peptides, e.g small ORFs (smORFs). Recent estimates indicate that hundreds of thousands of those ORFs may exist across the tree of life, that would notably expand the known peptidome. However, computational predictions of smORFs are particularly difficult and reference protein database contain only few entries.
To improve efforts in structural genome annotation of eukaryotes an integrated pipeline was build which results output proteogenomic, novel peptides and a complementary search database to Ensembl. Peptidome-DB is an integrated Java pipeline comprising data preprocessing, peptide mapping, ORF clustering and proteogenomic classification. A web prototype allows users to upload results from proteomic database search tools and the respective protein sequence database. The pipeline performs an exact string-matching (Aho-Corasick algorithm) on the peptides from the search engine to their sequence database entries. BLAST and Exonerate align entries against Ensembl databases from various molecular types (PEP, cDNA, ncRNA, DNA). Single-linkage clustering (SLC) groups ORFs from unannotated loci with exons from Ensembl PEP together. An optimal SLC distance threshold from the intragenic and intergenic distance distributions from Ensembl is calculated and a decision tree classifies ORFs from novel peptides into an intragenic or intergenic event.
I developed a pipeline, Peptidome-DB, for the incorporation and curation of proteogenomic data. Peptidome-DB utilizes Ensembl genome assemblies to refine gene models and annotate the peptidome with protein-level evidence.
Schlagwörter
Schlagwörter
(Englisch)
Open Reading Frames smORFs Proteomics Peptidomics Databases
Schlagwörter
(Deutsch)
Offene Leserahmen smORFs Proteomik Peptide Datenbanken
Autor*innen
Sebastian Didusch
Haupttitel (Englisch)
Peptidome-DB - a proteogenomic database to annotate the peptidome
Paralleltitel (Deutsch)
Peptidome-DB - eine proteogenomische Datenbank zum Annotieren des Peptidoms
Publikationsjahr
2020
Umfangsangabe
vii, 84 Seiten ; Illustrationen, Diagramme
Sprache
Englisch
Beurteiler*in
Thomas Rattei
AC Nummer
AC16056002
Utheses ID
53842
Studienkennzahl
UA | 066 | 910 | |
