Detailansicht

Data analysis for protein folding
Stephan Hattinger
Art der Arbeit
Diplomarbeit
Universität
Universität Wien
Fakultät
Fakultät für Mathematik
Betreuer*in
Arnold Neumaier
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.27784
URN
urn:nbn:at:at-ubw:1-29405.91027.463064-5
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Eine neue Methode zur ab–initio Proteinfaltung auf C alpha Ebene wurde entwickelt und in MATLAB implementiert. Ähnlich wie in verwandten Verfahren wird dabei angenommen, dass sich der native state am globalen Minimum einer Energiefunktion V befindet. Im Unterschied zu Energiefunktionen herkömmlicher ab–initio Verfahren motiviert die hier präsentierte Methode das Potential V jedoch nicht auf Basis physikochemischer Eigenschaften beteiligter Entitäten; es wird vielmehr ein rein statistisches Modell aus einer Datenbank bekannter Strukturen erzeugt und zur Bildung des Potentials V herangezogen. Im Anschluss werden Minima von V mittels lokaler Optimierung mit multiple restart gesucht. Basis des Modells bilden Fragmente bestehend aus 4 aufeinanderfolgenden Aminosäuren. Es werden darauf sekundäre Geometrieklassen s definiert und darauf ein Klassifikator trainiert, welcher in der Vorhersage zusammen mit einem Hidden Markov Model aus der vorherzusagenden Primärsequenz eine Folge wahrscheinlicher Sekundärklassensequenzen generiert. Für jede dieser Sequenzen wird ein Potential als Summe der entsprechenden Kovarianzmodelle erstellt und dann lokal optimiert. Weiters werden eine Reihe zusätzlicher constraints verwendet um eine Verkleinerung des Suchraumes zu erreichen. Vorhersagen bei (sehr) kurzen Ketten unter 10 Residuen erreichen einen minimalen RMSD von unter 1Å, zur Vorhersage längerer Ketten bedürfte es allerdings noch einiger Verfeinerungsarbeit.
Abstract
(Englisch)
A new approach to ab-initio Protein Folding is developed and implemented in MATLAB. Similar to related methods, the native state of a chain is assumed to reside at the global minimum of some free energy function V. In contrast to those methods however, whose potential function often is motivated by physico–chemical properties and considerations, in this thesis we take an agnostic approach and model the energy function as data–analytically obtained potential function V . The global optimum then is sought to be found via multiple–restart local optimization. Amino–acid fragments of length 4 serve as basis of our model. We then define secondary structure geometry classes (s-classes) as simple bound classifiers on fragment geometries. A classifier then is trained to predict those classes from the primary sequence of fragments. For the actual prediction process, we use a Hidden Markov Model in combination with the classifier to discover the most probable s-class sequences for the given primary sequence, and in turn use those sequences as starting points for a local optimizer. The optimization objective function V basically is the sum of class–conditional covariance models over all fragments in the target. In order to reduce the search space, we filter out unlikely folds with a number of data–analytically obtained constraints. A fairly exhaustive software framework was developed alongside. Current predictions on (very) short sequences under 10 residuals achieve an RMSD of under 1Å, but for prediction of longer sequences a lot of refinement seems necessary.

Schlagwörter

Schlagwörter
(Englisch)
Protein Folding Data analysis Statistcal Parameter Estimation ab-initio
Schlagwörter
(Deutsch)
Proteinfaltung Datenanalyse Statistische Parameterschätzung ab-initio
Autor*innen
Stephan Hattinger
Haupttitel (Englisch)
Data analysis for protein folding
Paralleltitel (Deutsch)
Datananalyse für Proteinfaltung
Publikationsjahr
2013
Umfangsangabe
VI, 83 S. : Ill., graph. Darst.
Sprache
Englisch
Beurteiler*in
Arnold Neumaier
Klassifikationen
31 Mathematik > 31.73 Mathematische Statistik ,
35 Chemie > 35.05 Mathematische Chemie, chemische Statistik
AC Nummer
AC11100748
Utheses ID
24825
Studienkennzahl
UA | 405 | | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1