Detailansicht
Joint multi-modal representations for clustering and anomaly detection
Ylli Sadikaj
Art der Arbeit
Dissertation
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Doktoratsstudium der technischen Wissenschaften Informatik
Betreuer*in
Claudia Plant
DOI
10.25365/thesis.82095
URN
urn:nbn:at:at-ubw:1-23284.46318.553452-5
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Das Erlernen aussagekräftiger Darstellungen aus heterogenen Datenquellen ist eine zentrale Herausforderung im Data Mining und im maschinellen Lernen. Systeme der realen Welt, wie Zitationsnetzwerke, soziale Plattformen, Rechenzentrumsinfrastrukturen und industrielle Fertigungslinien, generieren Daten, die sich über mehrere Modalitäten erstrecken, darunter relationale Strukturen, kategoriale Attribute, textuelle Beschreibungen und visuelle Signale. Um solche Daten effektiv zu analysieren, müssen diese vielfältigen Modalitäten in einen gemeinsamen, niedrigdimensionalen Raum eingebettet werden, in dem Ähnlichkeiten, Unterschiede und Abweichungen direkt verglichen werden können. Diese Arbeit entwickelt gemeinsame Einbettungsmethoden für zwei wichtige Modalitäten, graphstrukturierte Daten und visuell-textuelle Daten, und zeigt, dass ein gemeinsames Prinzip sie verbindet: Die Clusterbildung in einem gemeinsamen Einbettungsraum ebnet den Weg zur Anomalieerkennung. Im ersten Teil befassen wir uns mit der Herausforderung der gemeinsamen Einbettung von attributierten multirelationalen Graphen, auch bekannt als Multiplex-Netzwerke. In diesen Netzwerken erstreckt sich derselbe Knotenbestand über mehrere Beziehungstypen (Graphen) und ist mit kategorialen Attributen angereichert. Um dieses Problem anzugehen, schlagen wir SpectralMix vor, einen unüberwachten spektralen Ansatz. SpectralMix integriert spektrale Einbettung zur Erhaltung der Netzwerkstruktur mit Homogenitätsanalyse zur Einbeziehung kategorialer Attribute und schafft so einen einheitlichen Vektorraum für beide Modalitäten. Anschließend erweitern wir diesen Ansatz um zwei zusätzliche Frameworks. Erstens passt das SSAMN-Framework SpectralMix für semi-überwachte Settings an, indem es Klassenlabels in den gemeinsamen Raum einbettet. Zweitens bewältigt das CJEMN-Framework kontrastive halbüberwachte Settings durch Hinzufügen einer strukturell informierten Negativ-Sampling-Schicht und eines dynamischen Pseudo-Labeling-Mechanismus, wodurch die Unterscheidungskraft der Einbettungen verbessert wird. Über mehrere reale Datensätze hinweg übertreffen sie die Baselines bei Knoten-Clustering- und Knoten-Klassifizierungsaufgaben durchweg. Eine entscheidende empirische Erkenntnis ergab sich aus den gemeinsamen Einbettungen, die von SpectralMix und SSAMN im ACM-Zitationsnetzwerk erzeugt wurden. Eine kleine Gruppe von Artikeln, die von einer gemeinsamen Untergruppe von Autoren verfasst wurden und ein ähnliches schichtübergreifendes Verbindungsmuster aufweisen, wurde an den Rand des Einbettungsraums gedrängt, weit entfernt von jedem Cluster-Zentrum. Die so zutage getretene Clusterstruktur entlarvte diese Artikel als Ausreißer, ohne dass ein spezieller Mechanismus zur Anomalieerkennung erforderlich war, was den Anstoß für den zweiten Teil der Arbeit gab. Anhand von zwei angewandten Studien demonstrieren wir zudem die Verallgemeinerbarkeit der Prinzipien der Graphen-Einbettung und des Clusterings. Eine auf Datencenter-Traffic-Traces angewandte Biclustering-Methodik deckt stabile, dichte Kommunikationsgruppen auf, die über aufeinanderfolgende Zeitintervalle hinweg bestehen bleiben. Eine weitere Studie zu Empfehlungssystemen zeigt, dass die Kombination von graphenbasierten Cluster-Zentroid-Einbettungen mit Textbewertungs-Einbettungen zu einer Verbesserung der Empfehlungsgenauigkeit bei nicht-neuronalen Methoden führt. Im zweiten Teil übertragen wir die Erkenntnisse aus dem Bereich „Clustering zur Anomalieerkennung“ auf den visuellen Bereich. In der industriellen Fertigung ist die Erkennung von Anomalien wichtig, doch die Identifizierung der spezifischen Fehlerart ist für die Diagnose und die Einleitung von Korrekturmaßnahmen oft ebenso entscheidend. Wir stellen die Aufgabe der Multi-Type-Anomaly-Segmentation (MTAS) vor und schlagen MultiADS vor, eine Zero-Shot-Methode, die lokale Bildausschnitt-Einbettungen mit defektspezifischen Text-Einbettungen in einem gemeinsamen Bild-Sprach-Raum abgleicht. Die Text-Prompts werden aus unserer Knowledge Base for Anomalies (KBA) generiert, die Defekt-Metadaten aus mehreren industriellen Datensätzen aggregiert und organisiert. Die resultierenden Text-Einbettungen bilden $K+1$ unterschiedliche Cluster, einen für den Normalzustand und einen für jeden der $K$ Fehlertypen, sodass sich die Erkennung und Klassifizierung darauf reduzieren, jeden Bildausschnitt dem nächstgelegenen Cluster-Zentrum zuzuordnen. Nach unserem Kenntnisstand ist MultiADS das erste Bild-Sprache-Framework, das explizit für die Zero-Shot-Segmentierung von Anomalien verschiedener Typen entwickelt wurde, bei der Anomalien nicht nur erkannt und lokalisiert, sondern auch bestimmten Fehlerkategorien zugeordnet werden. Darüber hinaus bleibt MultiADS im Vergleich zu den modernsten Baseline-Modellen bei der standardmäßigen binären Anomalieerkennung und -segmentierung sowohl in Zero- als auch in Few-Shot-Szenarien wettbewerbsfähig. Insgesamt zeigen die Ergebnisse dieser Arbeit anhand von Graphen und industriellen Bildern, dass ein prinzipienbasiertes Clustering in einem gemeinsamen Einbettungsraum die geometrische Grundlage für die Erkennung, Lokalisierung und Klassifizierung von Anomalien bildet, die bei einmodalen oder grobkörnigen Darstellungen systematisch übersehen werden.
Abstract
(Englisch)
Learning meaningful representations from heterogeneous data sources is a central challenge in data mining and machine learning. Real-world systems, such as citation networks, social platforms, datacenter infrastructures, and industrial production lines, generate data that spans across multiple modalities, such as relational structures, categorical attributes, textual descriptions, and visual signals. Analyzing such data effectively requires embedding these diverse modalities into a shared, low-dimensional space where similarities, differences, and deviations can be directly compared. This thesis develops joint embedding methods for two major modalities, graph-structured data and visual-textual data, and demonstrates that a common principle connects them, clustering in a joint embedding space paves the way to anomaly detection. In the first part, we address the challenge of jointly embedding attributed multi-relational graphs, also known as multiplex networks. In these networks, the same set of nodes spans multiple relational types (graphs) and is enriched with categorical attributes. To tackle this, we propose SpectralMix, an unsupervised spectral approach. SpectralMix integrates spectral embedding to preserve network structure with homogeneity analysis to incorporate categorical attributes, creating a unified vector space for both modalities. We then extend this approach with two additional frameworks. First, the SSAMN framework adapts SpectralMix for semi-supervised settings by embedding class labels into the joint space. Second, the CJEMN framework tackles contrastive semi-supervised settings by adding a structurally informed negative sampling layer and a dynamic pseudo-labeling mechanism, thereby enhancing the discriminative power of the embeddings. Across multiple real-world datasets, they consistently outperform baselines in node clustering and node classification tasks. A pivotal empirical finding emerged from the joint embeddings produced by SpectralMix and SSAMN on the ACM citation network. A small group of papers, written by a common subset of authors and sharing a similar cross-layer connectivity pattern, was pushed to the periphery of the embedding space, far from every cluster-centroid. The cluster structure thus exposed these papers as outliers without any dedicated anomaly-detection mechanism, motivating the second part of the thesis. We further demonstrate the generalizability of graph embedding and clustering principles through two applied studies. A biclustering methodology applied to datacenter traffic traces reveals stable, dense communication groups that persist across consecutive time intervals. Another study conducted on recommender systems shows that combining graph-based cluster centroid embeddings with text review embeddings leads to recommendation accuracy improvement for non-neural methods. In the second part, we carry the clustering-to-anomaly-detection insight into the visual domain. In industrial production, detecting anomalies is important, but identifying the specific defect type is often equally critical for diagnosis and corrective action. We introduce the Multi-type Anomaly Segmentation (MTAS) task and propose MultiADS, a zero-shot method that aligns local image-patch embeddings with defect-specific text embeddings in a joint vision--language space. The text prompts are generated from our Knowledge Base for Anomalies (KBA), which aggregates and organizes defect metadata across several industrial datasets. The resulting text embeddings form $K+1$ distinct clusters, one for the normal state and one for each of the $K$ defect types, so that detection and classification reduce to assigning each image patch to its nearest-cluster-centroid. To the best of our knowledge, MultiADS is the first vision--language framework explicitly designed for zero-shot multi-type anomaly segmentation, where anomalies are not only detected and localized but also assigned to specific defect categories. Additionally, MultiADS remains competitive with state-of-the-art baselines on standard binary anomaly detection and segmentation in both zero- and few-shot settings. Taken together, the contributions of this thesis demonstrate, across graphs and industrial images, that principled clustering in a joint embedding space provides the geometric foundation for detecting, localizing, and classifying anomalies that single-modality or coarse-grained representations systematically miss.
Schlagwörter
Schlagwörter
(Deutsch)
Gemeinsame Einbettungen Gemeinsame multimodale Darstellung Grapheneinbettung Graphen-Clustering Anomalieerkennung Visuelle Anomalieerkennung
Schlagwörter
(Englisch)
Joint Embeddings Joint Multi-modal Representation Graph Embedding Graph Clustering Anomaly Detection Visual Anomaly Detection
Haupttitel (Englisch)
Joint multi-modal representations for clustering and anomaly detection
Publikationsjahr
2026
Umfangsangabe
x, 158 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*innen
Carlotta Domeniconi ,
Aristides Gionis
Klassifikationen
54 Informatik > 54.00 Informatik. Allgemeines ,
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC18050602
Utheses ID
81272
Studienkennzahl
UA | 786 | 880 | |
