Detailansicht

FRED as an automatic term and relation extraction tool
a comparative study of machine-generated ontologies and human-designed terminological systems in the medical domain
Ilaria Granzini
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Zentrum für Translationswissenschaft
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Translation Deutsch Italienisch
Betreuer*in
Dagmar Gromann
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.81840
URN
urn:nbn:at:at-ubw:1-14093.89130.244523-8
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Diese Masterarbeit untersucht das Potenzial von FRED, einem Semantic-Web-Tool zur automatischen Textanalyse, für die automatische Extraktion von Konzepten und Relationen im Rahmen terminologischer Arbeit im biomedizinischen Bereich. Hierfür wurde ein Korpus aus zehn englischsprachigen Wikipedia-Artikeln zu unterschiedlichen Themen untersucht. Die von FRED automatisch extrahierten Konzepte und Relationen wurden mit den in SDL MultiTerm manuell erstellten Begriffssystemen verglichen. Die quantitative Auswertung zeigt, dass FRED relevante Fachkonzepte in beachtlichem Umfang identifizieren kann. Ein Teil der Konzepte, die im Rahmen der manuellen Terminologiearbeit erfasst wurden, konnte auch durch FRED erkannt werden. Deutlich geringer fiel dagegen die Übereinstimmung bei den Relationen aus. Die von FRED extrahierten Relationen werden aus der sprachlichen und semantischen Struktur eines Textes abgeleitet und werden in ontologiebasierten Strukturen formalisiert. Bei der Terminologiearbeit steht hingegen die Modellierung von Begriffssystemen im Vordergrund. Beide Ansätze erfassen daher häufig ähnliche Konzepte, stellen die Beziehungen zwischen diesen Konzepten jedoch unterschiedlich dar. Die qualitative Analyse zeigt, dass die Unterschiede nicht auf Extraktionsfehler zurückzuführen sind, sondern auf die unterschiedlichen Grundlagen der beiden Ansätze. Aber wurden mehrere Stärken von FRED sichtbar. Das System konnte semantische Zusammenhänge erkennen, synonymische Konzepte miteinander verknüpfen und Verbindungen zu externen Wissensressourcen, z. B. DBpedia, herstellen. Dies gelang teilweise sogar dann, wenn die entsprechenden Konzepte im Ausgangstext nicht ausdrücklich genannt wurden. Die Untersuchung zeigte jedoch auch einige Einschränkungen. So erzeugt FRED wiederholt doppelte Relationen und bildet häufig sprachliche Strukturen ab, die aus terminologischer Sicht nicht relevant sind. Insbesondere in den frühen Phasen der Terminologiearbeit kann FRED eine wertvolle Unterstützung darstellen, bei der Konzeptextraktion oder der semantischen Anreicherung der Terminologie. Für die Erstellung von Begriffssystemen reicht die automatische Extraktion von Ontologien jedoch nicht aus, um die manuelle Terminologiearbeit zu ersetzen. Daher erscheint ein hybrider Ansatz sinnvoll, bei dem automatische Verfahren die Arbeit von Terminologinnen unterstützen, ohne deren fachliche Analyse zu ersetzen.
Abstract
(Englisch)
This master's thesis investigated the potential of FRED, a Semantic Web machine-reading tool, for automatic term and relation extraction in terminology work applied in the biomedical domain. To achieve this objective, a corpus of ten English-language Wikipedia articles covering different medical topics was analysed. The concepts and relations extracted automatically by FRED were compared with concept system manually created in SDL Multiterm. The quantitative analysis demonstrated that FRED is moderately effective in identifying relevant domain concepts. The system retrieved a substantial proportion of the concepts identified during the manual terminology analysis. The correspondence between relations extracted by FRED and those manually chosen in SDL are considerably lower. The qualitative analysis, on the contrary, reveals that this limited overlap is attributable to the different representational principles underlying the two approaches rather than to extraction errors. FRED establishes semantic relations on the basis of linguistic and syntactic structure of the source text and formalises them through ontology-based representations. SDL terminology analysis, by contrast, seeks to organize domain knowledge and terminology by concept systems. As a result, the two approaches often identify similar concepts but represent their relationships in different ways. By qualitative analysis several examples emerge, which demonstrate the potential of FRED. The tool is capable of identify semantic correspondences, recognise synonymous concepts and establish links to external knowledge resources such as DBpedia, even when the related concepts do not occur explicitly in the source text. On the contrary, the analysis also revealed several limitations, including the generation of duplicate relations and the extraction of relations thar reflect linguistic structure rather than conceptual relation relevant for terminology work. Overall, FRED can provide useful support during the initial stages of terminology work, particularly for concept identification and semantic enrichment. Nevertheless, automatic ontology extraction remains insufficient to replace manual terminology analysis. The results therefore support the use of a hybrid approach in which ontology extraction tools assist, rather than substitute, human terminologists.

Schlagwörter

Schlagwörter
(Deutsch)
Terminologie Ontologie-Lernen FRED Begriffsextraktion Relationsextraktion Semantisches Web
Schlagwörter
(Englisch)
Ontology Learning Terminology Term Extraction Relation Extraction FRED Semantic Web
Autor*innen
Ilaria Granzini
Haupttitel (Englisch)
FRED as an automatic term and relation extraction tool
Hauptuntertitel (Englisch)
a comparative study of machine-generated ontologies and human-designed terminological systems in the medical domain
Paralleltitel (Deutsch)
FRED als automatisches Extraktionsinstrument für Termini und Relationen
Paralleluntertitel (Deutsch)
eine vergleichende Untersuchung von Ontologien und terminologischen Systemen im medizinischen Fachgebiet
Publikationsjahr
2026
Umfangsangabe
iv, 123 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Dagmar Gromann
Klassifikation
17 Sprach- und Literaturwissenschaft > 17.49 Angewandte Sprachwissenschaft. Sonstiges
AC Nummer
AC18007517
Utheses ID
81928
Studienkennzahl
UA | 070 | 331 | 348 |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1