Humboldt-Universität zu Berlin
Hierarchical Multiclass Topic Modelling with Prior Knowledge
Abstract
dc:description.abstractEine neue Multi-Label-Dokument-Klassifizierungstechnik namens CascadeLDA wird in dieser Arbeit eingeführt. Statt sich auf diskriminierende Modellierungstechniken zu konzentrieren, erweitert CascadeLDA ein generatives Basismodell durch die Einbeziehung von zwei Arten von Vorinformationen. Erstens wird das Wissen aus einem gekennzeichneten Trainingsdatensatz verwendet, um das generative Modell zu steuern. Zweitens wird die implizite Baumstruktur der Labels ausgenutzt, um diskriminierende Eigenschaften zwischen eng verwandten Labels hervorzuheben. Durch die Transformation des Klassifizierungsproblems in einem Ensemble von kleineren Problemen, werden vergleichbare out-of-sample Resultate circa 25 mal schneller erreicht als im Basismodell. In diesem Paper wird CascadeLDA auf Datensätzen mit akademischen Abstracts und vollständige wissenschaftliche angewendet. Das Modell wird eingesetzt, um Autoren beim Klassifizieren ihrer Publikationen automatisch zu unterstützen.
Degree
thesis:*- Grantor dc:publisher
- Humboldt-Universität zu Berlin
- Year dc:date.issued
- 2018
Author and committee
dc:creator, dc:contributor.*- Author dc:creator
-
- Schröder, Ken
Subjects
dc:subject × 12Rights
dc:rights- Statement dc:rights
-
- (CC BY-NC-SA 3.0 DE) Namensnennung - Nicht-kommerziell - Weitergabe unter gleichen Bedingungen 3.0 Deutschland
- Licence dc:rights.uri
- Language dc:language.iso
- eng