{"id":{"repo_id":"humboldt-diss","oai_identifier":"oai:edoc.hu-berlin.de:18452/19516"},"canonical_url":"https://search.dev.ndltd.org/etd/humboldt-diss/oai:edoc.hu-berlin.de:18452/19516","repository":{"repo_id":"humboldt-diss","name":"Humboldt Universität zu Berlin","base_url":"https://edoc.hu-berlin.de/server/oai/request"},"display":{"title":"Hierarchical Multiclass Topic Modelling with Prior Knowledge","abstract":"Eine neue Multi-Label-Dokument-Klassifizierungstechnik namens CascadeLDA wird in dieser Arbeit eingeführt. Statt sich auf diskriminierende Modellierungstechniken zu konzentrieren, erweitert CascadeLDA ein generatives Basismodell durch die Einbeziehung von zwei Arten von Vorinformationen. Erstens wird das Wissen aus einem gekennzeichneten Trainingsdatensatz verwendet, um das generative Modell zu steuern. Zweitens wird die implizite Baumstruktur der Labels ausgenutzt, um diskriminierende Eigenschaften zwischen eng verwandten Labels hervorzuheben. Durch die Transformation des Klassifizierungsproblems in einem Ensemble von kleineren Problemen, werden vergleichbare out-of-sample Resultate circa 25 mal schneller erreicht als im Basismodell. In diesem Paper wird CascadeLDA auf Datensätzen mit akademischen Abstracts und vollständige wissenschaftliche angewendet. Das Modell wird eingesetzt, um Autoren beim Klassifizieren ihrer Publikationen automatisch zu unterstützen.","abstract_html":"Eine neue Multi-Label-Dokument-Klassifizierungstechnik namens CascadeLDA wird in dieser Arbeit eingeführt. Statt sich auf diskriminierende Modellierungstechniken zu konzentrieren, erweitert CascadeLDA ein generatives Basismodell durch die Einbeziehung von zwei Arten von Vorinformationen. Erstens wird das Wissen aus einem gekennzeichneten Trainingsdatensatz verwendet, um das generative Modell zu steuern. Zweitens wird die implizite Baumstruktur der Labels ausgenutzt, um diskriminierende Eigenschaften zwischen eng verwandten Labels hervorzuheben. Durch die Transformation des Klassifizierungsproblems in einem Ensemble von kleineren Problemen, werden vergleichbare out-of-sample Resultate circa 25 mal schneller erreicht als im Basismodell. In diesem Paper wird CascadeLDA auf Datensätzen mit akademischen Abstracts und vollständige wissenschaftliche angewendet. Das Modell wird eingesetzt, um Autoren beim Klassifizieren ihrer Publikationen automatisch zu unterstützen.","abstract_has_math":false,"creators":["Schröder, Ken"],"institution":"Humboldt-Universität zu Berlin","degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2018,"date_issued":"2018-02-12","date_published":"2018-02-12","updated_at":"2026-08-21T16:45:14Z","subjects":["Bayes","Gibbs-Sampling","Latent Dirichlet Allocation","maschinelles Lernen","Variationsinferenz","Themenmodellierung","natural language processing","variational inference","Topicmodeling","Gibbs sampling","graphical models","machine learning"],"languages":["eng"],"rights":["(CC BY-NC-SA 3.0 DE) Namensnennung - Nicht-kommerziell - Weitergabe unter gleichen Bedingungen 3.0 Deutschland"],"rights_urls":["http://creativecommons.org/licenses/by-nc-sa/3.0/de/"],"identifier_entries":[{"key":"dc:identifier.doi","label":"DOI","values":["https://doi.org/10.18452/18795"],"render_values":[{"text":"https://doi.org/10.18452/18795","href":"https://doi.org/10.18452/18795","code":true}]}]},"links":{"outbound_url":"https://edoc.hu-berlin.de/18452/19516","outbound_label":"Repository record","outbound_source":"dc:identifier.uri"},"source_record":{"url":"https://edoc.hu-berlin.de/server/oai/request?verb=GetRecord&metadataPrefix=dim&identifier=oai%3Aedoc.hu-berlin.de%3A18452%2F19516","prefix":"dim"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Schröder, Ken"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2018-02-12T14:46:12Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2018-02-12T14:46:12Z"]},{"key":"dc:date.issued","label":"Date","values":["2018-02-12"]},{"key":"dc:publisher","label":"Institution","values":["Humboldt-Universität zu Berlin"]},{"key":"dc:type","label":"Dc Type","values":["masterThesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Bayes","Gibbs-Sampling","Latent Dirichlet Allocation","maschinelles Lernen","Variationsinferenz","Themenmodellierung","natural language processing","variational inference","Topicmodeling","Gibbs sampling","graphical models","machine learning"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["eng"]},{"key":"dc:rights","label":"Dc Rights","values":["(CC BY-NC-SA 3.0 DE) Namensnennung - Nicht-kommerziell - Weitergabe unter gleichen Bedingungen 3.0 Deutschland"]},{"key":"dc:rights.uri","label":"Rights URI","values":["http://creativecommons.org/licenses/by-nc-sa/3.0/de/"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.doi","label":"DOI","values":["https://doi.org/10.18452/18795"]},{"key":"dc:identifier.uri","label":"Identifier URI","values":["https://edoc.hu-berlin.de/18452/19516"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["Eine neue Multi-Label-Dokument-Klassifizierungstechnik namens CascadeLDA wird in dieser Arbeit eingeführt. Statt sich auf diskriminierende Modellierungstechniken zu konzentrieren, erweitert CascadeLDA ein generatives Basismodell durch die Einbeziehung von zwei Arten von Vorinformationen. Erstens wird das Wissen aus einem gekennzeichneten Trainingsdatensatz verwendet, um das generative Modell zu steuern. Zweitens wird die implizite Baumstruktur der Labels ausgenutzt, um diskriminierende Eigenschaften zwischen eng verwandten Labels hervorzuheben. Durch die Transformation des Klassifizierungsproblems in einem Ensemble von kleineren Problemen, werden vergleichbare out-of-sample Resultate circa 25 mal schneller erreicht als im Basismodell. In diesem Paper wird CascadeLDA auf Datensätzen mit akademischen Abstracts und vollständige wissenschaftliche angewendet. Das Modell wird eingesetzt, um Autoren beim Klassifizieren ihrer Publikationen automatisch zu unterstützen.","A new multi-label document classification technique called CascadeLDA is introduced in this thesis. Rather than focusing on discriminative modelling techniques, CascadeLDA extends a baseline generative model by incorporating two types of prior information. Firstly, knowledge from a labeled training dataset is used to direct the generative model. Secondly, the implicit tree structure of the labels is exploited to emphasise discriminative features between closely related labels. By segregating the classification problem in an ensemble of smaller problems, out-of-sample results are achieved at about 25 times the speed of the baseline model. In this thesis, CascadeLDA is performed on datasets with academic abstracts and full academic papers. The model is employed to assist authors in tagging their newly published articles."]},{"key":"dc:title","label":"Title","values":["Hierarchical Multiclass Topic Modelling with Prior Knowledge"]}]}],"canonical_facts":{"dc:creator":["Schröder, Ken"],"dc:date.accessioned":["2018-02-12T14:46:12Z"],"dc:date.available":["2018-02-12T14:46:12Z"],"dc:date.issued":["2018-02-12"],"dc:description.abstract":["Eine neue Multi-Label-Dokument-Klassifizierungstechnik namens CascadeLDA wird in dieser Arbeit eingeführt. Statt sich auf diskriminierende Modellierungstechniken zu konzentrieren, erweitert CascadeLDA ein generatives Basismodell durch die Einbeziehung von zwei Arten von Vorinformationen. Erstens wird das Wissen aus einem gekennzeichneten Trainingsdatensatz verwendet, um das generative Modell zu steuern. Zweitens wird die implizite Baumstruktur der Labels ausgenutzt, um diskriminierende Eigenschaften zwischen eng verwandten Labels hervorzuheben. Durch die Transformation des Klassifizierungsproblems in einem Ensemble von kleineren Problemen, werden vergleichbare out-of-sample Resultate circa 25 mal schneller erreicht als im Basismodell. In diesem Paper wird CascadeLDA auf Datensätzen mit akademischen Abstracts und vollständige wissenschaftliche angewendet. Das Modell wird eingesetzt, um Autoren beim Klassifizieren ihrer Publikationen automatisch zu unterstützen.","A new multi-label document classification technique called CascadeLDA is introduced in this thesis. Rather than focusing on discriminative modelling techniques, CascadeLDA extends a baseline generative model by incorporating two types of prior information. Firstly, knowledge from a labeled training dataset is used to direct the generative model. Secondly, the implicit tree structure of the labels is exploited to emphasise discriminative features between closely related labels. By segregating the classification problem in an ensemble of smaller problems, out-of-sample results are achieved at about 25 times the speed of the baseline model. In this thesis, CascadeLDA is performed on datasets with academic abstracts and full academic papers. The model is employed to assist authors in tagging their newly published articles."],"dc:identifier.doi":["https://doi.org/10.18452/18795"],"dc:identifier.uri":["https://edoc.hu-berlin.de/18452/19516"],"dc:language.iso":["eng"],"dc:publisher":["Humboldt-Universität zu Berlin"],"dc:rights":["(CC BY-NC-SA 3.0 DE) Namensnennung - Nicht-kommerziell - Weitergabe unter gleichen Bedingungen 3.0 Deutschland"],"dc:rights.uri":["http://creativecommons.org/licenses/by-nc-sa/3.0/de/"],"dc:subject":["Bayes","Gibbs-Sampling","Latent Dirichlet Allocation","maschinelles Lernen","Variationsinferenz","Themenmodellierung","natural language processing","variational inference","Topicmodeling","Gibbs sampling","graphical models","machine learning"],"dc:title":["Hierarchical Multiclass Topic Modelling with Prior Knowledge"],"dc:type":["masterThesis"]},"updated_at":"2026-08-21T16:45:14Z"}