Back to results

Universidad de Chile

Semi-automatic extraction of RDF triples from Wikipedia tables

Abstract

dc:description.abstract

Wikipedia es una enciclopedia en línea, multilingüe y gratuita disponible en 339 ediciones. La edición de Wikipedia en inglés actualmente cuenta con más de 6,7 millones de artículos y 46 millones de usuarios registrados. Una gran cantidad de información en Wikipedia se encuentra contenida en tablas. El problema radica en el gran número de tablas en Wikipedia, así como en la gran cantidad de tipos de esquemas de tablas en un formato semi-estructurado. En consecuencia, extraer manualmente información estructurada de estas tablas se vuelve impráctico, y automatizar este proceso se vuelve muy complejo. Para abordar este problema, proponemos una solución que involucra el uso de clusters de tablas de Wikipedia agrupadas por encabezados similares y la selección de un lenguaje de mapeo adecuado para transformar la información de esas tablas en información estructurada. En este estudio, realizamos un análisis comparativo de varios lenguajes de mapeo y sus respectivos procesadores usados para la extracción de relaciones semánticas de las tablas de Wikipedia. El objetivo principal es extraer información semántica de las tablas de Wikipedia con alta precisión a gran escala, con el objetivo de integrar el conocimiento resultante de manera más efectiva en bases de conocimiento existentes, como Wikidata. Si bien estudios previos han comparado algunos lenguajes de mapeo y procesadores, ninguno ha abordado este corpus en particular. Nuestra comparación de diferentes procesadores aplicados a nuestro data corpus destaca a Tarql como el procesador más productivo, generando 984,260 triples, de los cuales 791,021 son nuevos en Wikidata. Además, al examinar 500 relaciones aleatorias extraídas por Tarql de los 10 clusters más grandes, obtuvimos como resultado una precisión promedio del 84.6%. Sin embargo, como la imprecisión está principalmente asociada con clusters específicos de tablas, excluir estos clusters podría mejorar significativamente la precisión lograda. Métodos automatizados previos lograron una precisión del 81.5% y del 70%, lo que indica una mejora en la precisión con nuestro enfoque.

Degree

thesis:*
Grantor dc:publisher
Universidad de Chile
Year dc:date.issued
2025

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • Concha Sepúlveda, Adriana Cecilia.
Advisor dc:contributor.advisor
  • Hogan, Aidan

Rights

dc:rights
Statement dc:rights
  • Attribution-NonCommercial-NoDerivs 3.0 United States
Language dc:language.iso
en

Identifiers

dc:identifier.*
Dc Identifier Other
10.58011/r6y4-n642
OAI identifier oai:identifier
oai:repositorio.uchile.cl:2250/204304

Chain of custody

source
Harvested from
Universidad de Chile
Base URL
repositorio.uchile.cl/oai/request
Last updated
2026-07-27
Source record
OAI-PMH GetRecord
related terms
citation

Concha Sepúlveda, Adriana Cecilia.. Semi-automatic extraction of RDF triples from Wikipedia tables. Universidad de Chile, 2025. https://repositorio.uchile.cl/handle/2250/204304