{"id":{"repo_id":"chile","oai_identifier":"oai:repositorio.uchile.cl:2250/198541"},"canonical_url":"https://search.dev.ndltd.org/etd/chile/oai:repositorio.uchile.cl:2250/198541","repository":{"repo_id":"chile","name":"Universidad de Chile","base_url":"https://repositorio.uchile.cl/oai/request"},"display":{"title":"Optimización del sistema de análisis y caracterización de discusiones en Twitter \"Tsundoku\"","abstract":"Tsundoku es un sistema de análisis y de caracterización de discusiones en Twitter, desarrollado por el profesor Eduardo Graells Garrido en conjunto con otros académicos del área de la computación. El objetivo principal de este sistema es la detección de postura de los usuarios en torno a algún tópico de discusión, junto con la detección de bots dentro de la misma. Este sistema ha sido ocupado para la caracterizar la discusión en torno al referéndum por una nueva constitución en Chile el año 2020, y sigue siendo ocupado por académicos de distintas áreas de estudio para otros tópicos de discusión. Si bien Tsundoku es sumamente útil, también presenta ciertas limitantes que dificultan su uso. Principalmente se destaca el tiempo de ejecución excesivo en el preprocesamiento de tweets, influenciado por el manejo de datos con archivos en formato json, que son inadecuados para este tipo de estudios. Además, la clasificación del lugar de procedencia de los usuarios presenta resultados insatisfactorios, y muy por debajo de la evaluación de la predicción de postura. Así, nace la oportunidad de integrar herramientas de procesamiento masivo de datos dentro de Tsundoku, junto con algunas mejoras en torno a la clasificación que podrían explorarse. Para lo anterior, se integró el uso de la librería PyArrow que permite la interoperabilidad de librerías de manejo de dataframes como dask y pandas, además de incluir métodos optimizados para la lectura y escritura de archivos especializados para el manejo de grandes cantidades de datos. El nuevo formato ocupado para el manejo de dataframes corresponde a ficheros parquet, creado especialmente para lecturas eficientes. Además, se integraron word embeddings al proceso de clasificación, permitiendo añadir un acercamiento contextual al procesamiento de texto. Estos embeddings fueron obtenidos a partir de la arquitectura Transformers, ocupando el modelo pre-entrenado en español conocido como BETO y desarrollado por académicos de la Universidad de Chile. Lo anterior resultó en una reducción del 92 % del tiempo de ejecución para el preprocesamiento de tweets, junto con la creación de un programa que permita a los usuarios transformar sus datos de json a parquet para un manejo eficiente de datos. Por otro lado, la integración de word embeddings a la clasificación permitió aumentar en un 7 % la exactitud de la clasificación del lugar de origen del usuario. Se espera que la exploración e incorporación de más herramientas de procesamiento de lenguaje natural pueda ampliar las oportunidades de estudio y mejorar la detección de postura con Tsundoku","abstract_html":"Tsundoku es un sistema de análisis y de caracterización de discusiones en Twitter, desarrollado por el profesor Eduardo Graells Garrido en conjunto con otros académicos del área de la computación. El objetivo principal de este sistema es la detección de postura de los usuarios en torno a algún tópico de discusión, junto con la detección de bots dentro de la misma. Este sistema ha sido ocupado para la caracterizar la discusión en torno al referéndum por una nueva constitución en Chile el año 2020, y sigue siendo ocupado por académicos de distintas áreas de estudio para otros tópicos de discusión. Si bien Tsundoku es sumamente útil, también presenta ciertas limitantes que dificultan su uso. Principalmente se destaca el tiempo de ejecución excesivo en el preprocesamiento de tweets, influenciado por el manejo de datos con archivos en formato json, que son inadecuados para este tipo de estudios. Además, la clasificación del lugar de procedencia de los usuarios presenta resultados insatisfactorios, y muy por debajo de la evaluación de la predicción de postura. Así, nace la oportunidad de integrar herramientas de procesamiento masivo de datos dentro de Tsundoku, junto con algunas mejoras en torno a la clasificación que podrían explorarse. Para lo anterior, se integró el uso de la librería PyArrow que permite la interoperabilidad de librerías de manejo de dataframes como dask y pandas, además de incluir métodos optimizados para la lectura y escritura de archivos especializados para el manejo de grandes cantidades de datos. El nuevo formato ocupado para el manejo de dataframes corresponde a ficheros parquet, creado especialmente para lecturas eficientes. Además, se integraron word embeddings al proceso de clasificación, permitiendo añadir un acercamiento contextual al procesamiento de texto. Estos embeddings fueron obtenidos a partir de la arquitectura Transformers, ocupando el modelo pre-entrenado en español conocido como BETO y desarrollado por académicos de la Universidad de Chile. Lo anterior resultó en una reducción del 92 % del tiempo de ejecución para el preprocesamiento de tweets, junto con la creación de un programa que permita a los usuarios transformar sus datos de json a parquet para un manejo eficiente de datos. Por otro lado, la integración de word embeddings a la clasificación permitió aumentar en un 7 % la exactitud de la clasificación del lugar de origen del usuario. Se espera que la exploración e incorporación de más herramientas de procesamiento de lenguaje natural pueda ampliar las oportunidades de estudio y mejorar la detección de postura con Tsundoku","abstract_has_math":false,"creators":["García Ríos, Nicolás Francisco"],"institution":"Universidad de Chile","degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":["Graells Garrido, Eduardo"],"committee_chairs":[],"committee_members":[],"year":2023,"date_issued":"2023","date_published":"2023","updated_at":"2026-07-27T19:10:05Z","subjects":[],"languages":["es"],"rights":["Attribution-NonCommercial-NoDerivs 3.0 United States"],"rights_urls":["http://creativecommons.org/licenses/by-nc-nd/3.0/us/"],"identifier_entries":[{"key":"dc:identifier.other","label":"Dc Identifier Other","values":["10.58011/dnzh-9p19"],"render_values":[{"text":"10.58011/dnzh-9p19","href":"https://doi.org/10.58011/dnzh-9p19","code":true}]}]},"links":{"outbound_url":"https://repositorio.uchile.cl/handle/2250/198541","outbound_label":"Repository record","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor.advisor","label":"Advisor","values":["Graells Garrido, Eduardo"]},{"key":"dc:contributor.other","label":"Dc Contributor Other","values":["Hevia Angulo, Alejandro","Villena Rodríguez, Fabián"]},{"key":"dc:creator","label":"Author","values":["García Ríos, Nicolás Francisco"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2024-05-14T13:47:44Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2024-05-14T13:47:44Z"]},{"key":"dc:date.issued","label":"Date","values":["2023"]},{"key":"dc:publisher","label":"Institution","values":["Universidad de Chile"]},{"key":"dc:type","label":"Dc Type","values":["Tesis"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["es"]},{"key":"dc:rights","label":"Dc Rights","values":["Attribution-NonCommercial-NoDerivs 3.0 United States"]},{"key":"dc:rights.uri","label":"Rights URI","values":["http://creativecommons.org/licenses/by-nc-nd/3.0/us/"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.other","label":"Dc Identifier Other","values":["10.58011/dnzh-9p19"]},{"key":"dc:identifier.uri","label":"Identifier URI","values":["https://repositorio.uchile.cl/handle/2250/198541"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["Tsundoku es un sistema de análisis y de caracterización de discusiones en Twitter, desarrollado por el profesor Eduardo Graells Garrido en conjunto con otros académicos del área de la computación. El objetivo principal de este sistema es la detección de postura de los usuarios en torno a algún tópico de discusión, junto con la detección de bots dentro de la misma. Este sistema ha sido ocupado para la caracterizar la discusión en torno al referéndum por una nueva constitución en Chile el año 2020, y sigue siendo ocupado por académicos de distintas áreas de estudio para otros tópicos de discusión. Si bien Tsundoku es sumamente útil, también presenta ciertas limitantes que dificultan su uso. Principalmente se destaca el tiempo de ejecución excesivo en el preprocesamiento de tweets, influenciado por el manejo de datos con archivos en formato json, que son inadecuados para este tipo de estudios. Además, la clasificación del lugar de procedencia de los usuarios presenta resultados insatisfactorios, y muy por debajo de la evaluación de la predicción de postura. Así, nace la oportunidad de integrar herramientas de procesamiento masivo de datos dentro de Tsundoku, junto con algunas mejoras en torno a la clasificación que podrían explorarse. Para lo anterior, se integró el uso de la librería PyArrow que permite la interoperabilidad de librerías de manejo de dataframes como dask y pandas, además de incluir métodos optimizados para la lectura y escritura de archivos especializados para el manejo de grandes cantidades de datos. El nuevo formato ocupado para el manejo de dataframes corresponde a ficheros parquet, creado especialmente para lecturas eficientes. Además, se integraron word embeddings al proceso de clasificación, permitiendo añadir un acercamiento contextual al procesamiento de texto. Estos embeddings fueron obtenidos a partir de la arquitectura Transformers, ocupando el modelo pre-entrenado en español conocido como BETO y desarrollado por académicos de la Universidad de Chile. Lo anterior resultó en una reducción del 92 % del tiempo de ejecución para el preprocesamiento de tweets, junto con la creación de un programa que permita a los usuarios transformar sus datos de json a parquet para un manejo eficiente de datos. Por otro lado, la integración de word embeddings a la clasificación permitió aumentar en un 7 % la exactitud de la clasificación del lugar de origen del usuario. Se espera que la exploración e incorporación de más herramientas de procesamiento de lenguaje natural pueda ampliar las oportunidades de estudio y mejorar la detección de postura con Tsundoku"]},{"key":"dc:title","label":"Title","values":["Optimización del sistema de análisis y caracterización de discusiones en Twitter \"Tsundoku\""]}]}],"canonical_facts":{"dc:contributor.advisor":["Graells Garrido, Eduardo"],"dc:contributor.other":["Hevia Angulo, Alejandro","Villena Rodríguez, Fabián"],"dc:creator":["García Ríos, Nicolás Francisco"],"dc:date.accessioned":["2024-05-14T13:47:44Z"],"dc:date.available":["2024-05-14T13:47:44Z"],"dc:date.issued":["2023"],"dc:description.abstract":["Tsundoku es un sistema de análisis y de caracterización de discusiones en Twitter, desarrollado por el profesor Eduardo Graells Garrido en conjunto con otros académicos del área de la computación. El objetivo principal de este sistema es la detección de postura de los usuarios en torno a algún tópico de discusión, junto con la detección de bots dentro de la misma. Este sistema ha sido ocupado para la caracterizar la discusión en torno al referéndum por una nueva constitución en Chile el año 2020, y sigue siendo ocupado por académicos de distintas áreas de estudio para otros tópicos de discusión. Si bien Tsundoku es sumamente útil, también presenta ciertas limitantes que dificultan su uso. Principalmente se destaca el tiempo de ejecución excesivo en el preprocesamiento de tweets, influenciado por el manejo de datos con archivos en formato json, que son inadecuados para este tipo de estudios. Además, la clasificación del lugar de procedencia de los usuarios presenta resultados insatisfactorios, y muy por debajo de la evaluación de la predicción de postura. Así, nace la oportunidad de integrar herramientas de procesamiento masivo de datos dentro de Tsundoku, junto con algunas mejoras en torno a la clasificación que podrían explorarse. Para lo anterior, se integró el uso de la librería PyArrow que permite la interoperabilidad de librerías de manejo de dataframes como dask y pandas, además de incluir métodos optimizados para la lectura y escritura de archivos especializados para el manejo de grandes cantidades de datos. El nuevo formato ocupado para el manejo de dataframes corresponde a ficheros parquet, creado especialmente para lecturas eficientes. Además, se integraron word embeddings al proceso de clasificación, permitiendo añadir un acercamiento contextual al procesamiento de texto. Estos embeddings fueron obtenidos a partir de la arquitectura Transformers, ocupando el modelo pre-entrenado en español conocido como BETO y desarrollado por académicos de la Universidad de Chile. Lo anterior resultó en una reducción del 92 % del tiempo de ejecución para el preprocesamiento de tweets, junto con la creación de un programa que permita a los usuarios transformar sus datos de json a parquet para un manejo eficiente de datos. Por otro lado, la integración de word embeddings a la clasificación permitió aumentar en un 7 % la exactitud de la clasificación del lugar de origen del usuario. Se espera que la exploración e incorporación de más herramientas de procesamiento de lenguaje natural pueda ampliar las oportunidades de estudio y mejorar la detección de postura con Tsundoku"],"dc:identifier.other":["10.58011/dnzh-9p19"],"dc:identifier.uri":["https://repositorio.uchile.cl/handle/2250/198541"],"dc:language.iso":["es"],"dc:publisher":["Universidad de Chile"],"dc:rights":["Attribution-NonCommercial-NoDerivs 3.0 United States"],"dc:rights.uri":["http://creativecommons.org/licenses/by-nc-nd/3.0/us/"],"dc:title":["Optimización del sistema de análisis y caracterización de discusiones en Twitter \"Tsundoku\""],"dc:type":["Tesis"]},"updated_at":"2026-07-27T19:10:05Z"}