{"id":{"repo_id":"cadiz","oai_identifier":"oai:rodin.uca.es:10498/36186"},"canonical_url":"https://search.dev.ndltd.org/etd/cadiz/oai:rodin.uca.es:10498/36186","repository":{"repo_id":"cadiz","name":"Universidad de Cadiz","base_url":"https://rodin.uca.es/oai/request"},"display":{"title":"Mejora en la calidad de los datos: Una perspectiva de las técnicas de preprocesado para la Minería de Datos","abstract":"En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \\textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento. La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático. Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos.","abstract_html":"En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \\textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento. La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático. Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos.","abstract_has_math":false,"creators":["Cabrera Sánchez, Juan Francisco"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":["Silva Ramírez, Esther Lydia"],"committee_chairs":[],"committee_members":[],"year":2025,"date_issued":"2025-03-06","date_published":"2025-03-06","updated_at":"2026-07-24T01:29:31Z","subjects":["Inteligencia Arficial","Missing Data","Preprocesado","Generación sintética"],"languages":["spa"],"rights":["Attribution-NonCommercial-NoDerivatives 4.0 Internacional"],"rights_urls":["http://creativecommons.org/licenses/by-nc-nd/4.0/"],"identifier_entries":[]},"links":{"outbound_url":"http://hdl.handle.net/10498/36186","outbound_label":"Handle","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor.advisor","label":"Advisor","values":["Silva Ramírez, Esther Lydia"]},{"key":"dc:contributor.other","label":"Dc Contributor Other","values":["Ingeniería Informática"]},{"key":"dc:creator","label":"Author","values":["Cabrera Sánchez, Juan Francisco"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2025-04-23T09:30:27Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2025-04-23T09:30:27Z"]},{"key":"dc:date.issued","label":"Date","values":["2025-03-06"]},{"key":"dc:type","label":"Dc Type","values":["doctoral thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Inteligencia Arficial","Missing Data","Preprocesado","Generación sintética"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["spa"]},{"key":"dc:rights","label":"Dc Rights","values":["Attribution-NonCommercial-NoDerivatives 4.0 Internacional"]},{"key":"dc:rights.uri","label":"Rights URI","values":["http://creativecommons.org/licenses/by-nc-nd/4.0/"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.uri","label":"Identifier URI","values":["http://hdl.handle.net/10498/36186"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \\textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento. La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático. Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos.","Nowadays, the volume of information transmitted each day continues to grow as the number of interconnected devices increases. In various domains, such as the Internet of Things, Computer Vision, and Big Data, this information is used to guide decision-making processes in both the public and private sectors. To this end, it is essential to carry out preliminary data preprocessing to enhance data quality. By doing so, the resulting data become consistent, valid, and prepared for subsequent use, thus enabling data-driven decisions. The preprocessing stage involves multiple phases aimed at improving data quality, including the detection and correction of noise, anomalies, or missing values. In addition, transformations are performed on datasets to provide them in an appropriate format for knowledge extraction models. The present doctoral thesis focuses on studying, improving, and proposing various data preprocessing techniques, with the objective of obtaining high-quality data that facilitate increased accuracy of models in regression and classification tasks. The research is centered on two main lines of inquiry. On the one hand, it addresses the issue of missing data, ranging from the synthetic generation of missing data to its resolution through the application of data imputation methods, alongside a real-world example to validate the stated hypotheses. On the other hand, it proposes techniques to reduce the size of the training set, thereby optimizing other aspects such as computation time, without compromising the performance of machine learning models. Both lines of research have been validated through publications in international journals, as well as presentations at national and international conferences. Thus, the hypotheses posed in the present doctoral thesis—grounded in improving data quality to enable the application of knowledge extraction models with the assurance of optimal results that support data-driven decision-making—are deemed to be substantiated."]},{"key":"dc:format","label":"Dc Format","values":["application/pdf"]},{"key":"dc:title","label":"Title","values":["Mejora en la calidad de los datos: Una perspectiva de las técnicas de preprocesado para la Minería de Datos"]}]}],"canonical_facts":{"dc:contributor.advisor":["Silva Ramírez, Esther Lydia"],"dc:contributor.other":["Ingeniería Informática"],"dc:creator":["Cabrera Sánchez, Juan Francisco"],"dc:date.accessioned":["2025-04-23T09:30:27Z"],"dc:date.available":["2025-04-23T09:30:27Z"],"dc:date.issued":["2025-03-06"],"dc:description.abstract":["En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \\textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento. La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático. Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos.","Nowadays, the volume of information transmitted each day continues to grow as the number of interconnected devices increases. In various domains, such as the Internet of Things, Computer Vision, and Big Data, this information is used to guide decision-making processes in both the public and private sectors. To this end, it is essential to carry out preliminary data preprocessing to enhance data quality. By doing so, the resulting data become consistent, valid, and prepared for subsequent use, thus enabling data-driven decisions. The preprocessing stage involves multiple phases aimed at improving data quality, including the detection and correction of noise, anomalies, or missing values. In addition, transformations are performed on datasets to provide them in an appropriate format for knowledge extraction models. The present doctoral thesis focuses on studying, improving, and proposing various data preprocessing techniques, with the objective of obtaining high-quality data that facilitate increased accuracy of models in regression and classification tasks. The research is centered on two main lines of inquiry. On the one hand, it addresses the issue of missing data, ranging from the synthetic generation of missing data to its resolution through the application of data imputation methods, alongside a real-world example to validate the stated hypotheses. On the other hand, it proposes techniques to reduce the size of the training set, thereby optimizing other aspects such as computation time, without compromising the performance of machine learning models. Both lines of research have been validated through publications in international journals, as well as presentations at national and international conferences. Thus, the hypotheses posed in the present doctoral thesis—grounded in improving data quality to enable the application of knowledge extraction models with the assurance of optimal results that support data-driven decision-making—are deemed to be substantiated."],"dc:format":["application/pdf"],"dc:identifier.uri":["http://hdl.handle.net/10498/36186"],"dc:language.iso":["spa"],"dc:rights":["Attribution-NonCommercial-NoDerivatives 4.0 Internacional"],"dc:rights.uri":["http://creativecommons.org/licenses/by-nc-nd/4.0/"],"dc:subject":["Inteligencia Arficial","Missing Data","Preprocesado","Generación sintética"],"dc:title":["Mejora en la calidad de los datos: Una perspectiva de las técnicas de preprocesado para la Minería de Datos"],"dc:type":["doctoral thesis"]},"updated_at":"2026-07-24T01:29:31Z"}