{"id":{"repo_id":"lima","oai_identifier":"oai:repositorio.ulima.edu.pe:20.500.12724/23146"},"canonical_url":"https://search.dev.ndltd.org/etd/lima/oai:repositorio.ulima.edu.pe:20.500.12724/23146","repository":{"repo_id":"lima","name":"Universidad de Lima","base_url":"https://repositorio.ulima.edu.pe/oai/request"},"display":{"title":"Modelos de machine learning para el análisis de calidad del agua y su contribución para la agricultura","abstract":"El presente trabajo aplica modelos de machine learning para analizar los parámetros que influyen en la calidad del agua en la cuenca del río Chancay - Lambayeque, con especial énfasis en su impacto sobre la agricultura. Se utilizó la metodología CRISP-DM, empleando la plataforma Orange para el modelado y evaluación de distintos modelos de machine learning (multiple linear regression (MLR), support vector machine (SVM), decision tree (DT), random forest (RF), artificial neural network (ANN) y xgboost (extreme gradient boosting)). Los modelos fueron evaluados mediante R2, MAE, MSE y RMSE, destacando el buen desempeño del Random Forest, Decision Tree, ANN para el análisis del OD con un R2 de 0,741, 0714 y 0,785 respectivamente; para el análisis de la DBO los resultados del R2 fueron 0,856, 0,901 y 0,871. Por otro lado, el modelo de XGBoost sólo presentó buenos resultados con la DBO, siendo un R2 de 0,815. Los parámetros con mayor relevancia para las variables Oxígeno Disuelto (OD) y Demanda Bioquímica de Oxígeno (DBO) fueron el Cadmio y Fósforo Total, presentando un score máximo de 0,684 y 0,287 respectivamente. Asimismo, los parámetros que también presentaron un buen score fueron Boro y Litio (para OD) y Nitrógeno Total y Cromo Total (para DBO), según análisis de importancia de atributos (RReliefF y Score obtenido). Se recomienda priorizar el monitoreo de estos elementos y revisar su inclusión en los Estándares de Calidad Ambiental para el Agua (ECA) para categoría 3 (riego y bebida de animales). Los resultados evidencian el potencial del machine learning como herramienta para mejorar la gestión hídrica en contextos agrícolas.","abstract_html":"El presente trabajo aplica modelos de machine learning para analizar los parámetros que influyen en la calidad del agua en la cuenca del río Chancay - Lambayeque, con especial énfasis en su impacto sobre la agricultura. Se utilizó la metodología CRISP-DM, empleando la plataforma Orange para el modelado y evaluación de distintos modelos de machine learning (multiple linear regression (MLR), support vector machine (SVM), decision tree (DT), random forest (RF), artificial neural network (ANN) y xgboost (extreme gradient boosting)). Los modelos fueron evaluados mediante R2, MAE, MSE y RMSE, destacando el buen desempeño del Random Forest, Decision Tree, ANN para el análisis del OD con un R2 de 0,741, 0714 y 0,785 respectivamente; para el análisis de la DBO los resultados del R2 fueron 0,856, 0,901 y 0,871. Por otro lado, el modelo de XGBoost sólo presentó buenos resultados con la DBO, siendo un R2 de 0,815. Los parámetros con mayor relevancia para las variables Oxígeno Disuelto (OD) y Demanda Bioquímica de Oxígeno (DBO) fueron el Cadmio y Fósforo Total, presentando un score máximo de 0,684 y 0,287 respectivamente. Asimismo, los parámetros que también presentaron un buen score fueron Boro y Litio (para OD) y Nitrógeno Total y Cromo Total (para DBO), según análisis de importancia de atributos (RReliefF y Score obtenido). Se recomienda priorizar el monitoreo de estos elementos y revisar su inclusión en los Estándares de Calidad Ambiental para el Agua (ECA) para categoría 3 (riego y bebida de animales). Los resultados evidencian el potencial del machine learning como herramienta para mejorar la gestión hídrica en contextos agrícolas.","abstract_has_math":false,"creators":["Delgado Pinedo, Daniel Francisco","Trujillo Vasquez, Sergio Alejandro"],"institution":"Universidad de Lima","degree_name":"Ingeniero Industrial","degree_level":"Título profesional","degree_discipline":"Ingeniería Industrial","degree_department":null,"school":null,"contributors":[],"advisors":["Corzo Chávez, Jorge Antonio"],"committee_chairs":[],"committee_members":[],"year":2025,"date_issued":"2025","date_published":"2025","updated_at":"2026-07-24T02:49:55Z","subjects":[],"languages":["spa"],"rights":["info:eu-repo/semantics/openAccess"],"rights_urls":["https://creativecommons.org/licenses/by-nc-sa/4.0"],"identifier_entries":[]},"links":{"outbound_url":"https://hdl.handle.net/20.500.12724/23146","outbound_label":"Handle","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor.advisor","label":"Advisor","values":["Corzo Chávez, Jorge Antonio"]},{"key":"dc:creator","label":"Author","values":["Delgado Pinedo, Daniel Francisco","Trujillo Vasquez, Sergio Alejandro"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2025-09-04T12:52:06Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2025-09-04T12:52:06Z"]},{"key":"dc:date.issued","label":"Date","values":["2025"]},{"key":"dc:publisher","label":"Institution","values":["Universidad de Lima"]},{"key":"dc:type","label":"Dc Type","values":["info:eu-repo/semantics/bachelorThesis"]},{"key":"thesis:degree_discipline","label":"Discipline","values":["Ingeniería Industrial"]},{"key":"thesis:degree_level","label":"Degree Level","values":["Título profesional"]},{"key":"thesis:degree_name","label":"Degree Name","values":["Ingeniero Industrial"]},{"key":"thesis:institution_name","label":"Thesis Institution Name","values":["Universidad de Lima. Facultad de Ingeniería"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["spa"]},{"key":"dc:rights","label":"Dc Rights","values":["info:eu-repo/semantics/openAccess"]},{"key":"dc:rights.uri","label":"Rights URI","values":["https://creativecommons.org/licenses/by-nc-sa/4.0"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.uri","label":"Identifier URI","values":["https://hdl.handle.net/20.500.12724/23146"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["El presente trabajo aplica modelos de machine learning para analizar los parámetros que influyen en la calidad del agua en la cuenca del río Chancay - Lambayeque, con especial énfasis en su impacto sobre la agricultura. Se utilizó la metodología CRISP-DM, empleando la plataforma Orange para el modelado y evaluación de distintos modelos de machine learning (multiple linear regression (MLR), support vector machine (SVM), decision tree (DT), random forest (RF), artificial neural network (ANN) y xgboost (extreme gradient boosting)). Los modelos fueron evaluados mediante R2, MAE, MSE y RMSE, destacando el buen desempeño del Random Forest, Decision Tree, ANN para el análisis del OD con un R2 de 0,741, 0714 y 0,785 respectivamente; para el análisis de la DBO los resultados del R2 fueron 0,856, 0,901 y 0,871. Por otro lado, el modelo de XGBoost sólo presentó buenos resultados con la DBO, siendo un R2 de 0,815. Los parámetros con mayor relevancia para las variables Oxígeno Disuelto (OD) y Demanda Bioquímica de Oxígeno (DBO) fueron el Cadmio y Fósforo Total, presentando un score máximo de 0,684 y 0,287 respectivamente. Asimismo, los parámetros que también presentaron un buen score fueron Boro y Litio (para OD) y Nitrógeno Total y Cromo Total (para DBO), según análisis de importancia de atributos (RReliefF y Score obtenido). Se recomienda priorizar el monitoreo de estos elementos y revisar su inclusión en los Estándares de Calidad Ambiental para el Agua (ECA) para categoría 3 (riego y bebida de animales). Los resultados evidencian el potencial del machine learning como herramienta para mejorar la gestión hídrica en contextos agrícolas.","This study applies machine learning models to analyze the parameters that influence water quality in the Chancay - Lambayeque river basin, with a special focus on their impact on agriculture. The CRISP-DM methodology was used, employing the Orange platform for modeling and evaluating various machine learning models (multiple linear regression (MLR), support vector machine (SVM), decision tree (DT), random forest (RF), artificial neural network (ANN), and XGBoost (extreme gradient boosting)). The models were evaluated using R², MAE, MSE, and RMSE, highlighting the strong performance of Random Forest, Decision Tree, and ANN in the analysis of dissolved oxygen (DO), with R² values of 0.741, 0.714, and 0.785 respectively. For the analysis of biochemical oxygen demand (BOD), the R² results were 0.856, 0.901, and 0.871, respectively. On the other hand, the XGBoost model only performed well for BOD, achieving an R² of 0.815. The most relevant parameters for the variables Dissolved Oxygen (DO) and Biochemical Oxygen Demand (BOD) were Cadmium and Total Phosphorus, with maximum scores of 0.684 and 0.287, respectively. Additionally, parameters such as Boron and Lithium (for DO), and Total Nitrogen and Total Chromium (for BOD) also showed strong scores, according to attribute importance analysis (RReliefF and obtained scores). It is recommended to prioritize the monitoring of these elements and to review their inclusion in the Water Enviroment Quality Standards (EQS) for category 3 (irrigation and animal drinking). The results demonstrate the potential of machine learning as a tool to improve water management in agricultural contexts."]},{"key":"dc:format","label":"Dc Format","values":["application/pdf"]},{"key":"dc:title","label":"Title","values":["Modelos de machine learning para el análisis de calidad del agua y su contribución para la agricultura"]}]}],"canonical_facts":{"dc:contributor.advisor":["Corzo Chávez, Jorge Antonio"],"dc:creator":["Delgado Pinedo, Daniel Francisco","Trujillo Vasquez, Sergio Alejandro"],"dc:date.accessioned":["2025-09-04T12:52:06Z"],"dc:date.available":["2025-09-04T12:52:06Z"],"dc:date.issued":["2025"],"dc:description.abstract":["El presente trabajo aplica modelos de machine learning para analizar los parámetros que influyen en la calidad del agua en la cuenca del río Chancay - Lambayeque, con especial énfasis en su impacto sobre la agricultura. Se utilizó la metodología CRISP-DM, empleando la plataforma Orange para el modelado y evaluación de distintos modelos de machine learning (multiple linear regression (MLR), support vector machine (SVM), decision tree (DT), random forest (RF), artificial neural network (ANN) y xgboost (extreme gradient boosting)). Los modelos fueron evaluados mediante R2, MAE, MSE y RMSE, destacando el buen desempeño del Random Forest, Decision Tree, ANN para el análisis del OD con un R2 de 0,741, 0714 y 0,785 respectivamente; para el análisis de la DBO los resultados del R2 fueron 0,856, 0,901 y 0,871. Por otro lado, el modelo de XGBoost sólo presentó buenos resultados con la DBO, siendo un R2 de 0,815. Los parámetros con mayor relevancia para las variables Oxígeno Disuelto (OD) y Demanda Bioquímica de Oxígeno (DBO) fueron el Cadmio y Fósforo Total, presentando un score máximo de 0,684 y 0,287 respectivamente. Asimismo, los parámetros que también presentaron un buen score fueron Boro y Litio (para OD) y Nitrógeno Total y Cromo Total (para DBO), según análisis de importancia de atributos (RReliefF y Score obtenido). Se recomienda priorizar el monitoreo de estos elementos y revisar su inclusión en los Estándares de Calidad Ambiental para el Agua (ECA) para categoría 3 (riego y bebida de animales). Los resultados evidencian el potencial del machine learning como herramienta para mejorar la gestión hídrica en contextos agrícolas.","This study applies machine learning models to analyze the parameters that influence water quality in the Chancay - Lambayeque river basin, with a special focus on their impact on agriculture. The CRISP-DM methodology was used, employing the Orange platform for modeling and evaluating various machine learning models (multiple linear regression (MLR), support vector machine (SVM), decision tree (DT), random forest (RF), artificial neural network (ANN), and XGBoost (extreme gradient boosting)). The models were evaluated using R², MAE, MSE, and RMSE, highlighting the strong performance of Random Forest, Decision Tree, and ANN in the analysis of dissolved oxygen (DO), with R² values of 0.741, 0.714, and 0.785 respectively. For the analysis of biochemical oxygen demand (BOD), the R² results were 0.856, 0.901, and 0.871, respectively. On the other hand, the XGBoost model only performed well for BOD, achieving an R² of 0.815. The most relevant parameters for the variables Dissolved Oxygen (DO) and Biochemical Oxygen Demand (BOD) were Cadmium and Total Phosphorus, with maximum scores of 0.684 and 0.287, respectively. Additionally, parameters such as Boron and Lithium (for DO), and Total Nitrogen and Total Chromium (for BOD) also showed strong scores, according to attribute importance analysis (RReliefF and obtained scores). It is recommended to prioritize the monitoring of these elements and to review their inclusion in the Water Enviroment Quality Standards (EQS) for category 3 (irrigation and animal drinking). The results demonstrate the potential of machine learning as a tool to improve water management in agricultural contexts."],"dc:format":["application/pdf"],"dc:identifier.uri":["https://hdl.handle.net/20.500.12724/23146"],"dc:language.iso":["spa"],"dc:publisher":["Universidad de Lima"],"dc:rights":["info:eu-repo/semantics/openAccess"],"dc:rights.uri":["https://creativecommons.org/licenses/by-nc-sa/4.0"],"dc:title":["Modelos de machine learning para el análisis de calidad del agua y su contribución para la agricultura"],"dc:type":["info:eu-repo/semantics/bachelorThesis"],"thesis:degree_discipline":["Ingeniería Industrial"],"thesis:degree_level":["Título profesional"],"thesis:degree_name":["Ingeniero Industrial"],"thesis:institution_name":["Universidad de Lima. Facultad de Ingeniería"]},"updated_at":"2026-07-24T02:49:55Z"}