{"id":{"repo_id":"cadiz","oai_identifier":"oai:rodin.uca.es:10498/39668"},"canonical_url":"https://search.dev.ndltd.org/etd/cadiz/oai:rodin.uca.es:10498/39668","repository":{"repo_id":"cadiz","name":"Universidad de Cadiz","base_url":"https://rodin.uca.es/oai/request"},"display":{"title":"Sistema automático de gestión de ciberataques","abstract":"Actualmente, todo usuario de un equipo informático debe tener en cuenta que cualquier equipo conectado a una red es vulnerable. Este problema no es nuevo, ya que existe desde que se diseñó Internet. Cuando se crearon los protocolos de comunicación en los años 70, el objetivo era compartir recursos en un entorno de confianza, no la seguridad. Sin embargo, con la expansión global de Internet y su uso comercial, esa falta de seguridad se ha convertido en un enorme problema. Las herramientas que se suelen utilizar para la protección de equipos informáticos, tales como antivirus basados en firmas o cortafuegos, han demostrado no ser suficientes. De hecho, siempre van un paso por detrás de los atacantes. Hoy en día, las amenazas son tan sofisticadas y rápidas que la intervención humana ya no es suficiente para contenerlas. Por ello, el uso de la inteligencia artificial (AI) se ha convertido en una técnica imprescindible para analizar el tráfico de red y gestionar los ataques de forma automática. Esta tesis doctoral surge de la necesidad de superar las limitaciones de las herramientas actuales. Se han podido identificar tres problemas principales: la escasez de datos de calidad para investigar, la necesidad de detectar ataques con mayor precisión, minimizando falsas alarmas, y la identificación de ataques desconocidos. Para solucionar esto, en esta tesis doctoral se ha diseñado un sistema de gestión de ciberataques dividido en tres partes: - Generación de datos: el primer problema encontrado para entrenar un modelo de AI es que los conjuntos de datos públicos suelen estar obsoletos o mal etiquetados. Para resolverlo, se ha creado un sistema que genera datos a medida. En lugar de generar datos sintéticos, se ha diseñado una solución que despliega una red utilizando la herramienta Docker. Esto permite simular ataques en un entorno controlado, capturar el tráfico, transformarlo en estadísticas de flujos de red y etiquetarlo automáticamente. Así se consiguen datos de alta calidad y perfectamente etiquetados, sabiendo perfectamente qué es tráfico normal y qué es un ataque. - Detección de ciberataques: este sistema se ha diseñado mediante la adaptación de un modelo extenso de lenguaje (LLM), concretamente T5, a una tarea de detección de ataques. Esto ha sido una idea novedosa. Partiendo de la premisa de que, si los LLM entienden el lenguaje humano, también pueden entender el tráfico de red, se transforman los datos numéricos de las estadísticas de flujos de red en frases de texto que el modelo puede procesar. Los resultados han sido prometedores. Tras una etapa de ajuste, el sistema fue capaz de distinguir el tráfico normal del malicioso e incluso especificar el tipo de ataque exacto. Se utilizaron los conjuntos de datos CIC-IDS-2017, CSE-CIC-IDS2018 y BCCC-CIC-IDS-2017, elegidos por ser los más empleados en los estudios disponibles en la literatura y porque contienen los tipos de ataques más modernos y populares. Para todas las métricas de evaluación (tasa de acierto, precisión, sensibilidad y valor-F ), los resultados superaron el 99,94 % para el primer conjunto de datos, 99,84 % para el segundo y 99,9 % para el tercero. - Predicción de ciberataques desconocidos: finalmente, se aborda el problema de predecir ataques que nunca han sido vistos por el modelo. Se ha diseñado una serie de experimentos para probar si el modelo podía detectar un tipo de ataque que nunca había visto durante su entrenamiento. Aquí se descubrió algo muy interesante sobre el uso del timestamp, ya que se pudo demostrar que eliminar el timestamp mejora los resultados. Al quitar la información temporal, se obliga al modelo a centrarse solo en los valores estadísticos que representan un ataque. Esto hace que el sistema sea capaz de generalizar mejor ante amenazas desconocidas. Por lo tanto, con esta tesis doctoral se presenta una solución que se encarga desde la generación automática de datos fiables hasta un sistema de detección y predicción. Los resultados confirman que adaptar los LLM al análisis de red es una estrategia viable y muy eficaz para utilizarlo como protección en un entorno cada vez más preocupante y cambiante.","abstract_html":"Actualmente, todo usuario de un equipo informático debe tener en cuenta que cualquier equipo conectado a una red es vulnerable. Este problema no es nuevo, ya que existe desde que se diseñó Internet. Cuando se crearon los protocolos de comunicación en los años 70, el objetivo era compartir recursos en un entorno de confianza, no la seguridad. Sin embargo, con la expansión global de Internet y su uso comercial, esa falta de seguridad se ha convertido en un enorme problema. Las herramientas que se suelen utilizar para la protección de equipos informáticos, tales como antivirus basados en firmas o cortafuegos, han demostrado no ser suficientes. De hecho, siempre van un paso por detrás de los atacantes. Hoy en día, las amenazas son tan sofisticadas y rápidas que la intervención humana ya no es suficiente para contenerlas. Por ello, el uso de la inteligencia artificial (AI) se ha convertido en una técnica imprescindible para analizar el tráfico de red y gestionar los ataques de forma automática. Esta tesis doctoral surge de la necesidad de superar las limitaciones de las herramientas actuales. Se han podido identificar tres problemas principales: la escasez de datos de calidad para investigar, la necesidad de detectar ataques con mayor precisión, minimizando falsas alarmas, y la identificación de ataques desconocidos. Para solucionar esto, en esta tesis doctoral se ha diseñado un sistema de gestión de ciberataques dividido en tres partes: - Generación de datos: el primer problema encontrado para entrenar un modelo de AI es que los conjuntos de datos públicos suelen estar obsoletos o mal etiquetados. Para resolverlo, se ha creado un sistema que genera datos a medida. En lugar de generar datos sintéticos, se ha diseñado una solución que despliega una red utilizando la herramienta Docker. Esto permite simular ataques en un entorno controlado, capturar el tráfico, transformarlo en estadísticas de flujos de red y etiquetarlo automáticamente. Así se consiguen datos de alta calidad y perfectamente etiquetados, sabiendo perfectamente qué es tráfico normal y qué es un ataque. - Detección de ciberataques: este sistema se ha diseñado mediante la adaptación de un modelo extenso de lenguaje (LLM), concretamente T5, a una tarea de detección de ataques. Esto ha sido una idea novedosa. Partiendo de la premisa de que, si los LLM entienden el lenguaje humano, también pueden entender el tráfico de red, se transforman los datos numéricos de las estadísticas de flujos de red en frases de texto que el modelo puede procesar. Los resultados han sido prometedores. Tras una etapa de ajuste, el sistema fue capaz de distinguir el tráfico normal del malicioso e incluso especificar el tipo de ataque exacto. Se utilizaron los conjuntos de datos CIC-IDS-2017, CSE-CIC-IDS2018 y BCCC-CIC-IDS-2017, elegidos por ser los más empleados en los estudios disponibles en la literatura y porque contienen los tipos de ataques más modernos y populares. Para todas las métricas de evaluación (tasa de acierto, precisión, sensibilidad y valor-F ), los resultados superaron el 99,94 % para el primer conjunto de datos, 99,84 % para el segundo y 99,9 % para el tercero. - Predicción de ciberataques desconocidos: finalmente, se aborda el problema de predecir ataques que nunca han sido vistos por el modelo. Se ha diseñado una serie de experimentos para probar si el modelo podía detectar un tipo de ataque que nunca había visto durante su entrenamiento. Aquí se descubrió algo muy interesante sobre el uso del timestamp, ya que se pudo demostrar que eliminar el timestamp mejora los resultados. Al quitar la información temporal, se obliga al modelo a centrarse solo en los valores estadísticos que representan un ataque. Esto hace que el sistema sea capaz de generalizar mejor ante amenazas desconocidas. Por lo tanto, con esta tesis doctoral se presenta una solución que se encarga desde la generación automática de datos fiables hasta un sistema de detección y predicción. Los resultados confirman que adaptar los LLM al análisis de red es una estrategia viable y muy eficaz para utilizarlo como protección en un entorno cada vez más preocupante y cambiante.","abstract_has_math":false,"creators":["Gutiérrez Galeano, Leopoldo Jesús"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":["Domínguez Jiménez, Juan José","Medina Bulo, María Inmaculada"],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-07-24T01:29:27Z","subjects":[],"languages":["spa"],"rights":["Attribution-NonCommercial-NoDerivatives 4.0 Internacional"],"rights_urls":["http://creativecommons.org/licenses/by-nc-nd/4.0/"],"identifier_entries":[]},"links":{"outbound_url":"http://hdl.handle.net/10498/39668","outbound_label":"Handle","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor.advisor","label":"Advisor","values":["Domínguez Jiménez, Juan José","Medina Bulo, María Inmaculada"]},{"key":"dc:contributor.other","label":"Dc Contributor Other","values":["Ingeniería Informática"]},{"key":"dc:creator","label":"Author","values":["Gutiérrez Galeano, Leopoldo Jesús"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2026-05-27T06:31:54Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2026-05-27T06:31:54Z"]},{"key":"dc:date.issued","label":"Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["doctoral thesis"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["spa"]},{"key":"dc:rights","label":"Dc Rights","values":["Attribution-NonCommercial-NoDerivatives 4.0 Internacional"]},{"key":"dc:rights.uri","label":"Rights URI","values":["http://creativecommons.org/licenses/by-nc-nd/4.0/"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.uri","label":"Identifier URI","values":["http://hdl.handle.net/10498/39668"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["Actualmente, todo usuario de un equipo informático debe tener en cuenta que cualquier equipo conectado a una red es vulnerable. Este problema no es nuevo, ya que existe desde que se diseñó Internet. Cuando se crearon los protocolos de comunicación en los años 70, el objetivo era compartir recursos en un entorno de confianza, no la seguridad. Sin embargo, con la expansión global de Internet y su uso comercial, esa falta de seguridad se ha convertido en un enorme problema. Las herramientas que se suelen utilizar para la protección de equipos informáticos, tales como antivirus basados en firmas o cortafuegos, han demostrado no ser suficientes. De hecho, siempre van un paso por detrás de los atacantes. Hoy en día, las amenazas son tan sofisticadas y rápidas que la intervención humana ya no es suficiente para contenerlas. Por ello, el uso de la inteligencia artificial (AI) se ha convertido en una técnica imprescindible para analizar el tráfico de red y gestionar los ataques de forma automática. Esta tesis doctoral surge de la necesidad de superar las limitaciones de las herramientas actuales. Se han podido identificar tres problemas principales: la escasez de datos de calidad para investigar, la necesidad de detectar ataques con mayor precisión, minimizando falsas alarmas, y la identificación de ataques desconocidos. Para solucionar esto, en esta tesis doctoral se ha diseñado un sistema de gestión de ciberataques dividido en tres partes: - Generación de datos: el primer problema encontrado para entrenar un modelo de AI es que los conjuntos de datos públicos suelen estar obsoletos o mal etiquetados. Para resolverlo, se ha creado un sistema que genera datos a medida. En lugar de generar datos sintéticos, se ha diseñado una solución que despliega una red utilizando la herramienta Docker. Esto permite simular ataques en un entorno controlado, capturar el tráfico, transformarlo en estadísticas de flujos de red y etiquetarlo automáticamente. Así se consiguen datos de alta calidad y perfectamente etiquetados, sabiendo perfectamente qué es tráfico normal y qué es un ataque. - Detección de ciberataques: este sistema se ha diseñado mediante la adaptación de un modelo extenso de lenguaje (LLM), concretamente T5, a una tarea de detección de ataques. Esto ha sido una idea novedosa. Partiendo de la premisa de que, si los LLM entienden el lenguaje humano, también pueden entender el tráfico de red, se transforman los datos numéricos de las estadísticas de flujos de red en frases de texto que el modelo puede procesar. Los resultados han sido prometedores. Tras una etapa de ajuste, el sistema fue capaz de distinguir el tráfico normal del malicioso e incluso especificar el tipo de ataque exacto. Se utilizaron los conjuntos de datos CIC-IDS-2017, CSE-CIC-IDS2018 y BCCC-CIC-IDS-2017, elegidos por ser los más empleados en los estudios disponibles en la literatura y porque contienen los tipos de ataques más modernos y populares. Para todas las métricas de evaluación (tasa de acierto, precisión, sensibilidad y valor-F ), los resultados superaron el 99,94 % para el primer conjunto de datos, 99,84 % para el segundo y 99,9 % para el tercero. - Predicción de ciberataques desconocidos: finalmente, se aborda el problema de predecir ataques que nunca han sido vistos por el modelo. Se ha diseñado una serie de experimentos para probar si el modelo podía detectar un tipo de ataque que nunca había visto durante su entrenamiento. Aquí se descubrió algo muy interesante sobre el uso del timestamp, ya que se pudo demostrar que eliminar el timestamp mejora los resultados. Al quitar la información temporal, se obliga al modelo a centrarse solo en los valores estadísticos que representan un ataque. Esto hace que el sistema sea capaz de generalizar mejor ante amenazas desconocidas. Por lo tanto, con esta tesis doctoral se presenta una solución que se encarga desde la generación automática de datos fiables hasta un sistema de detección y predicción. Los resultados confirman que adaptar los LLM al análisis de red es una estrategia viable y muy eficaz para utilizarlo como protección en un entorno cada vez más preocupante y cambiante.","Currently, every computer user must keep in mind that any equipment connected to a network is vulnerable. This problem is not new, as it has existed since the Internet was designed. When communication protocols were created in the 70s, the objective was resource sharing in a trusted environment, not security. However, with the global expansion of the Internet and its commercial use, that lack of security has become a significant problem. The tools usually used for the protection of computer equipment, such as signaturebased antivirus or firewalls, have proven to be insufficient. In fact, they are always one step behind attackers. Today, threats are so sophisticated and fast that human intervention is no longer sufficient to contain them. For this reason, the use of Artificial Intelligence (AI) has become an essential technique to analyse network traffic and manage attacks automatically. This PhD thesis arises from the need to overcome the limitations of current tools. Three main problems have been identified: the scarcity of quality data for research, the need to detect attacks with greater precision while minimising false alarms, and the identification of unknown attacks. To solve this, a cyberattack management system divided into three parts has been designed in this PhD thesis: Data generation: The first problem found in training an AI model is that public datasets are usually obsolete or poorly labelled. To resolve this, a system that generates custom data has been created. Instead of generating synthetic data, a solution has been designed that deploys a network using the Docker tool. This allows for simulating attacks in a controlled environment, capturing traffic, transforming it into network flow statistics, and labelling it automatically. Thus, high-quality and perfectly labelled data are achieved, with a clear understanding of what constitutes normal traffic and what is an attack. Cyberattack detection: This system has been designed by adapting a Large Language Model (LLM), specifically T5, to an attack detection task. This has been a novel idea. Starting from the premise that if LLMs understand human language, they can also understand network traffic, numerical data from network flow statistics are transformed into text sentences that the model can process. The results have been promising. After a fine-tuning stage, the system was able to distinguish normal from malicious traffic and even specify the exact type of attack. The CIC-IDS-2017, CSE-CIC-IDS2018, and BCCC-CIC-IDS-2017 datasets were used, chosen for being the most employed in studies available in the literature and because they contain the most modern and popular attack types. For all evaluation metrics (accuracy, precision, recall, and F-score), the results exceeded 99.94% for the first dataset, 99.84% for the second, and 99.9% for the third. Unknown cyberattack prediction: Finally, the problem of predicting attacks that have never been seen by the model is addressed. A series of experiments has been designed to test whether the model could detect a type of attack it had never seen during its training. Here, something very interesting was discovered regarding the use of the timestamp, as it could be demonstrated that eliminating the timestamp improves results. By removing temporal information, the model is forced to focus only on the statistical values that represent an attack. This makes the system capable of generalising better against unknown threats. Therefore, with this PhD thesis, a solution is presented that handles everything from the automatic generation of reliable data to a detection and prediction system. The results confirm that adapting LLMs to network analysis is a viable and very effective strategy to use as protection in an increasingly worrying and changing environment."]},{"key":"dc:format","label":"Dc Format","values":["application/pdf"]},{"key":"dc:title","label":"Title","values":["Sistema automático de gestión de ciberataques"]}]}],"canonical_facts":{"dc:contributor.advisor":["Domínguez Jiménez, Juan José","Medina Bulo, María Inmaculada"],"dc:contributor.other":["Ingeniería Informática"],"dc:creator":["Gutiérrez Galeano, Leopoldo Jesús"],"dc:date.accessioned":["2026-05-27T06:31:54Z"],"dc:date.available":["2026-05-27T06:31:54Z"],"dc:date.issued":["2026"],"dc:description.abstract":["Actualmente, todo usuario de un equipo informático debe tener en cuenta que cualquier equipo conectado a una red es vulnerable. Este problema no es nuevo, ya que existe desde que se diseñó Internet. Cuando se crearon los protocolos de comunicación en los años 70, el objetivo era compartir recursos en un entorno de confianza, no la seguridad. Sin embargo, con la expansión global de Internet y su uso comercial, esa falta de seguridad se ha convertido en un enorme problema. Las herramientas que se suelen utilizar para la protección de equipos informáticos, tales como antivirus basados en firmas o cortafuegos, han demostrado no ser suficientes. De hecho, siempre van un paso por detrás de los atacantes. Hoy en día, las amenazas son tan sofisticadas y rápidas que la intervención humana ya no es suficiente para contenerlas. Por ello, el uso de la inteligencia artificial (AI) se ha convertido en una técnica imprescindible para analizar el tráfico de red y gestionar los ataques de forma automática. Esta tesis doctoral surge de la necesidad de superar las limitaciones de las herramientas actuales. Se han podido identificar tres problemas principales: la escasez de datos de calidad para investigar, la necesidad de detectar ataques con mayor precisión, minimizando falsas alarmas, y la identificación de ataques desconocidos. Para solucionar esto, en esta tesis doctoral se ha diseñado un sistema de gestión de ciberataques dividido en tres partes: - Generación de datos: el primer problema encontrado para entrenar un modelo de AI es que los conjuntos de datos públicos suelen estar obsoletos o mal etiquetados. Para resolverlo, se ha creado un sistema que genera datos a medida. En lugar de generar datos sintéticos, se ha diseñado una solución que despliega una red utilizando la herramienta Docker. Esto permite simular ataques en un entorno controlado, capturar el tráfico, transformarlo en estadísticas de flujos de red y etiquetarlo automáticamente. Así se consiguen datos de alta calidad y perfectamente etiquetados, sabiendo perfectamente qué es tráfico normal y qué es un ataque. - Detección de ciberataques: este sistema se ha diseñado mediante la adaptación de un modelo extenso de lenguaje (LLM), concretamente T5, a una tarea de detección de ataques. Esto ha sido una idea novedosa. Partiendo de la premisa de que, si los LLM entienden el lenguaje humano, también pueden entender el tráfico de red, se transforman los datos numéricos de las estadísticas de flujos de red en frases de texto que el modelo puede procesar. Los resultados han sido prometedores. Tras una etapa de ajuste, el sistema fue capaz de distinguir el tráfico normal del malicioso e incluso especificar el tipo de ataque exacto. Se utilizaron los conjuntos de datos CIC-IDS-2017, CSE-CIC-IDS2018 y BCCC-CIC-IDS-2017, elegidos por ser los más empleados en los estudios disponibles en la literatura y porque contienen los tipos de ataques más modernos y populares. Para todas las métricas de evaluación (tasa de acierto, precisión, sensibilidad y valor-F ), los resultados superaron el 99,94 % para el primer conjunto de datos, 99,84 % para el segundo y 99,9 % para el tercero. - Predicción de ciberataques desconocidos: finalmente, se aborda el problema de predecir ataques que nunca han sido vistos por el modelo. Se ha diseñado una serie de experimentos para probar si el modelo podía detectar un tipo de ataque que nunca había visto durante su entrenamiento. Aquí se descubrió algo muy interesante sobre el uso del timestamp, ya que se pudo demostrar que eliminar el timestamp mejora los resultados. Al quitar la información temporal, se obliga al modelo a centrarse solo en los valores estadísticos que representan un ataque. Esto hace que el sistema sea capaz de generalizar mejor ante amenazas desconocidas. Por lo tanto, con esta tesis doctoral se presenta una solución que se encarga desde la generación automática de datos fiables hasta un sistema de detección y predicción. Los resultados confirman que adaptar los LLM al análisis de red es una estrategia viable y muy eficaz para utilizarlo como protección en un entorno cada vez más preocupante y cambiante.","Currently, every computer user must keep in mind that any equipment connected to a network is vulnerable. This problem is not new, as it has existed since the Internet was designed. When communication protocols were created in the 70s, the objective was resource sharing in a trusted environment, not security. However, with the global expansion of the Internet and its commercial use, that lack of security has become a significant problem. The tools usually used for the protection of computer equipment, such as signaturebased antivirus or firewalls, have proven to be insufficient. In fact, they are always one step behind attackers. Today, threats are so sophisticated and fast that human intervention is no longer sufficient to contain them. For this reason, the use of Artificial Intelligence (AI) has become an essential technique to analyse network traffic and manage attacks automatically. This PhD thesis arises from the need to overcome the limitations of current tools. Three main problems have been identified: the scarcity of quality data for research, the need to detect attacks with greater precision while minimising false alarms, and the identification of unknown attacks. To solve this, a cyberattack management system divided into three parts has been designed in this PhD thesis: Data generation: The first problem found in training an AI model is that public datasets are usually obsolete or poorly labelled. To resolve this, a system that generates custom data has been created. Instead of generating synthetic data, a solution has been designed that deploys a network using the Docker tool. This allows for simulating attacks in a controlled environment, capturing traffic, transforming it into network flow statistics, and labelling it automatically. Thus, high-quality and perfectly labelled data are achieved, with a clear understanding of what constitutes normal traffic and what is an attack. Cyberattack detection: This system has been designed by adapting a Large Language Model (LLM), specifically T5, to an attack detection task. This has been a novel idea. Starting from the premise that if LLMs understand human language, they can also understand network traffic, numerical data from network flow statistics are transformed into text sentences that the model can process. The results have been promising. After a fine-tuning stage, the system was able to distinguish normal from malicious traffic and even specify the exact type of attack. The CIC-IDS-2017, CSE-CIC-IDS2018, and BCCC-CIC-IDS-2017 datasets were used, chosen for being the most employed in studies available in the literature and because they contain the most modern and popular attack types. For all evaluation metrics (accuracy, precision, recall, and F-score), the results exceeded 99.94% for the first dataset, 99.84% for the second, and 99.9% for the third. Unknown cyberattack prediction: Finally, the problem of predicting attacks that have never been seen by the model is addressed. A series of experiments has been designed to test whether the model could detect a type of attack it had never seen during its training. Here, something very interesting was discovered regarding the use of the timestamp, as it could be demonstrated that eliminating the timestamp improves results. By removing temporal information, the model is forced to focus only on the statistical values that represent an attack. This makes the system capable of generalising better against unknown threats. Therefore, with this PhD thesis, a solution is presented that handles everything from the automatic generation of reliable data to a detection and prediction system. The results confirm that adapting LLMs to network analysis is a viable and very effective strategy to use as protection in an increasingly worrying and changing environment."],"dc:format":["application/pdf"],"dc:identifier.uri":["http://hdl.handle.net/10498/39668"],"dc:language.iso":["spa"],"dc:rights":["Attribution-NonCommercial-NoDerivatives 4.0 Internacional"],"dc:rights.uri":["http://creativecommons.org/licenses/by-nc-nd/4.0/"],"dc:title":["Sistema automático de gestión de ciberataques"],"dc:type":["doctoral thesis"]},"updated_at":"2026-07-24T01:29:27Z"}