{"id":{"repo_id":"chile","oai_identifier":"oai:repositorio.uchile.cl:2250/186868"},"canonical_url":"https://search.dev.ndltd.org/etd/chile/oai:repositorio.uchile.cl:2250/186868","repository":{"repo_id":"chile","name":"Universidad de Chile","base_url":"https://repositorio.uchile.cl/oai/request"},"display":{"title":"Recuperación de imágenes basada en dibujos con técnicas de atención","abstract":"En la última década han tenido lugar notables avances en técnicas de aprendizaje de máquinas para el reconocimiento de imágenes, basadas en Deep Learning y Redes neuronales, que buscan extraer representaciones abstractas por medio del entrenamiento de la red con grandes cantidades de datos de ejemplo. La mayoría de las arquitecturas se han basado en la convolución discreta como bloque fundamental de construcción. Esta convolución discreta define filtros pequeños que \"pasan\" por la representación bidimensional de la imagen, de manera similar a como ocurre en la convolución continua entre dos funciones. Estos filtros se componen de parámetros entrenables que la red aprende y actúan como detectores de patrones visuales locales. A pesar de su utilidad, la convolución presenta algunas desventajas: es ineficiente para relacionar puntos distantes de la imagen (por ser ventanas locales), es invariante a la rotación (el mismo patrón rotado es considerado como diferente), y los filtros resultante son fijos (los patrones que detectan no se adaptan en función de la imagen). Una creciente de cantidad de investigación explora técnicas \"atencionales\" que, a grandes rasgos, imitan a la atención cognitiva de la que son capaces los seres humanos. Ilustrativamente, estas confieren la capacidad para atender de manera selectiva a elementos que son considerados más importantes, y permiten relacionarlos de manera contextual. Sin embargo, estas técnicas con frecuencia implican mayores costos de tiempo en la práctica, incluso si su eficiencia teórica se compara a la de modelos convolucionales. En este trabajo comparamos modelos convolucionales y atencionales puros contra una variedad de modelos híbridos, que utilizan convoluciones y 3 tipos de operación atencional, en distintas proporciones, en tareas de clasificación de imágenes y recuperación de imágenes en base a dibujos. Mostramos que algunos modelos híbridos pueden igualar o incluso superar a sus contra partes convolucionales y atencionales puras, con menor cantidad de parámetros entrenables que las redes convolucionales, y menores costos de tiempo que las atencionales.","abstract_html":"En la última década han tenido lugar notables avances en técnicas de aprendizaje de máquinas para el reconocimiento de imágenes, basadas en Deep Learning y Redes neuronales, que buscan extraer representaciones abstractas por medio del entrenamiento de la red con grandes cantidades de datos de ejemplo. La mayoría de las arquitecturas se han basado en la convolución discreta como bloque fundamental de construcción. Esta convolución discreta define filtros pequeños que &quot;pasan&quot; por la representación bidimensional de la imagen, de manera similar a como ocurre en la convolución continua entre dos funciones. Estos filtros se componen de parámetros entrenables que la red aprende y actúan como detectores de patrones visuales locales. A pesar de su utilidad, la convolución presenta algunas desventajas: es ineficiente para relacionar puntos distantes de la imagen (por ser ventanas locales), es invariante a la rotación (el mismo patrón rotado es considerado como diferente), y los filtros resultante son fijos (los patrones que detectan no se adaptan en función de la imagen). Una creciente de cantidad de investigación explora técnicas &quot;atencionales&quot; que, a grandes rasgos, imitan a la atención cognitiva de la que son capaces los seres humanos. Ilustrativamente, estas confieren la capacidad para atender de manera selectiva a elementos que son considerados más importantes, y permiten relacionarlos de manera contextual. Sin embargo, estas técnicas con frecuencia implican mayores costos de tiempo en la práctica, incluso si su eficiencia teórica se compara a la de modelos convolucionales. En este trabajo comparamos modelos convolucionales y atencionales puros contra una variedad de modelos híbridos, que utilizan convoluciones y 3 tipos de operación atencional, en distintas proporciones, en tareas de clasificación de imágenes y recuperación de imágenes en base a dibujos. Mostramos que algunos modelos híbridos pueden igualar o incluso superar a sus contra partes convolucionales y atencionales puras, con menor cantidad de parámetros entrenables que las redes convolucionales, y menores costos de tiempo que las atencionales.","abstract_has_math":false,"creators":["Mondaca Wyman, Gonzalo Andrés"],"institution":"Universidad de Chile","degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":["Saavedra Rondo, José"],"committee_chairs":[],"committee_members":[],"year":2022,"date_issued":"2022","date_published":"2022","updated_at":"2026-07-27T19:10:00Z","subjects":["Procesamiento de imagen","Recuperación de imágenes","Clasificación de imágenes","Deep learning","Modelos convolucionales"],"languages":["es"],"rights":["Attribution-NonCommercial-NoDerivs 3.0 United States"],"rights_urls":["http://creativecommons.org/licenses/by-nc-nd/3.0/us/"],"identifier_entries":[{"key":"dc:identifier.other","label":"Dc Identifier Other","values":["10.58011/bmgb-7s79"],"render_values":[{"text":"10.58011/bmgb-7s79","href":"https://doi.org/10.58011/bmgb-7s79","code":true}]}]},"links":{"outbound_url":"https://repositorio.uchile.cl/handle/2250/186868","outbound_label":"Repository record","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor.advisor","label":"Advisor","values":["Saavedra Rondo, José"]},{"key":"dc:contributor.other","label":"Dc Contributor Other","values":["Navarro Badino, Gonzalo","Rivara Zúñiga, María Cecilia"]},{"key":"dc:creator","label":"Author","values":["Mondaca Wyman, Gonzalo Andrés"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2022-07-21T14:31:12Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2022-07-21T14:31:12Z"]},{"key":"dc:date.issued","label":"Date","values":["2022"]},{"key":"dc:publisher","label":"Institution","values":["Universidad de Chile"]},{"key":"dc:type","label":"Dc Type","values":["Tesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Procesamiento de imagen","Recuperación de imágenes","Clasificación de imágenes","Deep learning","Modelos convolucionales"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["es"]},{"key":"dc:rights","label":"Dc Rights","values":["Attribution-NonCommercial-NoDerivs 3.0 United States"]},{"key":"dc:rights.uri","label":"Rights URI","values":["http://creativecommons.org/licenses/by-nc-nd/3.0/us/"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.other","label":"Dc Identifier Other","values":["10.58011/bmgb-7s79"]},{"key":"dc:identifier.uri","label":"Identifier URI","values":["https://repositorio.uchile.cl/handle/2250/186868"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["En la última década han tenido lugar notables avances en técnicas de aprendizaje de máquinas para el reconocimiento de imágenes, basadas en Deep Learning y Redes neuronales, que buscan extraer representaciones abstractas por medio del entrenamiento de la red con grandes cantidades de datos de ejemplo. La mayoría de las arquitecturas se han basado en la convolución discreta como bloque fundamental de construcción. Esta convolución discreta define filtros pequeños que \"pasan\" por la representación bidimensional de la imagen, de manera similar a como ocurre en la convolución continua entre dos funciones. Estos filtros se componen de parámetros entrenables que la red aprende y actúan como detectores de patrones visuales locales. A pesar de su utilidad, la convolución presenta algunas desventajas: es ineficiente para relacionar puntos distantes de la imagen (por ser ventanas locales), es invariante a la rotación (el mismo patrón rotado es considerado como diferente), y los filtros resultante son fijos (los patrones que detectan no se adaptan en función de la imagen). Una creciente de cantidad de investigación explora técnicas \"atencionales\" que, a grandes rasgos, imitan a la atención cognitiva de la que son capaces los seres humanos. Ilustrativamente, estas confieren la capacidad para atender de manera selectiva a elementos que son considerados más importantes, y permiten relacionarlos de manera contextual. Sin embargo, estas técnicas con frecuencia implican mayores costos de tiempo en la práctica, incluso si su eficiencia teórica se compara a la de modelos convolucionales. En este trabajo comparamos modelos convolucionales y atencionales puros contra una variedad de modelos híbridos, que utilizan convoluciones y 3 tipos de operación atencional, en distintas proporciones, en tareas de clasificación de imágenes y recuperación de imágenes en base a dibujos. Mostramos que algunos modelos híbridos pueden igualar o incluso superar a sus contra partes convolucionales y atencionales puras, con menor cantidad de parámetros entrenables que las redes convolucionales, y menores costos de tiempo que las atencionales."]},{"key":"dc:title","label":"Title","values":["Recuperación de imágenes basada en dibujos con técnicas de atención"]}]}],"canonical_facts":{"dc:contributor.advisor":["Saavedra Rondo, José"],"dc:contributor.other":["Navarro Badino, Gonzalo","Rivara Zúñiga, María Cecilia"],"dc:creator":["Mondaca Wyman, Gonzalo Andrés"],"dc:date.accessioned":["2022-07-21T14:31:12Z"],"dc:date.available":["2022-07-21T14:31:12Z"],"dc:date.issued":["2022"],"dc:description.abstract":["En la última década han tenido lugar notables avances en técnicas de aprendizaje de máquinas para el reconocimiento de imágenes, basadas en Deep Learning y Redes neuronales, que buscan extraer representaciones abstractas por medio del entrenamiento de la red con grandes cantidades de datos de ejemplo. La mayoría de las arquitecturas se han basado en la convolución discreta como bloque fundamental de construcción. Esta convolución discreta define filtros pequeños que \"pasan\" por la representación bidimensional de la imagen, de manera similar a como ocurre en la convolución continua entre dos funciones. Estos filtros se componen de parámetros entrenables que la red aprende y actúan como detectores de patrones visuales locales. A pesar de su utilidad, la convolución presenta algunas desventajas: es ineficiente para relacionar puntos distantes de la imagen (por ser ventanas locales), es invariante a la rotación (el mismo patrón rotado es considerado como diferente), y los filtros resultante son fijos (los patrones que detectan no se adaptan en función de la imagen). Una creciente de cantidad de investigación explora técnicas \"atencionales\" que, a grandes rasgos, imitan a la atención cognitiva de la que son capaces los seres humanos. Ilustrativamente, estas confieren la capacidad para atender de manera selectiva a elementos que son considerados más importantes, y permiten relacionarlos de manera contextual. Sin embargo, estas técnicas con frecuencia implican mayores costos de tiempo en la práctica, incluso si su eficiencia teórica se compara a la de modelos convolucionales. En este trabajo comparamos modelos convolucionales y atencionales puros contra una variedad de modelos híbridos, que utilizan convoluciones y 3 tipos de operación atencional, en distintas proporciones, en tareas de clasificación de imágenes y recuperación de imágenes en base a dibujos. Mostramos que algunos modelos híbridos pueden igualar o incluso superar a sus contra partes convolucionales y atencionales puras, con menor cantidad de parámetros entrenables que las redes convolucionales, y menores costos de tiempo que las atencionales."],"dc:identifier.other":["10.58011/bmgb-7s79"],"dc:identifier.uri":["https://repositorio.uchile.cl/handle/2250/186868"],"dc:language.iso":["es"],"dc:publisher":["Universidad de Chile"],"dc:rights":["Attribution-NonCommercial-NoDerivs 3.0 United States"],"dc:rights.uri":["http://creativecommons.org/licenses/by-nc-nd/3.0/us/"],"dc:subject":["Procesamiento de imagen","Recuperación de imágenes","Clasificación de imágenes","Deep learning","Modelos convolucionales"],"dc:title":["Recuperación de imágenes basada en dibujos con técnicas de atención"],"dc:type":["Tesis"]},"updated_at":"2026-07-27T19:10:00Z"}