Back to results

Universidad de Chile

Extending reinforcement learning techniques for diffusion models

Abstract

dc:description.abstract

El Aprendizaje por Refuerzo (RL) se ha convertido en una herramienta crucial para alinear modelos generativos complejos, superando las limitaciones de los métodos de aprendizaje supervisado tradicionales. Su capacidad para optimizar recompensas arbitrarias, incluyendo funciones escalares no diferenciables o retroalimentación humana, es especialmente útil para modelos a gran escala como los Modelos de Lenguaje Grandes (LLMs) y los modelos de difusión. Esta tesis investiga la aplicación de técnicas de RL a modelos de difusión preentrenados, utilizando métodos de gradiente de políticas para adaptar estos modelos a nuevas tareas. Explora cómo los modelos de difusión pueden considerarse agentes que generan muestras para maximizar atributos específicos, como la calidad estética o la compresibilidad, y realiza un análisis empírico de las señales de recompensa a lo largo de las trayectorias de muestra. El trabajo incluye la implementación de algoritmos de optimización de políticas de vanguardia (DDPO) e integra la retroalimentación humana para proporcionar herramientas y perspectivas prácticas. Esta investigación ofrece una ruta para comprender el uso de RL en el ajuste de modelos de difusión preentrenados y proporciona ideas para posibles adaptaciones futuras.

Degree

thesis:*
Grantor dc:publisher
Universidad de Chile
Year dc:date.issued
2024

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • Alcázar Carrasco, Cristóbal Patricio
Advisor dc:contributor.advisor
  • Tobar Henríquez, Felipe

Rights

dc:rights
Statement dc:rights
  • Attribution-NonCommercial-NoDerivs 3.0 United States
Language dc:language.iso
en

Identifiers

dc:identifier.*
Dc Identifier Other
10.58011/2gb7-ka47
OAI identifier oai:identifier
oai:repositorio.uchile.cl:2250/202928

Chain of custody

source
Harvested from
Universidad de Chile
Base URL
repositorio.uchile.cl/oai/request
Last updated
2026-07-27
Source record
OAI-PMH GetRecord
related terms
citation

Alcázar Carrasco, Cristóbal Patricio. Extending reinforcement learning techniques for diffusion models. Universidad de Chile, 2024. https://repositorio.uchile.cl/handle/2250/202928