{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5425631"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5425631","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"Semantically-Guided Image Synthesis: Augmenting VAE Decoders with Foundation Model Representations","abstract":"Οι Variational Autoencoders (VAEs) αποτελούν το κρίσιμο πρώτο στάδιο στη σύγχρονη latent γενετική μοντελοποίηση, ωστόσο συχνά αντιμετωπίζουν έναν εγγενή συμβιβασμό ανάμεσα στη συμπίεση του latent χώρου και στην πιστότητα της ανακατασκευής. Επιπλέον, οι τυπικές αρχιτεκτονικές VAE συχνά δυσκολεύονται να ανακτήσουν λεπτομερείς υφές και σύνθετες σημασιολογικές δομές από το χαμηλής διάστασης latent z. Στην παρούσα εργασία, προτείνουμε μια βελτίωση στην αρχιτεκτονική του αποκωδικοποιητή του VAE, η οποία αξιοποιεί υψηλού επιπέδου σημασιολογική πληροφορία από Vision Foundation Models(VFMs). Κεντρικό στοιχείο της προσέγγισής μας είναι η προσαρμογή του ελαφρού συνελικτικού σημασιολογικού συμπιεστή που εισήχθη στο πλαίσια της δουλειάς του REGLUE. Ενώ το REGLUE χρησιμοποιεί αυτό το υποσύστημα για να ενσωματώσει σημασιολογικά χαρακτηριστικά εντός μιας διαδικασίας διάχυσης, εμείς επεκτείνουμε την εφαρμογή του στον αποκωδικοποιητή του VAE, ώστε να συναθροίζει μη γραμμικά τα χαρακτηριστικά DINO VFM πολλαπλών επιπέδων σε μια χωρικά δομημένη, χαμηλής διάστασης αναπαράσταση και να τα θέτει άμεσα ως συνθήκη τον αποκωδικοποιητή του VAE. Εισάγοντας αυτούς τους σημασιολογικούς χάρτες στα upsampling blocks του αποκωδικοποιητή κατά τη διάρκεια του finetuning, παρέχουμε στο μοντέλο ένα δομικό σήμα που συμπληρώνει την πληροφορία του κύριου latent χώρου. Τα πειραματικά μας αποτελέσματα δείχνουν ότι αυτή η σημασιολογικά καθοδηγούμενη στρατηγική αποκωδικοποίησης υπερτερεί των baseline VAEs σε καίριες μετρικές. Πιο αξιοσημείωτα, παρατηρούμε σημαντική βελτίωση στο rFID (Reconstruction FID), γεγονός που υποδεικνύει ανώτερη ικανότητα σύνθεσης εικόνων που είναι τόσο κατανομικά όσο και δομικά πιστές στην πραγματική εικόνα. Επιπλέον, οι βελτιώσεις στο gFID υποδηλώνουν ότι ο εμπλουτισμένος αποκωδικοποιητής παρέχει μια πιο εύρωστη βάση για σύνθεση εικόνων. Τα ευρήματά μας αναδεικνύουν ότι η μη γραμμική συμπίεση των χαρακτηριστικών VFM δεν είναι ωφέλιμη μόνο για μοντέλα διάχυσης, αλλά αποτελεί ένα εργαλείο για την αντιμετώπιση των θεμελιωδών περιορισμών ανακατασκευής των αρχιτεκτονικών VAEs.","abstract_html":"Οι Variational Autoencoders (VAEs) αποτελούν το κρίσιμο πρώτο στάδιο στη σύγχρονη latent γενετική μοντελοποίηση, ωστόσο συχνά αντιμετωπίζουν έναν εγγενή συμβιβασμό ανάμεσα στη συμπίεση του latent χώρου και στην πιστότητα της ανακατασκευής. Επιπλέον, οι τυπικές αρχιτεκτονικές VAE συχνά δυσκολεύονται να ανακτήσουν λεπτομερείς υφές και σύνθετες σημασιολογικές δομές από το χαμηλής διάστασης latent z. Στην παρούσα εργασία, προτείνουμε μια βελτίωση στην αρχιτεκτονική του αποκωδικοποιητή του VAE, η οποία αξιοποιεί υψηλού επιπέδου σημασιολογική πληροφορία από Vision Foundation Models(VFMs). Κεντρικό στοιχείο της προσέγγισής μας είναι η προσαρμογή του ελαφρού συνελικτικού σημασιολογικού συμπιεστή που εισήχθη στο πλαίσια της δουλειάς του REGLUE. Ενώ το REGLUE χρησιμοποιεί αυτό το υποσύστημα για να ενσωματώσει σημασιολογικά χαρακτηριστικά εντός μιας διαδικασίας διάχυσης, εμείς επεκτείνουμε την εφαρμογή του στον αποκωδικοποιητή του VAE, ώστε να συναθροίζει μη γραμμικά τα χαρακτηριστικά DINO VFM πολλαπλών επιπέδων σε μια χωρικά δομημένη, χαμηλής διάστασης αναπαράσταση και να τα θέτει άμεσα ως συνθήκη τον αποκωδικοποιητή του VAE. Εισάγοντας αυτούς τους σημασιολογικούς χάρτες στα upsampling blocks του αποκωδικοποιητή κατά τη διάρκεια του finetuning, παρέχουμε στο μοντέλο ένα δομικό σήμα που συμπληρώνει την πληροφορία του κύριου latent χώρου. Τα πειραματικά μας αποτελέσματα δείχνουν ότι αυτή η σημασιολογικά καθοδηγούμενη στρατηγική αποκωδικοποίησης υπερτερεί των baseline VAEs σε καίριες μετρικές. Πιο αξιοσημείωτα, παρατηρούμε σημαντική βελτίωση στο rFID (Reconstruction FID), γεγονός που υποδεικνύει ανώτερη ικανότητα σύνθεσης εικόνων που είναι τόσο κατανομικά όσο και δομικά πιστές στην πραγματική εικόνα. Επιπλέον, οι βελτιώσεις στο gFID υποδηλώνουν ότι ο εμπλουτισμένος αποκωδικοποιητής παρέχει μια πιο εύρωστη βάση για σύνθεση εικόνων. Τα ευρήματά μας αναδεικνύουν ότι η μη γραμμική συμπίεση των χαρακτηριστικών VFM δεν είναι ωφέλιμη μόνο για μοντέλα διάχυσης, αλλά αποτελεί ένα εργαλείο για την αντιμετώπιση των θεμελιωδών περιορισμών ανακατασκευής των αρχιτεκτονικών VAEs.","abstract_has_math":false,"creators":["Πετσαγγουράκης Γεώργιος-Μάριος","Petsangourakis Georgios-Marios"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-08-21T16:41:59Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["Ελληνικά","English","Greek"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5425631"],"render_values":[{"text":"uoadl:5425631","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5425631","outbound_label":"Repository record","outbound_source":"dc:identifier"},"source_record":{"url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh?verb=GetRecord&metadataPrefix=oai_dc&identifier=oai%3Alib.uoa.gr%3Auoadl%3A5425631","prefix":"oai_dc"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Πετσαγγουράκης Γεώργιος-Μάριος","Petsangourakis Georgios-Marios"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["Ελληνικά","English","Greek"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5425631","https://pergamos.lib.uoa.gr/uoa/dl/object/5425631"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Οι Variational Autoencoders (VAEs) αποτελούν το κρίσιμο πρώτο στάδιο στη σύγχρονη latent γενετική μοντελοποίηση, ωστόσο συχνά αντιμετωπίζουν έναν εγγενή συμβιβασμό ανάμεσα στη συμπίεση του latent χώρου και στην πιστότητα της ανακατασκευής. Επιπλέον, οι τυπικές αρχιτεκτονικές VAE συχνά δυσκολεύονται να ανακτήσουν λεπτομερείς υφές και σύνθετες σημασιολογικές δομές από το χαμηλής διάστασης latent z. Στην παρούσα εργασία, προτείνουμε μια βελτίωση στην αρχιτεκτονική του αποκωδικοποιητή του VAE, η οποία αξιοποιεί υψηλού επιπέδου σημασιολογική πληροφορία από Vision Foundation Models(VFMs). Κεντρικό στοιχείο της προσέγγισής μας είναι η προσαρμογή του ελαφρού συνελικτικού σημασιολογικού συμπιεστή που εισήχθη στο πλαίσια της δουλειάς του REGLUE. Ενώ το REGLUE χρησιμοποιεί αυτό το υποσύστημα για να ενσωματώσει σημασιολογικά χαρακτηριστικά εντός μιας διαδικασίας διάχυσης, εμείς επεκτείνουμε την εφαρμογή του στον αποκωδικοποιητή του VAE, ώστε να συναθροίζει μη γραμμικά τα χαρακτηριστικά DINO VFM πολλαπλών επιπέδων σε μια χωρικά δομημένη, χαμηλής διάστασης αναπαράσταση και να τα θέτει άμεσα ως συνθήκη τον αποκωδικοποιητή του VAE. Εισάγοντας αυτούς τους σημασιολογικούς χάρτες στα upsampling blocks του αποκωδικοποιητή κατά τη διάρκεια του finetuning, παρέχουμε στο μοντέλο ένα δομικό σήμα που συμπληρώνει την πληροφορία του κύριου latent χώρου. Τα πειραματικά μας αποτελέσματα δείχνουν ότι αυτή η σημασιολογικά καθοδηγούμενη στρατηγική αποκωδικοποίησης υπερτερεί των baseline VAEs σε καίριες μετρικές. Πιο αξιοσημείωτα, παρατηρούμε σημαντική βελτίωση στο rFID (Reconstruction FID), γεγονός που υποδεικνύει ανώτερη ικανότητα σύνθεσης εικόνων που είναι τόσο κατανομικά όσο και δομικά πιστές στην πραγματική εικόνα. Επιπλέον, οι βελτιώσεις στο gFID υποδηλώνουν ότι ο εμπλουτισμένος αποκωδικοποιητής παρέχει μια πιο εύρωστη βάση για σύνθεση εικόνων. Τα ευρήματά μας αναδεικνύουν ότι η μη γραμμική συμπίεση των χαρακτηριστικών VFM δεν είναι ωφέλιμη μόνο για μοντέλα διάχυσης, αλλά αποτελεί ένα εργαλείο για την αντιμετώπιση των θεμελιωδών περιορισμών ανακατασκευής των αρχιτεκτονικών VAEs.","Variational Autoencoders (VAEs) serve as the critical first stage in modern latent generative modeling, yet they often face an inherent trade-off between latent compression and reconstruction fidelity. Moreover, standard VAE architectures frequently struggle to recover fine-grained textures and complex semantic structures from the low-dimensional latent bottleneck $z$. In this work, we propose an architectural enhancement to the VAE decoder that leverages high-level semantic information from Vision Foundation Models (VFMs). Central to our approach is the adaptation of the lightweight convolutional semantic compressor introduced in the REGLUE framework. While REGLUE utilizes this module to entangle semantic features within a diffusion process, we extend its application to the VAE decoder to non-linearly aggregate multi-layer DINO VFM features into a spatially structured, low-dimensional representation that directly conditions the VAE decoder. By injecting these \"semantic maps\" into the decoder’s upsampling blocks during finetuning, we provide the model with a structural signal that supplements the information in the primary latent space. Our experimental results demonstrate that this semantically-guided decoding strategy outperforms baseline VAEs across key metrics. Most notably, we observe a substantial improvement in rFID (Reconstruction FID), indicating a superior ability to synthesize images that are both distributionally and structurally faithful to the ground truth. Furthermore, improvements in standard generative FID suggest that the augmented decoder provides a more robust foundation for downstream synthesis tasks. Our findings highlight that the non-linear compression of VFM features is not only beneficial for diffusion backbones but is a transformative tool for overcoming the fundamental reconstruction bottlenecks of autoencoder architectures."]},{"key":"dc:title","label":"Title","values":["Semantically-Guided Image Synthesis: Augmenting VAE Decoders with Foundation Model Representations"]}]}],"canonical_facts":{"dc:creator":["Πετσαγγουράκης Γεώργιος-Μάριος","Petsangourakis Georgios-Marios"],"dc:date":["2026"],"dc:description":["Οι Variational Autoencoders (VAEs) αποτελούν το κρίσιμο πρώτο στάδιο στη σύγχρονη latent γενετική μοντελοποίηση, ωστόσο συχνά αντιμετωπίζουν έναν εγγενή συμβιβασμό ανάμεσα στη συμπίεση του latent χώρου και στην πιστότητα της ανακατασκευής. Επιπλέον, οι τυπικές αρχιτεκτονικές VAE συχνά δυσκολεύονται να ανακτήσουν λεπτομερείς υφές και σύνθετες σημασιολογικές δομές από το χαμηλής διάστασης latent z. Στην παρούσα εργασία, προτείνουμε μια βελτίωση στην αρχιτεκτονική του αποκωδικοποιητή του VAE, η οποία αξιοποιεί υψηλού επιπέδου σημασιολογική πληροφορία από Vision Foundation Models(VFMs). Κεντρικό στοιχείο της προσέγγισής μας είναι η προσαρμογή του ελαφρού συνελικτικού σημασιολογικού συμπιεστή που εισήχθη στο πλαίσια της δουλειάς του REGLUE. Ενώ το REGLUE χρησιμοποιεί αυτό το υποσύστημα για να ενσωματώσει σημασιολογικά χαρακτηριστικά εντός μιας διαδικασίας διάχυσης, εμείς επεκτείνουμε την εφαρμογή του στον αποκωδικοποιητή του VAE, ώστε να συναθροίζει μη γραμμικά τα χαρακτηριστικά DINO VFM πολλαπλών επιπέδων σε μια χωρικά δομημένη, χαμηλής διάστασης αναπαράσταση και να τα θέτει άμεσα ως συνθήκη τον αποκωδικοποιητή του VAE. Εισάγοντας αυτούς τους σημασιολογικούς χάρτες στα upsampling blocks του αποκωδικοποιητή κατά τη διάρκεια του finetuning, παρέχουμε στο μοντέλο ένα δομικό σήμα που συμπληρώνει την πληροφορία του κύριου latent χώρου. Τα πειραματικά μας αποτελέσματα δείχνουν ότι αυτή η σημασιολογικά καθοδηγούμενη στρατηγική αποκωδικοποίησης υπερτερεί των baseline VAEs σε καίριες μετρικές. Πιο αξιοσημείωτα, παρατηρούμε σημαντική βελτίωση στο rFID (Reconstruction FID), γεγονός που υποδεικνύει ανώτερη ικανότητα σύνθεσης εικόνων που είναι τόσο κατανομικά όσο και δομικά πιστές στην πραγματική εικόνα. Επιπλέον, οι βελτιώσεις στο gFID υποδηλώνουν ότι ο εμπλουτισμένος αποκωδικοποιητής παρέχει μια πιο εύρωστη βάση για σύνθεση εικόνων. Τα ευρήματά μας αναδεικνύουν ότι η μη γραμμική συμπίεση των χαρακτηριστικών VFM δεν είναι ωφέλιμη μόνο για μοντέλα διάχυσης, αλλά αποτελεί ένα εργαλείο για την αντιμετώπιση των θεμελιωδών περιορισμών ανακατασκευής των αρχιτεκτονικών VAEs.","Variational Autoencoders (VAEs) serve as the critical first stage in modern latent generative modeling, yet they often face an inherent trade-off between latent compression and reconstruction fidelity. Moreover, standard VAE architectures frequently struggle to recover fine-grained textures and complex semantic structures from the low-dimensional latent bottleneck $z$. In this work, we propose an architectural enhancement to the VAE decoder that leverages high-level semantic information from Vision Foundation Models (VFMs). Central to our approach is the adaptation of the lightweight convolutional semantic compressor introduced in the REGLUE framework. While REGLUE utilizes this module to entangle semantic features within a diffusion process, we extend its application to the VAE decoder to non-linearly aggregate multi-layer DINO VFM features into a spatially structured, low-dimensional representation that directly conditions the VAE decoder. By injecting these \"semantic maps\" into the decoder’s upsampling blocks during finetuning, we provide the model with a structural signal that supplements the information in the primary latent space. Our experimental results demonstrate that this semantically-guided decoding strategy outperforms baseline VAEs across key metrics. Most notably, we observe a substantial improvement in rFID (Reconstruction FID), indicating a superior ability to synthesize images that are both distributionally and structurally faithful to the ground truth. Furthermore, improvements in standard generative FID suggest that the augmented decoder provides a more robust foundation for downstream synthesis tasks. Our findings highlight that the non-linear compression of VFM features is not only beneficial for diffusion backbones but is a transformative tool for overcoming the fundamental reconstruction bottlenecks of autoencoder architectures."],"dc:identifier":["uoadl:5425631","https://pergamos.lib.uoa.gr/uoa/dl/object/5425631"],"dc:language":["Ελληνικά","English","Greek"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["Semantically-Guided Image Synthesis: Augmenting VAE Decoders with Foundation Model Representations"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-08-21T16:41:59Z"}