Back to results

National and Kapodistrian University of Athens

Semantically-Guided Image Synthesis: Augmenting VAE Decoders with Foundation Model Representations

Abstract

dc:description

Οι Variational Autoencoders (VAEs) αποτελούν το κρίσιμο πρώτο στάδιο στη σύγχρονη latent γενετική μοντελοποίηση, ωστόσο συχνά αντιμετωπίζουν έναν εγγενή συμβιβασμό ανάμεσα στη συμπίεση του latent χώρου και στην πιστότητα της ανακατασκευής. Επιπλέον, οι τυπικές αρχιτεκτονικές VAE συχνά δυσκολεύονται να ανακτήσουν λεπτομερείς υφές και σύνθετες σημασιολογικές δομές από το χαμηλής διάστασης latent z. Στην παρούσα εργασία, προτείνουμε μια βελτίωση στην αρχιτεκτονική του αποκωδικοποιητή του VAE, η οποία αξιοποιεί υψηλού επιπέδου σημασιολογική πληροφορία από Vision Foundation Models(VFMs). Κεντρικό στοιχείο της προσέγγισής μας είναι η προσαρμογή του ελαφρού συνελικτικού σημασιολογικού συμπιεστή που εισήχθη στο πλαίσια της δουλειάς του REGLUE. Ενώ το REGLUE χρησιμοποιεί αυτό το υποσύστημα για να ενσωματώσει σημασιολογικά χαρακτηριστικά εντός μιας διαδικασίας διάχυσης, εμείς επεκτείνουμε την εφαρμογή του στον αποκωδικοποιητή του VAE, ώστε να συναθροίζει μη γραμμικά τα χαρακτηριστικά DINO VFM πολλαπλών επιπέδων σε μια χωρικά δομημένη, χαμηλής διάστασης αναπαράσταση και να τα θέτει άμεσα ως συνθήκη τον αποκωδικοποιητή του VAE. Εισάγοντας αυτούς τους σημασιολογικούς χάρτες στα upsampling blocks του αποκωδικοποιητή κατά τη διάρκεια του finetuning, παρέχουμε στο μοντέλο ένα δομικό σήμα που συμπληρώνει την πληροφορία του κύριου latent χώρου. Τα πειραματικά μας αποτελέσματα δείχνουν ότι αυτή η σημασιολογικά καθοδηγούμενη στρατηγική αποκωδικοποίησης υπερτερεί των baseline VAEs σε καίριες μετρικές. Πιο αξιοσημείωτα, παρατηρούμε σημαντική βελτίωση στο rFID (Reconstruction FID), γεγονός που υποδεικνύει ανώτερη ικανότητα σύνθεσης εικόνων που είναι τόσο κατανομικά όσο και δομικά πιστές στην πραγματική εικόνα. Επιπλέον, οι βελτιώσεις στο gFID υποδηλώνουν ότι ο εμπλουτισμένος αποκωδικοποιητής παρέχει μια πιο εύρωστη βάση για σύνθεση εικόνων. Τα ευρήματά μας αναδεικνύουν ότι η μη γραμμική συμπίεση των χαρακτηριστικών VFM δεν είναι ωφέλιμη μόνο για μοντέλα διάχυσης, αλλά αποτελεί ένα εργαλείο για την αντιμετώπιση των θεμελιωδών περιορισμών ανακατασκευής των αρχιτεκτονικών VAEs.

Author and committee

dc:creator, dc:contributor.*
Authors dc:creator
  • Πετσαγγουράκης Γεώργιος-Μάριος
  • Petsangourakis Georgios-Marios

Subjects

dc:subject × 2

Rights

Language dc:language
Ελληνικά, English, Greek

Identifiers

dc:identifier.*
Identifier
uoadl:5425631

Chain of custody

source
Harvested from
National and Kapodistrian University of Athens
Base URL
pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh
Last updated
2026-08-21
Source record
OAI-PMH GetRecord
citation

Πετσαγγουράκης Γεώργιος-Μάριος; Petsangourakis Georgios-Marios. Semantically-Guided Image Synthesis: Augmenting VAE Decoders with Foundation Model Representations. 2026. https://pergamos.lib.uoa.gr/uoa/dl/object/5425631