Back to results

National and Kapodistrian University of Athens

Instruction Mining from Images: Constructing a Synthetic Dataset for Multimodal Learning

Abstract

dc:description

Η ραγδαία εξέλιξη των μεγάλων γλωσσικών μοντέλων (Large Language Models – LLMs) και των πολυτροπικών μοντέλων όρασης–γλώσσας (Multimodal Large Language Models – MLLMs) έχει οδηγήσει στην ανάπτυξη συστημάτων ικανών να συνδυάζουν οπτική και γλωσσική πληροφορία για την εκτέλεση σύνθετων εργασιών συλλογισμού, κατανόησης εγγράφων, OCR, οπτικού διαλόγου και multimodal instruction following. Παρά τις σημαντικές επιδόσεις των σύγχρονων μοντέλων, η εκπαίδευσή τους εξαρτάται σε μεγάλο βαθμό από τη διαθεσιμότητα μεγάλων και υψηλής ποιότητας multimodal instruction datasets. Η χειροκίνητη δημιουργία τέτοιων συνόλων δεδομένων είναι ιδιαίτερα δαπανηρή, χρονοβόρα και δύσκολα επεκτάσιμη, ειδικά σε εργασίες που απαιτούν σύνθετο οπτικό συλλογισμό και ακριβές grounding μεταξύ εικόνας και κειμένου. Σκοπός της παρούσας διπλωματικής εργασίας είναι η μελέτη και ανάπτυξη ενός πλήρους pipeline συνθετικής παραγωγής multimodal instruction δεδομένων για την εκπαίδευση vision–language μοντέλων. Η εργασία διερευνά κατά πόσο η συνθετική παραγωγή δεδομένων μπορεί να αποτελέσει μία αποδοτική και επεκτάσιμη εναλλακτική λύση έναντι της χειροκίνητης επισημείωσης, καθώς και πώς διαφορετικές στρατηγικές φιλτραρίσματος, reward modeling και fine-tuning επηρεάζουν την τελική απόδοση των μοντέλων. Αρχικά παρουσιάζονται οι θεωρητικές βάσεις της επεξεργασίας φυσικής γλώσσας, της υπολογιστικής όρασης και των multimodal συστημάτων. Αναλύεται η εξέλιξη από τα distributed word embeddings και τα sequence-to-sequence μοντέλα έως τους Transformers και τα σύγχρονα foundation models. Παράλληλα εξετάζονται οι εξελίξεις στην computer vision, στα self-supervised και contrastive learning frameworks, καθώς και στα vision–language μοντέλα όπως τα CLIP, BLIP-2, LLaVA, InstructBLIP, Qwen-VL και Qwen2.5-VL. Στο πλαίσιο της εργασίας αναπτύχθηκε ένα modular multimodal synthetic instruction generation pipeline βασισμένο σε Magpie-style instruction synthesis. Για τη δημιουργία των synthetic δεδομένων χρησιμοποιήθηκαν τα μοντέλα Qwen2.5-VL-7B-Instruct και Qwen2.5-VL-32B-Instruct, ενώ οι εικόνες αντλήθηκαν από το dataset mixture The Cauldron, το οποίο περιλαμβάνει δεδομένα από OCR, charts, diagrams, scientific reasoning και visual question answering tasks. Το pipeline περιλαμβάνει διαδοχικά στάδια instruction synthesis, multimodal response generation, sanitization, reward-based filtering και τελικής κατασκευής του dataset. Για τον έλεγχο ποιότητας των παραγόμενων δεδομένων χρησιμοποιήθηκαν τόσο text-only reward models βασισμένα στο DeBERTa-v3 όσο και multimodal reward models όπως το Skywork-VL-Reward-7B. Μέσω αυτών πραγματοποιήθηκε φιλτράρισμα των instruction–response pairs με σκοπό τη διατήρηση δειγμάτων υψηλής ποιότητας και καλύτερου visual grounding. Επιπλέον, διερευνήθηκε η επίδραση του μεγέθους του generator model, η δυνατότητα multimodal self-distillation, καθώς και η αποδοτικότητα parameter-efficient fine-tuning τεχνικών όπως οι LoRA και QLoRA. Τα synthetic datasets που δημιουργήθηκαν χρησιμοποιήθηκαν για supervised fine-tuning διαφορετικών εκδόσεων των Qwen2.5-VL μοντέλων. Η αξιολόγηση πραγματοποιήθηκε σε ένα σύνολο multimodal benchmarks που περιλαμβάνουν OCR-intensive reasoning, document understanding, chart reasoning και γενικό multimodal reasoning. Τα αποτελέσματα έδειξαν ότι η συνθετική multimodal supervision μπορεί να βελτιώσει αποτελεσματικά τις επιδόσεις των μοντέλων χωρίς σημαντική υποβάθμιση της γενίκευσης, ενώ παράλληλα αναδείχθηκε η σημασία του reward-based filtering και της ποιότητας των synthetic δεδομένων. Ιδιαίτερα σημαντικό εύρημα της εργασίας είναι ότι οι parameter-efficient τεχνικές fine-tuning, και κυρίως το LoRA, πέτυχαν επιδόσεις συγκρίσιμες ή ανώτερες από το πλήρες fine-tuning, με αισθητά μικρότερο υπολογιστικό κόστος. Επιπλέον, παρατηρήθηκε ότι η χρήση multimodal reward models προσφέρει μετρήσιμη αλλά σχετικά περιορισμένη βελτίωση σε σχέση με text-only filtering strategies, ενώ το μέγεθος του generator model είχε μικρότερη επίδραση από άλλους παράγοντες όπως η στρατηγική fine-tuning και η ποιότητα του filtering pipeline. Στο πλαίσιο της έρευνας πραγματοποιήθηκε επίσης συμμετοχή στον διεθνή διαγωνισμό DCVLR (Data Curation for Vision-Language Reasoning), όπου το προτεινόμενο pipeline κατέκτησε την 3η θέση μεταξύ των συμμετοχών, επιβεβαιώνοντας την αποτελεσματικότητα της προτεινόμενης προσέγγισης στην παραγωγή multimodal synthetic instruction δεδομένων. Συνολικά, η εργασία συμβάλλει στην ευρύτερη ερευνητική κατεύθυνση των data-centric multimodal learning pipelines, αναδεικνύοντας ότι η συνθετική παραγωγή multimodal δεδομένων, σε συνδυασμό με reward modeling και parameter-efficient adaptation τεχνικές, μπορεί να αποτελέσει μία πρακτική και επεκτάσιμη προσέγγιση για την εκπαίδευση μελλοντικών vision–language foundation models.

Author and committee

dc:creator, dc:contributor.*
Authors dc:creator
  • Κασούρα Ελένη
  • Kasoura Eleni

Subjects

dc:subject × 2

Rights

Language dc:language
English

Identifiers

dc:identifier.*
Identifier
uoadl:5410418
OAI identifier oai:identifier
oai:lib.uoa.gr:uoadl:5410418

Chain of custody

source
Harvested from
National and Kapodistrian University of Athens
Base URL
pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

Κασούρα Ελένη; Kasoura Eleni. Instruction Mining from Images: Constructing a Synthetic Dataset for Multimodal Learning. 2026. https://pergamos.lib.uoa.gr/uoa/dl/object/5410418