{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5410418"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5410418","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"Instruction Mining from Images: Constructing a Synthetic Dataset for Multimodal Learning","abstract":"Η ραγδαία εξέλιξη των μεγάλων γλωσσικών μοντέλων (Large Language Models – LLMs) και των πολυτροπικών μοντέλων όρασης–γλώσσας (Multimodal Large Language Models – MLLMs) έχει οδηγήσει στην ανάπτυξη συστημάτων ικανών να συνδυάζουν οπτική και γλωσσική πληροφορία για την εκτέλεση σύνθετων εργασιών συλλογισμού, κατανόησης εγγράφων, OCR, οπτικού διαλόγου και multimodal instruction following. Παρά τις σημαντικές επιδόσεις των σύγχρονων μοντέλων, η εκπαίδευσή τους εξαρτάται σε μεγάλο βαθμό από τη διαθεσιμότητα μεγάλων και υψηλής ποιότητας multimodal instruction datasets. Η χειροκίνητη δημιουργία τέτοιων συνόλων δεδομένων είναι ιδιαίτερα δαπανηρή, χρονοβόρα και δύσκολα επεκτάσιμη, ειδικά σε εργασίες που απαιτούν σύνθετο οπτικό συλλογισμό και ακριβές grounding μεταξύ εικόνας και κειμένου. Σκοπός της παρούσας διπλωματικής εργασίας είναι η μελέτη και ανάπτυξη ενός πλήρους pipeline συνθετικής παραγωγής multimodal instruction δεδομένων για την εκπαίδευση vision–language μοντέλων. Η εργασία διερευνά κατά πόσο η συνθετική παραγωγή δεδομένων μπορεί να αποτελέσει μία αποδοτική και επεκτάσιμη εναλλακτική λύση έναντι της χειροκίνητης επισημείωσης, καθώς και πώς διαφορετικές στρατηγικές φιλτραρίσματος, reward modeling και fine-tuning επηρεάζουν την τελική απόδοση των μοντέλων. Αρχικά παρουσιάζονται οι θεωρητικές βάσεις της επεξεργασίας φυσικής γλώσσας, της υπολογιστικής όρασης και των multimodal συστημάτων. Αναλύεται η εξέλιξη από τα distributed word embeddings και τα sequence-to-sequence μοντέλα έως τους Transformers και τα σύγχρονα foundation models. Παράλληλα εξετάζονται οι εξελίξεις στην computer vision, στα self-supervised και contrastive learning frameworks, καθώς και στα vision–language μοντέλα όπως τα CLIP, BLIP-2, LLaVA, InstructBLIP, Qwen-VL και Qwen2.5-VL. Στο πλαίσιο της εργασίας αναπτύχθηκε ένα modular multimodal synthetic instruction generation pipeline βασισμένο σε Magpie-style instruction synthesis. Για τη δημιουργία των synthetic δεδομένων χρησιμοποιήθηκαν τα μοντέλα Qwen2.5-VL-7B-Instruct και Qwen2.5-VL-32B-Instruct, ενώ οι εικόνες αντλήθηκαν από το dataset mixture The Cauldron, το οποίο περιλαμβάνει δεδομένα από OCR, charts, diagrams, scientific reasoning και visual question answering tasks. Το pipeline περιλαμβάνει διαδοχικά στάδια instruction synthesis, multimodal response generation, sanitization, reward-based filtering και τελικής κατασκευής του dataset. Για τον έλεγχο ποιότητας των παραγόμενων δεδομένων χρησιμοποιήθηκαν τόσο text-only reward models βασισμένα στο DeBERTa-v3 όσο και multimodal reward models όπως το Skywork-VL-Reward-7B. Μέσω αυτών πραγματοποιήθηκε φιλτράρισμα των instruction–response pairs με σκοπό τη διατήρηση δειγμάτων υψηλής ποιότητας και καλύτερου visual grounding. Επιπλέον, διερευνήθηκε η επίδραση του μεγέθους του generator model, η δυνατότητα multimodal self-distillation, καθώς και η αποδοτικότητα parameter-efficient fine-tuning τεχνικών όπως οι LoRA και QLoRA. Τα synthetic datasets που δημιουργήθηκαν χρησιμοποιήθηκαν για supervised fine-tuning διαφορετικών εκδόσεων των Qwen2.5-VL μοντέλων. Η αξιολόγηση πραγματοποιήθηκε σε ένα σύνολο multimodal benchmarks που περιλαμβάνουν OCR-intensive reasoning, document understanding, chart reasoning και γενικό multimodal reasoning. Τα αποτελέσματα έδειξαν ότι η συνθετική multimodal supervision μπορεί να βελτιώσει αποτελεσματικά τις επιδόσεις των μοντέλων χωρίς σημαντική υποβάθμιση της γενίκευσης, ενώ παράλληλα αναδείχθηκε η σημασία του reward-based filtering και της ποιότητας των synthetic δεδομένων. Ιδιαίτερα σημαντικό εύρημα της εργασίας είναι ότι οι parameter-efficient τεχνικές fine-tuning, και κυρίως το LoRA, πέτυχαν επιδόσεις συγκρίσιμες ή ανώτερες από το πλήρες fine-tuning, με αισθητά μικρότερο υπολογιστικό κόστος. Επιπλέον, παρατηρήθηκε ότι η χρήση multimodal reward models προσφέρει μετρήσιμη αλλά σχετικά περιορισμένη βελτίωση σε σχέση με text-only filtering strategies, ενώ το μέγεθος του generator model είχε μικρότερη επίδραση από άλλους παράγοντες όπως η στρατηγική fine-tuning και η ποιότητα του filtering pipeline. Στο πλαίσιο της έρευνας πραγματοποιήθηκε επίσης συμμετοχή στον διεθνή διαγωνισμό DCVLR (Data Curation for Vision-Language Reasoning), όπου το προτεινόμενο pipeline κατέκτησε την 3η θέση μεταξύ των συμμετοχών, επιβεβαιώνοντας την αποτελεσματικότητα της προτεινόμενης προσέγγισης στην παραγωγή multimodal synthetic instruction δεδομένων. Συνολικά, η εργασία συμβάλλει στην ευρύτερη ερευνητική κατεύθυνση των data-centric multimodal learning pipelines, αναδεικνύοντας ότι η συνθετική παραγωγή multimodal δεδομένων, σε συνδυασμό με reward modeling και parameter-efficient adaptation τεχνικές, μπορεί να αποτελέσει μία πρακτική και επεκτάσιμη προσέγγιση για την εκπαίδευση μελλοντικών vision–language foundation models.","abstract_html":"Η ραγδαία εξέλιξη των μεγάλων γλωσσικών μοντέλων (Large Language Models – LLMs) και των πολυτροπικών μοντέλων όρασης–γλώσσας (Multimodal Large Language Models – MLLMs) έχει οδηγήσει στην ανάπτυξη συστημάτων ικανών να συνδυάζουν οπτική και γλωσσική πληροφορία για την εκτέλεση σύνθετων εργασιών συλλογισμού, κατανόησης εγγράφων, OCR, οπτικού διαλόγου και multimodal instruction following. Παρά τις σημαντικές επιδόσεις των σύγχρονων μοντέλων, η εκπαίδευσή τους εξαρτάται σε μεγάλο βαθμό από τη διαθεσιμότητα μεγάλων και υψηλής ποιότητας multimodal instruction datasets. Η χειροκίνητη δημιουργία τέτοιων συνόλων δεδομένων είναι ιδιαίτερα δαπανηρή, χρονοβόρα και δύσκολα επεκτάσιμη, ειδικά σε εργασίες που απαιτούν σύνθετο οπτικό συλλογισμό και ακριβές grounding μεταξύ εικόνας και κειμένου. Σκοπός της παρούσας διπλωματικής εργασίας είναι η μελέτη και ανάπτυξη ενός πλήρους pipeline συνθετικής παραγωγής multimodal instruction δεδομένων για την εκπαίδευση vision–language μοντέλων. Η εργασία διερευνά κατά πόσο η συνθετική παραγωγή δεδομένων μπορεί να αποτελέσει μία αποδοτική και επεκτάσιμη εναλλακτική λύση έναντι της χειροκίνητης επισημείωσης, καθώς και πώς διαφορετικές στρατηγικές φιλτραρίσματος, reward modeling και fine-tuning επηρεάζουν την τελική απόδοση των μοντέλων. Αρχικά παρουσιάζονται οι θεωρητικές βάσεις της επεξεργασίας φυσικής γλώσσας, της υπολογιστικής όρασης και των multimodal συστημάτων. Αναλύεται η εξέλιξη από τα distributed word embeddings και τα sequence-to-sequence μοντέλα έως τους Transformers και τα σύγχρονα foundation models. Παράλληλα εξετάζονται οι εξελίξεις στην computer vision, στα self-supervised και contrastive learning frameworks, καθώς και στα vision–language μοντέλα όπως τα CLIP, BLIP-2, LLaVA, InstructBLIP, Qwen-VL και Qwen2.5-VL. Στο πλαίσιο της εργασίας αναπτύχθηκε ένα modular multimodal synthetic instruction generation pipeline βασισμένο σε Magpie-style instruction synthesis. Για τη δημιουργία των synthetic δεδομένων χρησιμοποιήθηκαν τα μοντέλα Qwen2.5-VL-7B-Instruct και Qwen2.5-VL-32B-Instruct, ενώ οι εικόνες αντλήθηκαν από το dataset mixture The Cauldron, το οποίο περιλαμβάνει δεδομένα από OCR, charts, diagrams, scientific reasoning και visual question answering tasks. Το pipeline περιλαμβάνει διαδοχικά στάδια instruction synthesis, multimodal response generation, sanitization, reward-based filtering και τελικής κατασκευής του dataset. Για τον έλεγχο ποιότητας των παραγόμενων δεδομένων χρησιμοποιήθηκαν τόσο text-only reward models βασισμένα στο DeBERTa-v3 όσο και multimodal reward models όπως το Skywork-VL-Reward-7B. Μέσω αυτών πραγματοποιήθηκε φιλτράρισμα των instruction–response pairs με σκοπό τη διατήρηση δειγμάτων υψηλής ποιότητας και καλύτερου visual grounding. Επιπλέον, διερευνήθηκε η επίδραση του μεγέθους του generator model, η δυνατότητα multimodal self-distillation, καθώς και η αποδοτικότητα parameter-efficient fine-tuning τεχνικών όπως οι LoRA και QLoRA. Τα synthetic datasets που δημιουργήθηκαν χρησιμοποιήθηκαν για supervised fine-tuning διαφορετικών εκδόσεων των Qwen2.5-VL μοντέλων. Η αξιολόγηση πραγματοποιήθηκε σε ένα σύνολο multimodal benchmarks που περιλαμβάνουν OCR-intensive reasoning, document understanding, chart reasoning και γενικό multimodal reasoning. Τα αποτελέσματα έδειξαν ότι η συνθετική multimodal supervision μπορεί να βελτιώσει αποτελεσματικά τις επιδόσεις των μοντέλων χωρίς σημαντική υποβάθμιση της γενίκευσης, ενώ παράλληλα αναδείχθηκε η σημασία του reward-based filtering και της ποιότητας των synthetic δεδομένων. Ιδιαίτερα σημαντικό εύρημα της εργασίας είναι ότι οι parameter-efficient τεχνικές fine-tuning, και κυρίως το LoRA, πέτυχαν επιδόσεις συγκρίσιμες ή ανώτερες από το πλήρες fine-tuning, με αισθητά μικρότερο υπολογιστικό κόστος. Επιπλέον, παρατηρήθηκε ότι η χρήση multimodal reward models προσφέρει μετρήσιμη αλλά σχετικά περιορισμένη βελτίωση σε σχέση με text-only filtering strategies, ενώ το μέγεθος του generator model είχε μικρότερη επίδραση από άλλους παράγοντες όπως η στρατηγική fine-tuning και η ποιότητα του filtering pipeline. Στο πλαίσιο της έρευνας πραγματοποιήθηκε επίσης συμμετοχή στον διεθνή διαγωνισμό DCVLR (Data Curation for Vision-Language Reasoning), όπου το προτεινόμενο pipeline κατέκτησε την 3η θέση μεταξύ των συμμετοχών, επιβεβαιώνοντας την αποτελεσματικότητα της προτεινόμενης προσέγγισης στην παραγωγή multimodal synthetic instruction δεδομένων. Συνολικά, η εργασία συμβάλλει στην ευρύτερη ερευνητική κατεύθυνση των data-centric multimodal learning pipelines, αναδεικνύοντας ότι η συνθετική παραγωγή multimodal δεδομένων, σε συνδυασμό με reward modeling και parameter-efficient adaptation τεχνικές, μπορεί να αποτελέσει μία πρακτική και επεκτάσιμη προσέγγιση για την εκπαίδευση μελλοντικών vision–language foundation models.","abstract_has_math":false,"creators":["Κασούρα Ελένη","Kasoura Eleni"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-07-24T01:02:36Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["English"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5410418"],"render_values":[{"text":"uoadl:5410418","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5410418","outbound_label":"Repository record","outbound_source":"dc:identifier"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Κασούρα Ελένη","Kasoura Eleni"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["English"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5410418","https://pergamos.lib.uoa.gr/uoa/dl/object/5410418"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Η ραγδαία εξέλιξη των μεγάλων γλωσσικών μοντέλων (Large Language Models – LLMs) και των πολυτροπικών μοντέλων όρασης–γλώσσας (Multimodal Large Language Models – MLLMs) έχει οδηγήσει στην ανάπτυξη συστημάτων ικανών να συνδυάζουν οπτική και γλωσσική πληροφορία για την εκτέλεση σύνθετων εργασιών συλλογισμού, κατανόησης εγγράφων, OCR, οπτικού διαλόγου και multimodal instruction following. Παρά τις σημαντικές επιδόσεις των σύγχρονων μοντέλων, η εκπαίδευσή τους εξαρτάται σε μεγάλο βαθμό από τη διαθεσιμότητα μεγάλων και υψηλής ποιότητας multimodal instruction datasets. Η χειροκίνητη δημιουργία τέτοιων συνόλων δεδομένων είναι ιδιαίτερα δαπανηρή, χρονοβόρα και δύσκολα επεκτάσιμη, ειδικά σε εργασίες που απαιτούν σύνθετο οπτικό συλλογισμό και ακριβές grounding μεταξύ εικόνας και κειμένου. Σκοπός της παρούσας διπλωματικής εργασίας είναι η μελέτη και ανάπτυξη ενός πλήρους pipeline συνθετικής παραγωγής multimodal instruction δεδομένων για την εκπαίδευση vision–language μοντέλων. Η εργασία διερευνά κατά πόσο η συνθετική παραγωγή δεδομένων μπορεί να αποτελέσει μία αποδοτική και επεκτάσιμη εναλλακτική λύση έναντι της χειροκίνητης επισημείωσης, καθώς και πώς διαφορετικές στρατηγικές φιλτραρίσματος, reward modeling και fine-tuning επηρεάζουν την τελική απόδοση των μοντέλων. Αρχικά παρουσιάζονται οι θεωρητικές βάσεις της επεξεργασίας φυσικής γλώσσας, της υπολογιστικής όρασης και των multimodal συστημάτων. Αναλύεται η εξέλιξη από τα distributed word embeddings και τα sequence-to-sequence μοντέλα έως τους Transformers και τα σύγχρονα foundation models. Παράλληλα εξετάζονται οι εξελίξεις στην computer vision, στα self-supervised και contrastive learning frameworks, καθώς και στα vision–language μοντέλα όπως τα CLIP, BLIP-2, LLaVA, InstructBLIP, Qwen-VL και Qwen2.5-VL. Στο πλαίσιο της εργασίας αναπτύχθηκε ένα modular multimodal synthetic instruction generation pipeline βασισμένο σε Magpie-style instruction synthesis. Για τη δημιουργία των synthetic δεδομένων χρησιμοποιήθηκαν τα μοντέλα Qwen2.5-VL-7B-Instruct και Qwen2.5-VL-32B-Instruct, ενώ οι εικόνες αντλήθηκαν από το dataset mixture The Cauldron, το οποίο περιλαμβάνει δεδομένα από OCR, charts, diagrams, scientific reasoning και visual question answering tasks. Το pipeline περιλαμβάνει διαδοχικά στάδια instruction synthesis, multimodal response generation, sanitization, reward-based filtering και τελικής κατασκευής του dataset. Για τον έλεγχο ποιότητας των παραγόμενων δεδομένων χρησιμοποιήθηκαν τόσο text-only reward models βασισμένα στο DeBERTa-v3 όσο και multimodal reward models όπως το Skywork-VL-Reward-7B. Μέσω αυτών πραγματοποιήθηκε φιλτράρισμα των instruction–response pairs με σκοπό τη διατήρηση δειγμάτων υψηλής ποιότητας και καλύτερου visual grounding. Επιπλέον, διερευνήθηκε η επίδραση του μεγέθους του generator model, η δυνατότητα multimodal self-distillation, καθώς και η αποδοτικότητα parameter-efficient fine-tuning τεχνικών όπως οι LoRA και QLoRA. Τα synthetic datasets που δημιουργήθηκαν χρησιμοποιήθηκαν για supervised fine-tuning διαφορετικών εκδόσεων των Qwen2.5-VL μοντέλων. Η αξιολόγηση πραγματοποιήθηκε σε ένα σύνολο multimodal benchmarks που περιλαμβάνουν OCR-intensive reasoning, document understanding, chart reasoning και γενικό multimodal reasoning. Τα αποτελέσματα έδειξαν ότι η συνθετική multimodal supervision μπορεί να βελτιώσει αποτελεσματικά τις επιδόσεις των μοντέλων χωρίς σημαντική υποβάθμιση της γενίκευσης, ενώ παράλληλα αναδείχθηκε η σημασία του reward-based filtering και της ποιότητας των synthetic δεδομένων. Ιδιαίτερα σημαντικό εύρημα της εργασίας είναι ότι οι parameter-efficient τεχνικές fine-tuning, και κυρίως το LoRA, πέτυχαν επιδόσεις συγκρίσιμες ή ανώτερες από το πλήρες fine-tuning, με αισθητά μικρότερο υπολογιστικό κόστος. Επιπλέον, παρατηρήθηκε ότι η χρήση multimodal reward models προσφέρει μετρήσιμη αλλά σχετικά περιορισμένη βελτίωση σε σχέση με text-only filtering strategies, ενώ το μέγεθος του generator model είχε μικρότερη επίδραση από άλλους παράγοντες όπως η στρατηγική fine-tuning και η ποιότητα του filtering pipeline. Στο πλαίσιο της έρευνας πραγματοποιήθηκε επίσης συμμετοχή στον διεθνή διαγωνισμό DCVLR (Data Curation for Vision-Language Reasoning), όπου το προτεινόμενο pipeline κατέκτησε την 3η θέση μεταξύ των συμμετοχών, επιβεβαιώνοντας την αποτελεσματικότητα της προτεινόμενης προσέγγισης στην παραγωγή multimodal synthetic instruction δεδομένων. Συνολικά, η εργασία συμβάλλει στην ευρύτερη ερευνητική κατεύθυνση των data-centric multimodal learning pipelines, αναδεικνύοντας ότι η συνθετική παραγωγή multimodal δεδομένων, σε συνδυασμό με reward modeling και parameter-efficient adaptation τεχνικές, μπορεί να αποτελέσει μία πρακτική και επεκτάσιμη προσέγγιση για την εκπαίδευση μελλοντικών vision–language foundation models.","The rapid advancement of large language models (LLMs) and multimodal large language models (MLLMs) has significantly transformed natural language processing and computer vision. Modern vision–language systems are capable of performing complex multimodal reasoning tasks such as visual question answering, OCR-based reasoning, document understanding, grounded dialogue, and scientific interpretation. However, their performance strongly depends on the availability of large-scale, high-quality multimodal instruction datasets, whose manual construction is expensive and difficult to scale. This thesis investigates the development and evaluation of a multimodal synthetic instruction generation pipeline for vision–language model training. The proposed methodology explores whether synthetic multimodal supervision can serve as a scalable alternative to manual annotation, while also examining the impact of reward modeling, generator model scale, and parameter-efficient fine-tuning techniques on downstream multimodal performance. The proposed pipeline follows a modular Magpie-style framework. Instructions and responses are generated using Qwen2.5-VL models conditioned on images sampled from The Cauldron dataset mixture. The pipeline includes instruction synthesis, multimodal response generation, sanitization, reward-based filtering, and dataset construction. Both text-only and multimodal reward models, including DeBERTa-v3 and Skywork-VL-Reward-7B, are used to automatically filter low-quality or weakly grounded samples. The generated datasets are subsequently used for supervised fine-tuning of Qwen2.5-VL target models. Experimental evaluation is performed across multiple multimodal benchmarks covering OCR understanding, chart reasoning, document interpretation, scientific reasoning, and general multimodal instruction following. The thesis additionally investigates multimodal self-distillation and compares full fine-tuning with parameter-efficient adaptation methods such as LoRA and QLoRA. The experimental results demonstrate that synthetic multimodal supervision can effectively improve downstream multimodal reasoning performance while remaining computationally scalable. In particular, LoRA-based fine-tuning achieves highly competitive performance with substantially lower computational cost than full fine-tuning. The findings also highlight the importance of reward-based filtering and dataset quality in multimodal instruction tuning pipelines. As part of this work, the proposed methodology was submitted to the DCVLR (Data Curation for Vision-Language Reasoning) competition, where it achieved 3rd place, validating the effectiveness of the proposed synthetic multimodal data generation framework. Overall, this thesis contributes to the growing field of data-centric multimodal learning by demonstrating that synthetic instruction generation, reward modeling, and efficient adaptation techniques provide a practical and scalable framework for future vision–language foundation models."]},{"key":"dc:title","label":"Title","values":["Instruction Mining from Images: Constructing a Synthetic Dataset for Multimodal Learning"]}]}],"canonical_facts":{"dc:creator":["Κασούρα Ελένη","Kasoura Eleni"],"dc:date":["2026"],"dc:description":["Η ραγδαία εξέλιξη των μεγάλων γλωσσικών μοντέλων (Large Language Models – LLMs) και των πολυτροπικών μοντέλων όρασης–γλώσσας (Multimodal Large Language Models – MLLMs) έχει οδηγήσει στην ανάπτυξη συστημάτων ικανών να συνδυάζουν οπτική και γλωσσική πληροφορία για την εκτέλεση σύνθετων εργασιών συλλογισμού, κατανόησης εγγράφων, OCR, οπτικού διαλόγου και multimodal instruction following. Παρά τις σημαντικές επιδόσεις των σύγχρονων μοντέλων, η εκπαίδευσή τους εξαρτάται σε μεγάλο βαθμό από τη διαθεσιμότητα μεγάλων και υψηλής ποιότητας multimodal instruction datasets. Η χειροκίνητη δημιουργία τέτοιων συνόλων δεδομένων είναι ιδιαίτερα δαπανηρή, χρονοβόρα και δύσκολα επεκτάσιμη, ειδικά σε εργασίες που απαιτούν σύνθετο οπτικό συλλογισμό και ακριβές grounding μεταξύ εικόνας και κειμένου. Σκοπός της παρούσας διπλωματικής εργασίας είναι η μελέτη και ανάπτυξη ενός πλήρους pipeline συνθετικής παραγωγής multimodal instruction δεδομένων για την εκπαίδευση vision–language μοντέλων. Η εργασία διερευνά κατά πόσο η συνθετική παραγωγή δεδομένων μπορεί να αποτελέσει μία αποδοτική και επεκτάσιμη εναλλακτική λύση έναντι της χειροκίνητης επισημείωσης, καθώς και πώς διαφορετικές στρατηγικές φιλτραρίσματος, reward modeling και fine-tuning επηρεάζουν την τελική απόδοση των μοντέλων. Αρχικά παρουσιάζονται οι θεωρητικές βάσεις της επεξεργασίας φυσικής γλώσσας, της υπολογιστικής όρασης και των multimodal συστημάτων. Αναλύεται η εξέλιξη από τα distributed word embeddings και τα sequence-to-sequence μοντέλα έως τους Transformers και τα σύγχρονα foundation models. Παράλληλα εξετάζονται οι εξελίξεις στην computer vision, στα self-supervised και contrastive learning frameworks, καθώς και στα vision–language μοντέλα όπως τα CLIP, BLIP-2, LLaVA, InstructBLIP, Qwen-VL και Qwen2.5-VL. Στο πλαίσιο της εργασίας αναπτύχθηκε ένα modular multimodal synthetic instruction generation pipeline βασισμένο σε Magpie-style instruction synthesis. Για τη δημιουργία των synthetic δεδομένων χρησιμοποιήθηκαν τα μοντέλα Qwen2.5-VL-7B-Instruct και Qwen2.5-VL-32B-Instruct, ενώ οι εικόνες αντλήθηκαν από το dataset mixture The Cauldron, το οποίο περιλαμβάνει δεδομένα από OCR, charts, diagrams, scientific reasoning και visual question answering tasks. Το pipeline περιλαμβάνει διαδοχικά στάδια instruction synthesis, multimodal response generation, sanitization, reward-based filtering και τελικής κατασκευής του dataset. Για τον έλεγχο ποιότητας των παραγόμενων δεδομένων χρησιμοποιήθηκαν τόσο text-only reward models βασισμένα στο DeBERTa-v3 όσο και multimodal reward models όπως το Skywork-VL-Reward-7B. Μέσω αυτών πραγματοποιήθηκε φιλτράρισμα των instruction–response pairs με σκοπό τη διατήρηση δειγμάτων υψηλής ποιότητας και καλύτερου visual grounding. Επιπλέον, διερευνήθηκε η επίδραση του μεγέθους του generator model, η δυνατότητα multimodal self-distillation, καθώς και η αποδοτικότητα parameter-efficient fine-tuning τεχνικών όπως οι LoRA και QLoRA. Τα synthetic datasets που δημιουργήθηκαν χρησιμοποιήθηκαν για supervised fine-tuning διαφορετικών εκδόσεων των Qwen2.5-VL μοντέλων. Η αξιολόγηση πραγματοποιήθηκε σε ένα σύνολο multimodal benchmarks που περιλαμβάνουν OCR-intensive reasoning, document understanding, chart reasoning και γενικό multimodal reasoning. Τα αποτελέσματα έδειξαν ότι η συνθετική multimodal supervision μπορεί να βελτιώσει αποτελεσματικά τις επιδόσεις των μοντέλων χωρίς σημαντική υποβάθμιση της γενίκευσης, ενώ παράλληλα αναδείχθηκε η σημασία του reward-based filtering και της ποιότητας των synthetic δεδομένων. Ιδιαίτερα σημαντικό εύρημα της εργασίας είναι ότι οι parameter-efficient τεχνικές fine-tuning, και κυρίως το LoRA, πέτυχαν επιδόσεις συγκρίσιμες ή ανώτερες από το πλήρες fine-tuning, με αισθητά μικρότερο υπολογιστικό κόστος. Επιπλέον, παρατηρήθηκε ότι η χρήση multimodal reward models προσφέρει μετρήσιμη αλλά σχετικά περιορισμένη βελτίωση σε σχέση με text-only filtering strategies, ενώ το μέγεθος του generator model είχε μικρότερη επίδραση από άλλους παράγοντες όπως η στρατηγική fine-tuning και η ποιότητα του filtering pipeline. Στο πλαίσιο της έρευνας πραγματοποιήθηκε επίσης συμμετοχή στον διεθνή διαγωνισμό DCVLR (Data Curation for Vision-Language Reasoning), όπου το προτεινόμενο pipeline κατέκτησε την 3η θέση μεταξύ των συμμετοχών, επιβεβαιώνοντας την αποτελεσματικότητα της προτεινόμενης προσέγγισης στην παραγωγή multimodal synthetic instruction δεδομένων. Συνολικά, η εργασία συμβάλλει στην ευρύτερη ερευνητική κατεύθυνση των data-centric multimodal learning pipelines, αναδεικνύοντας ότι η συνθετική παραγωγή multimodal δεδομένων, σε συνδυασμό με reward modeling και parameter-efficient adaptation τεχνικές, μπορεί να αποτελέσει μία πρακτική και επεκτάσιμη προσέγγιση για την εκπαίδευση μελλοντικών vision–language foundation models.","The rapid advancement of large language models (LLMs) and multimodal large language models (MLLMs) has significantly transformed natural language processing and computer vision. Modern vision–language systems are capable of performing complex multimodal reasoning tasks such as visual question answering, OCR-based reasoning, document understanding, grounded dialogue, and scientific interpretation. However, their performance strongly depends on the availability of large-scale, high-quality multimodal instruction datasets, whose manual construction is expensive and difficult to scale. This thesis investigates the development and evaluation of a multimodal synthetic instruction generation pipeline for vision–language model training. The proposed methodology explores whether synthetic multimodal supervision can serve as a scalable alternative to manual annotation, while also examining the impact of reward modeling, generator model scale, and parameter-efficient fine-tuning techniques on downstream multimodal performance. The proposed pipeline follows a modular Magpie-style framework. Instructions and responses are generated using Qwen2.5-VL models conditioned on images sampled from The Cauldron dataset mixture. The pipeline includes instruction synthesis, multimodal response generation, sanitization, reward-based filtering, and dataset construction. Both text-only and multimodal reward models, including DeBERTa-v3 and Skywork-VL-Reward-7B, are used to automatically filter low-quality or weakly grounded samples. The generated datasets are subsequently used for supervised fine-tuning of Qwen2.5-VL target models. Experimental evaluation is performed across multiple multimodal benchmarks covering OCR understanding, chart reasoning, document interpretation, scientific reasoning, and general multimodal instruction following. The thesis additionally investigates multimodal self-distillation and compares full fine-tuning with parameter-efficient adaptation methods such as LoRA and QLoRA. The experimental results demonstrate that synthetic multimodal supervision can effectively improve downstream multimodal reasoning performance while remaining computationally scalable. In particular, LoRA-based fine-tuning achieves highly competitive performance with substantially lower computational cost than full fine-tuning. The findings also highlight the importance of reward-based filtering and dataset quality in multimodal instruction tuning pipelines. As part of this work, the proposed methodology was submitted to the DCVLR (Data Curation for Vision-Language Reasoning) competition, where it achieved 3rd place, validating the effectiveness of the proposed synthetic multimodal data generation framework. Overall, this thesis contributes to the growing field of data-centric multimodal learning by demonstrating that synthetic instruction generation, reward modeling, and efficient adaptation techniques provide a practical and scalable framework for future vision–language foundation models."],"dc:identifier":["uoadl:5410418","https://pergamos.lib.uoa.gr/uoa/dl/object/5410418"],"dc:language":["English"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["Instruction Mining from Images: Constructing a Synthetic Dataset for Multimodal Learning"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-07-24T01:02:36Z"}