{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5359962"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5359962","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"Adapting Whisper for Modern Greek and Dialectal Speech Recognition: A Multitask and Curriculum Learning Approach","abstract":"Οι πρόσφατες εξελίξεις στα μεγάλης κλίμακας αυτοεπιβλεπόμενα μοντέλα ομιλίας έχουν οδηγήσει σε σημαντικές βελτιώσεις στην αυτόματη αναγνώριση ομιλίας (ASR), ιδίως σε γλώσσες με πλούσιους γλωσσικούς πόρους. Παρ’ όλα αυτά, η προσαρμογή των μοντέλων αυτών σε γλώσσες χαμηλών και μεσαίων πόρων, καθώς και σε διαλεκτικές ποικιλίες, εξακολουθεί να αποτελεί πρόκληση. Οι βασικές δυσκολίες σχετίζονται με την περιορισμένη διαθεσιμότητα επισημειωμένων δεδομένων, την ορθογραφική αστάθεια και τη σημαντική απόκλιση μεταξύ των κατανομών εκπαίδευσης και στόχου. Στην παρούσα διπλωματική εργασία μελετάται η προσαρμογή του μοντέλου Whisper της OpenAI στην Ελληνική γλώσσα και σε τρεις διαλεκτικές ποικιλίες της: την Κυπριακή, την Κρητική και τη Μεσσηνιακή. Για την Κοινή Νέα Ελληνική προτείνεται ένα πλαίσιο πολυδιεργασιακής μάθησης, το οποίο βελτιστοποιεί ταυτόχρονα την αναγνώριση ομιλίας και τη μετάφραση ομιλίας σε κείμενο, μέσω παράλληλης εκπαίδευσης σε μεταγραφές και μεταφράσεις. Στόχος είναι η ενίσχυση της διαγλωσσικής μεταφοράς γνώσης και η βελτίωση της γενίκευσης σε σύγκριση με ένα απλό μοντέλο που έχει υποστεί εξειδικευμένη προσαρμογή (fine-tuning). Για τη διαλεκτική προσαρμογή προτείνεται ένα ενιαίο πλαίσιο που βασίζεται σε τρεις βασικούς άξονες: (α) επαύξηση δεδομένων μέσω μιας γειτονικής γλωσσικής ποικιλίας-πηγής, (β) συνδυασμός εποπτείας αναγνώρισης και μετάφρασης στο πλαίσιο πολυδιεργασιακής μάθησης και (γ) σταδιακή εκπαίδευση με τη μορφή curriculum learning, ώστε η μετάβαση από τη Νέα Ελληνική στη διάλεκτο-στόχο να πραγματοποιείται προοδευτικά και ελεγχόμενα. Το προτεινόμενο σχήμα υλοποιείται ως τετρασταδιακή διαδικασία, η οποία ξεκινά με διαγλωσσική μετάφραση και εποπτεία από τη γλώσσα-πηγή, συνεχίζει με δύο στάδια μικτής εκπαίδευσης σε μεταγραφές και μεταφράσεις και καταλήγει σε εξειδικευμένη προσαρμογή αναγνώρισης ομιλίας στη διάλεκτο-στόχο. Τα πειραματικά αποτελέσματα για την περίπτωση της Νέας Ελληνικής έδειξαν ότι, σε διαφορετικές κλίμακες του μοντέλου Whisper, η απλή ταυτόχρονη εκπαίδευση σε πολλαπλές εργασίες δεν οδηγεί πάντοτε σε σταθερή βελτίωση για μοντέλα μεγάλης χωρητικότητας, όπως το Whisper-large-v3-turbo. Αντιθέτως, παρατηρείται θετική επίδραση κυρίως σε μοντέλα μικρής και μεσαίας χωρητικότητας (Whisper-small και Whisper-medium), με βελτιώσεις (WER) που φθάνουν έως και περίπου 7% σε ορισμένες ρυθμίσεις, και μέσο όφελος περίπου 2% για τα μοντέλα μεσαίας χωρητικότητας. Αντίθετα, η σταδιακή εκπαίδευση βάσει curriculum, σε συνδυασμό με την πολυδιεργασιακή εποπτεία, οδηγεί σε συστηματική βελτίωση του Ποσοστού Σφαλμάτων Λέξεων (WER) και Χαρακτήρων (CER), ιδίως στα διαλεκτικά σενάρια χαμηλών πόρων. Συγκεκριμένα, σε σύγκριση με την απλή επιβλεπόμενη προσαρμογή (fine-tuning), παρατηρείται μέση μείωση του WER που κυμαίνεται μεταξύ 25% και 35% σε όλες τις κλίμακες μοντέλων, ενώ σε ορισμένες περιπτώσεις, όπως στο κρητικό ιδίωμα, η βελτίωση προσεγγίζει το 48%. Τα αποτελέσματα δείχνουν ότι το curriculum learning διευκολύνει τη μεταφορά γνώσης από την Κοινή Νεοελληνική προς τις διαλεκτικές ποικιλίες, περιορίζοντας την αποσταθεροποίηση που παρατηρείται στην απλή πολυδιεργασιακή εκπαίδευση. Επιπλέον, η αφαίρεση της διαγλωσσικής προ-ευθυγράμμισης (Greek Pre-Alignment) οδηγεί σε εντονότερη υποβάθμιση της απόδοσης στο Μεσσηνιακό ιδίωμα, δείχνοντας ότι οι μηχανισμοί διαλεκτικής αγκύρωσης (cross-dialect anchoring) είναι κρίσιμοι σε συνθήκες περιορισμένων δεδομένων. Αντίστοιχα, η αφαίρεση της εποπτείας μετάφρασης επιφέρει σαφή αύξηση του WER και του CER σε όλα τα μοντέλα, γεγονός που καταδεικνύει ότι η πολυδιεργασιακή εποπτεία δεν λειτουργεί απλώς επικουρικά, αλλά ενισχύει ουσιαστικά τη διαλεκτική γενίκευση. Συνολικά, υποδεικνύεται ότι ο συνδυασμός curriculum learning και πολυδιεργασιακής εκπαίδευσης συνιστά μια σταθερή και αποδοτική στρατηγική προσαρμογής σε διαλεκτικά σενάρια χαμηλών πόρων, επιτυγχάνοντας σημαντική και συστηματική μείωση των σφαλμάτων αναγνώρισης","abstract_html":"Οι πρόσφατες εξελίξεις στα μεγάλης κλίμακας αυτοεπιβλεπόμενα μοντέλα ομιλίας έχουν οδηγήσει σε σημαντικές βελτιώσεις στην αυτόματη αναγνώριση ομιλίας (ASR), ιδίως σε γλώσσες με πλούσιους γλωσσικούς πόρους. Παρ’ όλα αυτά, η προσαρμογή των μοντέλων αυτών σε γλώσσες χαμηλών και μεσαίων πόρων, καθώς και σε διαλεκτικές ποικιλίες, εξακολουθεί να αποτελεί πρόκληση. Οι βασικές δυσκολίες σχετίζονται με την περιορισμένη διαθεσιμότητα επισημειωμένων δεδομένων, την ορθογραφική αστάθεια και τη σημαντική απόκλιση μεταξύ των κατανομών εκπαίδευσης και στόχου. Στην παρούσα διπλωματική εργασία μελετάται η προσαρμογή του μοντέλου Whisper της OpenAI στην Ελληνική γλώσσα και σε τρεις διαλεκτικές ποικιλίες της: την Κυπριακή, την Κρητική και τη Μεσσηνιακή. Για την Κοινή Νέα Ελληνική προτείνεται ένα πλαίσιο πολυδιεργασιακής μάθησης, το οποίο βελτιστοποιεί ταυτόχρονα την αναγνώριση ομιλίας και τη μετάφραση ομιλίας σε κείμενο, μέσω παράλληλης εκπαίδευσης σε μεταγραφές και μεταφράσεις. Στόχος είναι η ενίσχυση της διαγλωσσικής μεταφοράς γνώσης και η βελτίωση της γενίκευσης σε σύγκριση με ένα απλό μοντέλο που έχει υποστεί εξειδικευμένη προσαρμογή (fine-tuning). Για τη διαλεκτική προσαρμογή προτείνεται ένα ενιαίο πλαίσιο που βασίζεται σε τρεις βασικούς άξονες: (α) επαύξηση δεδομένων μέσω μιας γειτονικής γλωσσικής ποικιλίας-πηγής, (β) συνδυασμός εποπτείας αναγνώρισης και μετάφρασης στο πλαίσιο πολυδιεργασιακής μάθησης και (γ) σταδιακή εκπαίδευση με τη μορφή curriculum learning, ώστε η μετάβαση από τη Νέα Ελληνική στη διάλεκτο-στόχο να πραγματοποιείται προοδευτικά και ελεγχόμενα. Το προτεινόμενο σχήμα υλοποιείται ως τετρασταδιακή διαδικασία, η οποία ξεκινά με διαγλωσσική μετάφραση και εποπτεία από τη γλώσσα-πηγή, συνεχίζει με δύο στάδια μικτής εκπαίδευσης σε μεταγραφές και μεταφράσεις και καταλήγει σε εξειδικευμένη προσαρμογή αναγνώρισης ομιλίας στη διάλεκτο-στόχο. Τα πειραματικά αποτελέσματα για την περίπτωση της Νέας Ελληνικής έδειξαν ότι, σε διαφορετικές κλίμακες του μοντέλου Whisper, η απλή ταυτόχρονη εκπαίδευση σε πολλαπλές εργασίες δεν οδηγεί πάντοτε σε σταθερή βελτίωση για μοντέλα μεγάλης χωρητικότητας, όπως το Whisper-large-v3-turbo. Αντιθέτως, παρατηρείται θετική επίδραση κυρίως σε μοντέλα μικρής και μεσαίας χωρητικότητας (Whisper-small και Whisper-medium), με βελτιώσεις (WER) που φθάνουν έως και περίπου 7% σε ορισμένες ρυθμίσεις, και μέσο όφελος περίπου 2% για τα μοντέλα μεσαίας χωρητικότητας. Αντίθετα, η σταδιακή εκπαίδευση βάσει curriculum, σε συνδυασμό με την πολυδιεργασιακή εποπτεία, οδηγεί σε συστηματική βελτίωση του Ποσοστού Σφαλμάτων Λέξεων (WER) και Χαρακτήρων (CER), ιδίως στα διαλεκτικά σενάρια χαμηλών πόρων. Συγκεκριμένα, σε σύγκριση με την απλή επιβλεπόμενη προσαρμογή (fine-tuning), παρατηρείται μέση μείωση του WER που κυμαίνεται μεταξύ 25% και 35% σε όλες τις κλίμακες μοντέλων, ενώ σε ορισμένες περιπτώσεις, όπως στο κρητικό ιδίωμα, η βελτίωση προσεγγίζει το 48%. Τα αποτελέσματα δείχνουν ότι το curriculum learning διευκολύνει τη μεταφορά γνώσης από την Κοινή Νεοελληνική προς τις διαλεκτικές ποικιλίες, περιορίζοντας την αποσταθεροποίηση που παρατηρείται στην απλή πολυδιεργασιακή εκπαίδευση. Επιπλέον, η αφαίρεση της διαγλωσσικής προ-ευθυγράμμισης (Greek Pre-Alignment) οδηγεί σε εντονότερη υποβάθμιση της απόδοσης στο Μεσσηνιακό ιδίωμα, δείχνοντας ότι οι μηχανισμοί διαλεκτικής αγκύρωσης (cross-dialect anchoring) είναι κρίσιμοι σε συνθήκες περιορισμένων δεδομένων. Αντίστοιχα, η αφαίρεση της εποπτείας μετάφρασης επιφέρει σαφή αύξηση του WER και του CER σε όλα τα μοντέλα, γεγονός που καταδεικνύει ότι η πολυδιεργασιακή εποπτεία δεν λειτουργεί απλώς επικουρικά, αλλά ενισχύει ουσιαστικά τη διαλεκτική γενίκευση. Συνολικά, υποδεικνύεται ότι ο συνδυασμός curriculum learning και πολυδιεργασιακής εκπαίδευσης συνιστά μια σταθερή και αποδοτική στρατηγική προσαρμογής σε διαλεκτικά σενάρια χαμηλών πόρων, επιτυγχάνοντας σημαντική και συστηματική μείωση των σφαλμάτων αναγνώρισης","abstract_has_math":false,"creators":["Κλήμη Αντιγόνη","Klimi Antigoni"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-07-24T01:01:53Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["English"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5359962"],"render_values":[{"text":"uoadl:5359962","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5359962","outbound_label":"Repository record","outbound_source":"dc:identifier"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Κλήμη Αντιγόνη","Klimi Antigoni"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["English"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5359962","https://pergamos.lib.uoa.gr/uoa/dl/object/5359962"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Οι πρόσφατες εξελίξεις στα μεγάλης κλίμακας αυτοεπιβλεπόμενα μοντέλα ομιλίας έχουν οδηγήσει σε σημαντικές βελτιώσεις στην αυτόματη αναγνώριση ομιλίας (ASR), ιδίως σε γλώσσες με πλούσιους γλωσσικούς πόρους. Παρ’ όλα αυτά, η προσαρμογή των μοντέλων αυτών σε γλώσσες χαμηλών και μεσαίων πόρων, καθώς και σε διαλεκτικές ποικιλίες, εξακολουθεί να αποτελεί πρόκληση. Οι βασικές δυσκολίες σχετίζονται με την περιορισμένη διαθεσιμότητα επισημειωμένων δεδομένων, την ορθογραφική αστάθεια και τη σημαντική απόκλιση μεταξύ των κατανομών εκπαίδευσης και στόχου. Στην παρούσα διπλωματική εργασία μελετάται η προσαρμογή του μοντέλου Whisper της OpenAI στην Ελληνική γλώσσα και σε τρεις διαλεκτικές ποικιλίες της: την Κυπριακή, την Κρητική και τη Μεσσηνιακή. Για την Κοινή Νέα Ελληνική προτείνεται ένα πλαίσιο πολυδιεργασιακής μάθησης, το οποίο βελτιστοποιεί ταυτόχρονα την αναγνώριση ομιλίας και τη μετάφραση ομιλίας σε κείμενο, μέσω παράλληλης εκπαίδευσης σε μεταγραφές και μεταφράσεις. Στόχος είναι η ενίσχυση της διαγλωσσικής μεταφοράς γνώσης και η βελτίωση της γενίκευσης σε σύγκριση με ένα απλό μοντέλο που έχει υποστεί εξειδικευμένη προσαρμογή (fine-tuning). Για τη διαλεκτική προσαρμογή προτείνεται ένα ενιαίο πλαίσιο που βασίζεται σε τρεις βασικούς άξονες: (α) επαύξηση δεδομένων μέσω μιας γειτονικής γλωσσικής ποικιλίας-πηγής, (β) συνδυασμός εποπτείας αναγνώρισης και μετάφρασης στο πλαίσιο πολυδιεργασιακής μάθησης και (γ) σταδιακή εκπαίδευση με τη μορφή curriculum learning, ώστε η μετάβαση από τη Νέα Ελληνική στη διάλεκτο-στόχο να πραγματοποιείται προοδευτικά και ελεγχόμενα. Το προτεινόμενο σχήμα υλοποιείται ως τετρασταδιακή διαδικασία, η οποία ξεκινά με διαγλωσσική μετάφραση και εποπτεία από τη γλώσσα-πηγή, συνεχίζει με δύο στάδια μικτής εκπαίδευσης σε μεταγραφές και μεταφράσεις και καταλήγει σε εξειδικευμένη προσαρμογή αναγνώρισης ομιλίας στη διάλεκτο-στόχο. Τα πειραματικά αποτελέσματα για την περίπτωση της Νέας Ελληνικής έδειξαν ότι, σε διαφορετικές κλίμακες του μοντέλου Whisper, η απλή ταυτόχρονη εκπαίδευση σε πολλαπλές εργασίες δεν οδηγεί πάντοτε σε σταθερή βελτίωση για μοντέλα μεγάλης χωρητικότητας, όπως το Whisper-large-v3-turbo. Αντιθέτως, παρατηρείται θετική επίδραση κυρίως σε μοντέλα μικρής και μεσαίας χωρητικότητας (Whisper-small και Whisper-medium), με βελτιώσεις (WER) που φθάνουν έως και περίπου 7% σε ορισμένες ρυθμίσεις, και μέσο όφελος περίπου 2% για τα μοντέλα μεσαίας χωρητικότητας. Αντίθετα, η σταδιακή εκπαίδευση βάσει curriculum, σε συνδυασμό με την πολυδιεργασιακή εποπτεία, οδηγεί σε συστηματική βελτίωση του Ποσοστού Σφαλμάτων Λέξεων (WER) και Χαρακτήρων (CER), ιδίως στα διαλεκτικά σενάρια χαμηλών πόρων. Συγκεκριμένα, σε σύγκριση με την απλή επιβλεπόμενη προσαρμογή (fine-tuning), παρατηρείται μέση μείωση του WER που κυμαίνεται μεταξύ 25% και 35% σε όλες τις κλίμακες μοντέλων, ενώ σε ορισμένες περιπτώσεις, όπως στο κρητικό ιδίωμα, η βελτίωση προσεγγίζει το 48%. Τα αποτελέσματα δείχνουν ότι το curriculum learning διευκολύνει τη μεταφορά γνώσης από την Κοινή Νεοελληνική προς τις διαλεκτικές ποικιλίες, περιορίζοντας την αποσταθεροποίηση που παρατηρείται στην απλή πολυδιεργασιακή εκπαίδευση. Επιπλέον, η αφαίρεση της διαγλωσσικής προ-ευθυγράμμισης (Greek Pre-Alignment) οδηγεί σε εντονότερη υποβάθμιση της απόδοσης στο Μεσσηνιακό ιδίωμα, δείχνοντας ότι οι μηχανισμοί διαλεκτικής αγκύρωσης (cross-dialect anchoring) είναι κρίσιμοι σε συνθήκες περιορισμένων δεδομένων. Αντίστοιχα, η αφαίρεση της εποπτείας μετάφρασης επιφέρει σαφή αύξηση του WER και του CER σε όλα τα μοντέλα, γεγονός που καταδεικνύει ότι η πολυδιεργασιακή εποπτεία δεν λειτουργεί απλώς επικουρικά, αλλά ενισχύει ουσιαστικά τη διαλεκτική γενίκευση. Συνολικά, υποδεικνύεται ότι ο συνδυασμός curriculum learning και πολυδιεργασιακής εκπαίδευσης συνιστά μια σταθερή και αποδοτική στρατηγική προσαρμογής σε διαλεκτικά σενάρια χαμηλών πόρων, επιτυγχάνοντας σημαντική και συστηματική μείωση των σφαλμάτων αναγνώρισης","Recent advances in large-scale self-supervised speech models have led to substantial improvements in Automatic Speech Recognition (ASR), particularly for high-resource languages. However, adapting such models to low- and mid-resource languages, as well as to dialectal varieties, remains challenging due to limited annotated data, orthographic variability, and significant distributional mismatch between training and target domains. In this thesis, we investigate the adaptation of OpenAI’s Whisper model to Standard Modern Greek and three dialectal varieties: Cypriot, Cretan, and Messenian. For Standard Greek, we propose a multitask learning framework that jointly optimizes speech recognition and speech-to-text translation by training on both transcriptions and translations. The goal is to enhance cross-lingual transfer and improve generalization compared to conventional fine-tuning. For dialect adaptation, we introduce a unified framework built upon three complementary components: (i) data augmentation through a linguistically adjacent source variety, (ii) joint ASR and translation supervision within a multitask setting, and (iii) a curriculum-based training strategy that progressively transitions from Standard Greek to the target dialect. The proposed approach is implemented as a four-stage process, starting with cross-lingual translation-based supervision from the source language, followed by two intermediate mixed stages combining transcription and translation, and culminating in dialect-specific ASR fine-tuning. Experimental results for Standard Greek show that naive multitask training does not consistently improve performance for high-capacity models such as Whisper-large-v3-turbo. In contrast, small- and medium-scale models (Whisper-small and Whisper-medium) benefit more clearly in Word Erro Rate (WER), achieving improvements of up to approximately 7% in certain configurations, with an average gain of around 2% for medium-scale models. For dialectal adaptation under low-resource conditions, curriculum-based multitask training yields systematic and substantial reductions in Word Error Rate (WER) and Character Error Rate (CER). Compared to standard supervised fine-tuning, the proposed framework achieves average relative WER reductions ranging from 25% to 35% across model scales, with improvements reaching up to 48% in the Cretan dialect. These gains are consistent across small, medium, and large-capacity models, suggesting that the progressive introduction of dialectal data stabilizes learning and mitigates distributional shift. Ablation experiments further demonstrate that removing Greek pre-alignment (cross-dialect anchoring) significantly degrades performance, particularly for the Messenian dialect, highlighting the importance of dialectal anchoring mechanisms in data-scarce settings. Similarly, eliminating translation supervision leads to consistent increases in WER and CER across all models, confirming that multitask supervision plays a central role in enhancing dialectal generalization. Overall, the findings indicate that the combination of curriculum learning and multitask training constitutes a robust and effective strategy for low-resource dialect adaptation, enabling substantial and systematic reductions in recognition errors."]},{"key":"dc:title","label":"Title","values":["Adapting Whisper for Modern Greek and Dialectal Speech Recognition: A Multitask and Curriculum Learning Approach"]}]}],"canonical_facts":{"dc:creator":["Κλήμη Αντιγόνη","Klimi Antigoni"],"dc:date":["2026"],"dc:description":["Οι πρόσφατες εξελίξεις στα μεγάλης κλίμακας αυτοεπιβλεπόμενα μοντέλα ομιλίας έχουν οδηγήσει σε σημαντικές βελτιώσεις στην αυτόματη αναγνώριση ομιλίας (ASR), ιδίως σε γλώσσες με πλούσιους γλωσσικούς πόρους. Παρ’ όλα αυτά, η προσαρμογή των μοντέλων αυτών σε γλώσσες χαμηλών και μεσαίων πόρων, καθώς και σε διαλεκτικές ποικιλίες, εξακολουθεί να αποτελεί πρόκληση. Οι βασικές δυσκολίες σχετίζονται με την περιορισμένη διαθεσιμότητα επισημειωμένων δεδομένων, την ορθογραφική αστάθεια και τη σημαντική απόκλιση μεταξύ των κατανομών εκπαίδευσης και στόχου. Στην παρούσα διπλωματική εργασία μελετάται η προσαρμογή του μοντέλου Whisper της OpenAI στην Ελληνική γλώσσα και σε τρεις διαλεκτικές ποικιλίες της: την Κυπριακή, την Κρητική και τη Μεσσηνιακή. Για την Κοινή Νέα Ελληνική προτείνεται ένα πλαίσιο πολυδιεργασιακής μάθησης, το οποίο βελτιστοποιεί ταυτόχρονα την αναγνώριση ομιλίας και τη μετάφραση ομιλίας σε κείμενο, μέσω παράλληλης εκπαίδευσης σε μεταγραφές και μεταφράσεις. Στόχος είναι η ενίσχυση της διαγλωσσικής μεταφοράς γνώσης και η βελτίωση της γενίκευσης σε σύγκριση με ένα απλό μοντέλο που έχει υποστεί εξειδικευμένη προσαρμογή (fine-tuning). Για τη διαλεκτική προσαρμογή προτείνεται ένα ενιαίο πλαίσιο που βασίζεται σε τρεις βασικούς άξονες: (α) επαύξηση δεδομένων μέσω μιας γειτονικής γλωσσικής ποικιλίας-πηγής, (β) συνδυασμός εποπτείας αναγνώρισης και μετάφρασης στο πλαίσιο πολυδιεργασιακής μάθησης και (γ) σταδιακή εκπαίδευση με τη μορφή curriculum learning, ώστε η μετάβαση από τη Νέα Ελληνική στη διάλεκτο-στόχο να πραγματοποιείται προοδευτικά και ελεγχόμενα. Το προτεινόμενο σχήμα υλοποιείται ως τετρασταδιακή διαδικασία, η οποία ξεκινά με διαγλωσσική μετάφραση και εποπτεία από τη γλώσσα-πηγή, συνεχίζει με δύο στάδια μικτής εκπαίδευσης σε μεταγραφές και μεταφράσεις και καταλήγει σε εξειδικευμένη προσαρμογή αναγνώρισης ομιλίας στη διάλεκτο-στόχο. Τα πειραματικά αποτελέσματα για την περίπτωση της Νέας Ελληνικής έδειξαν ότι, σε διαφορετικές κλίμακες του μοντέλου Whisper, η απλή ταυτόχρονη εκπαίδευση σε πολλαπλές εργασίες δεν οδηγεί πάντοτε σε σταθερή βελτίωση για μοντέλα μεγάλης χωρητικότητας, όπως το Whisper-large-v3-turbo. Αντιθέτως, παρατηρείται θετική επίδραση κυρίως σε μοντέλα μικρής και μεσαίας χωρητικότητας (Whisper-small και Whisper-medium), με βελτιώσεις (WER) που φθάνουν έως και περίπου 7% σε ορισμένες ρυθμίσεις, και μέσο όφελος περίπου 2% για τα μοντέλα μεσαίας χωρητικότητας. Αντίθετα, η σταδιακή εκπαίδευση βάσει curriculum, σε συνδυασμό με την πολυδιεργασιακή εποπτεία, οδηγεί σε συστηματική βελτίωση του Ποσοστού Σφαλμάτων Λέξεων (WER) και Χαρακτήρων (CER), ιδίως στα διαλεκτικά σενάρια χαμηλών πόρων. Συγκεκριμένα, σε σύγκριση με την απλή επιβλεπόμενη προσαρμογή (fine-tuning), παρατηρείται μέση μείωση του WER που κυμαίνεται μεταξύ 25% και 35% σε όλες τις κλίμακες μοντέλων, ενώ σε ορισμένες περιπτώσεις, όπως στο κρητικό ιδίωμα, η βελτίωση προσεγγίζει το 48%. Τα αποτελέσματα δείχνουν ότι το curriculum learning διευκολύνει τη μεταφορά γνώσης από την Κοινή Νεοελληνική προς τις διαλεκτικές ποικιλίες, περιορίζοντας την αποσταθεροποίηση που παρατηρείται στην απλή πολυδιεργασιακή εκπαίδευση. Επιπλέον, η αφαίρεση της διαγλωσσικής προ-ευθυγράμμισης (Greek Pre-Alignment) οδηγεί σε εντονότερη υποβάθμιση της απόδοσης στο Μεσσηνιακό ιδίωμα, δείχνοντας ότι οι μηχανισμοί διαλεκτικής αγκύρωσης (cross-dialect anchoring) είναι κρίσιμοι σε συνθήκες περιορισμένων δεδομένων. Αντίστοιχα, η αφαίρεση της εποπτείας μετάφρασης επιφέρει σαφή αύξηση του WER και του CER σε όλα τα μοντέλα, γεγονός που καταδεικνύει ότι η πολυδιεργασιακή εποπτεία δεν λειτουργεί απλώς επικουρικά, αλλά ενισχύει ουσιαστικά τη διαλεκτική γενίκευση. Συνολικά, υποδεικνύεται ότι ο συνδυασμός curriculum learning και πολυδιεργασιακής εκπαίδευσης συνιστά μια σταθερή και αποδοτική στρατηγική προσαρμογής σε διαλεκτικά σενάρια χαμηλών πόρων, επιτυγχάνοντας σημαντική και συστηματική μείωση των σφαλμάτων αναγνώρισης","Recent advances in large-scale self-supervised speech models have led to substantial improvements in Automatic Speech Recognition (ASR), particularly for high-resource languages. However, adapting such models to low- and mid-resource languages, as well as to dialectal varieties, remains challenging due to limited annotated data, orthographic variability, and significant distributional mismatch between training and target domains. In this thesis, we investigate the adaptation of OpenAI’s Whisper model to Standard Modern Greek and three dialectal varieties: Cypriot, Cretan, and Messenian. For Standard Greek, we propose a multitask learning framework that jointly optimizes speech recognition and speech-to-text translation by training on both transcriptions and translations. The goal is to enhance cross-lingual transfer and improve generalization compared to conventional fine-tuning. For dialect adaptation, we introduce a unified framework built upon three complementary components: (i) data augmentation through a linguistically adjacent source variety, (ii) joint ASR and translation supervision within a multitask setting, and (iii) a curriculum-based training strategy that progressively transitions from Standard Greek to the target dialect. The proposed approach is implemented as a four-stage process, starting with cross-lingual translation-based supervision from the source language, followed by two intermediate mixed stages combining transcription and translation, and culminating in dialect-specific ASR fine-tuning. Experimental results for Standard Greek show that naive multitask training does not consistently improve performance for high-capacity models such as Whisper-large-v3-turbo. In contrast, small- and medium-scale models (Whisper-small and Whisper-medium) benefit more clearly in Word Erro Rate (WER), achieving improvements of up to approximately 7% in certain configurations, with an average gain of around 2% for medium-scale models. For dialectal adaptation under low-resource conditions, curriculum-based multitask training yields systematic and substantial reductions in Word Error Rate (WER) and Character Error Rate (CER). Compared to standard supervised fine-tuning, the proposed framework achieves average relative WER reductions ranging from 25% to 35% across model scales, with improvements reaching up to 48% in the Cretan dialect. These gains are consistent across small, medium, and large-capacity models, suggesting that the progressive introduction of dialectal data stabilizes learning and mitigates distributional shift. Ablation experiments further demonstrate that removing Greek pre-alignment (cross-dialect anchoring) significantly degrades performance, particularly for the Messenian dialect, highlighting the importance of dialectal anchoring mechanisms in data-scarce settings. Similarly, eliminating translation supervision leads to consistent increases in WER and CER across all models, confirming that multitask supervision plays a central role in enhancing dialectal generalization. Overall, the findings indicate that the combination of curriculum learning and multitask training constitutes a robust and effective strategy for low-resource dialect adaptation, enabling substantial and systematic reductions in recognition errors."],"dc:identifier":["uoadl:5359962","https://pergamos.lib.uoa.gr/uoa/dl/object/5359962"],"dc:language":["English"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["Adapting Whisper for Modern Greek and Dialectal Speech Recognition: A Multitask and Curriculum Learning Approach"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-07-24T01:01:53Z"}