Back to search

National and Kapodistrian University of Athens

Adapting Whisper for Modern Greek and Dialectal Speech Recognition: A Multitask and Curriculum Learning Approach

Abstract

dc:description

Οι πρόσφατες εξελίξεις στα μεγάλης κλίμακας αυτοεπιβλεπόμενα μοντέλα ομιλίας έχουν οδηγήσει σε σημαντικές βελτιώσεις στην αυτόματη αναγνώριση ομιλίας (ASR), ιδίως σε γλώσσες με πλούσιους γλωσσικούς πόρους. Παρ’ όλα αυτά, η προσαρμογή των μοντέλων αυτών σε γλώσσες χαμηλών και μεσαίων πόρων, καθώς και σε διαλεκτικές ποικιλίες, εξακολουθεί να αποτελεί πρόκληση. Οι βασικές δυσκολίες σχετίζονται με την περιορισμένη διαθεσιμότητα επισημειωμένων δεδομένων, την ορθογραφική αστάθεια και τη σημαντική απόκλιση μεταξύ των κατανομών εκπαίδευσης και στόχου. Στην παρούσα διπλωματική εργασία μελετάται η προσαρμογή του μοντέλου Whisper της OpenAI στην Ελληνική γλώσσα και σε τρεις διαλεκτικές ποικιλίες της: την Κυπριακή, την Κρητική και τη Μεσσηνιακή. Για την Κοινή Νέα Ελληνική προτείνεται ένα πλαίσιο πολυδιεργασιακής μάθησης, το οποίο βελτιστοποιεί ταυτόχρονα την αναγνώριση ομιλίας και τη μετάφραση ομιλίας σε κείμενο, μέσω παράλληλης εκπαίδευσης σε μεταγραφές και μεταφράσεις. Στόχος είναι η ενίσχυση της διαγλωσσικής μεταφοράς γνώσης και η βελτίωση της γενίκευσης σε σύγκριση με ένα απλό μοντέλο που έχει υποστεί εξειδικευμένη προσαρμογή (fine-tuning). Για τη διαλεκτική προσαρμογή προτείνεται ένα ενιαίο πλαίσιο που βασίζεται σε τρεις βασικούς άξονες: (α) επαύξηση δεδομένων μέσω μιας γειτονικής γλωσσικής ποικιλίας-πηγής, (β) συνδυασμός εποπτείας αναγνώρισης και μετάφρασης στο πλαίσιο πολυδιεργασιακής μάθησης και (γ) σταδιακή εκπαίδευση με τη μορφή curriculum learning, ώστε η μετάβαση από τη Νέα Ελληνική στη διάλεκτο-στόχο να πραγματοποιείται προοδευτικά και ελεγχόμενα. Το προτεινόμενο σχήμα υλοποιείται ως τετρασταδιακή διαδικασία, η οποία ξεκινά με διαγλωσσική μετάφραση και εποπτεία από τη γλώσσα-πηγή, συνεχίζει με δύο στάδια μικτής εκπαίδευσης σε μεταγραφές και μεταφράσεις και καταλήγει σε εξειδικευμένη προσαρμογή αναγνώρισης ομιλίας στη διάλεκτο-στόχο. Τα πειραματικά αποτελέσματα για την περίπτωση της Νέας Ελληνικής έδειξαν ότι, σε διαφορετικές κλίμακες του μοντέλου Whisper, η απλή ταυτόχρονη εκπαίδευση σε πολλαπλές εργασίες δεν οδηγεί πάντοτε σε σταθερή βελτίωση για μοντέλα μεγάλης χωρητικότητας, όπως το Whisper-large-v3-turbo. Αντιθέτως, παρατηρείται θετική επίδραση κυρίως σε μοντέλα μικρής και μεσαίας χωρητικότητας (Whisper-small και Whisper-medium), με βελτιώσεις (WER) που φθάνουν έως και περίπου 7% σε ορισμένες ρυθμίσεις, και μέσο όφελος περίπου 2% για τα μοντέλα μεσαίας χωρητικότητας. Αντίθετα, η σταδιακή εκπαίδευση βάσει curriculum, σε συνδυασμό με την πολυδιεργασιακή εποπτεία, οδηγεί σε συστηματική βελτίωση του Ποσοστού Σφαλμάτων Λέξεων (WER) και Χαρακτήρων (CER), ιδίως στα διαλεκτικά σενάρια χαμηλών πόρων. Συγκεκριμένα, σε σύγκριση με την απλή επιβλεπόμενη προσαρμογή (fine-tuning), παρατηρείται μέση μείωση του WER που κυμαίνεται μεταξύ 25% και 35% σε όλες τις κλίμακες μοντέλων, ενώ σε ορισμένες περιπτώσεις, όπως στο κρητικό ιδίωμα, η βελτίωση προσεγγίζει το 48%. Τα αποτελέσματα δείχνουν ότι το curriculum learning διευκολύνει τη μεταφορά γνώσης από την Κοινή Νεοελληνική προς τις διαλεκτικές ποικιλίες, περιορίζοντας την αποσταθεροποίηση που παρατηρείται στην απλή πολυδιεργασιακή εκπαίδευση. Επιπλέον, η αφαίρεση της διαγλωσσικής προ-ευθυγράμμισης (Greek Pre-Alignment) οδηγεί σε εντονότερη υποβάθμιση της απόδοσης στο Μεσσηνιακό ιδίωμα, δείχνοντας ότι οι μηχανισμοί διαλεκτικής αγκύρωσης (cross-dialect anchoring) είναι κρίσιμοι σε συνθήκες περιορισμένων δεδομένων. Αντίστοιχα, η αφαίρεση της εποπτείας μετάφρασης επιφέρει σαφή αύξηση του WER και του CER σε όλα τα μοντέλα, γεγονός που καταδεικνύει ότι η πολυδιεργασιακή εποπτεία δεν λειτουργεί απλώς επικουρικά, αλλά ενισχύει ουσιαστικά τη διαλεκτική γενίκευση. Συνολικά, υποδεικνύεται ότι ο συνδυασμός curriculum learning και πολυδιεργασιακής εκπαίδευσης συνιστά μια σταθερή και αποδοτική στρατηγική προσαρμογής σε διαλεκτικά σενάρια χαμηλών πόρων, επιτυγχάνοντας σημαντική και συστηματική μείωση των σφαλμάτων αναγνώρισης

Author and committee

dc:creator, dc:contributor.*
Authors dc:creator
  • Κλήμη Αντιγόνη
  • Klimi Antigoni

Subjects

dc:subject × 2

Rights

Language dc:language
English

Identifiers

dc:identifier.*
Identifier
uoadl:5359962
OAI identifier oai:identifier
oai:lib.uoa.gr:uoadl:5359962

Chain of custody

source
Harvested from
National and Kapodistrian University of Athens
Base URL
pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

Κλήμη Αντιγόνη; Klimi Antigoni. Adapting Whisper for Modern Greek and Dialectal Speech Recognition: A Multitask and Curriculum Learning Approach. 2026. https://pergamos.lib.uoa.gr/uoa/dl/object/5359962