{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5359711"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5359711","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"Parallel Global Voices vol. 2: Multilingual corpora update and a performance analysis of modern translation frameworks on English-Greek","abstract":"Η ανάπτυξη συστημάτων Μηχανικής Μετάφρασης (ΜΜ) παραμένει θεμελιωδώς εξαρτημένη από τη διαθεσιμότητα παράλληλων δεδομένων εκπαίδευσης υψηλής ποιότητας. Η παρούσα εργασία αντιμετωπίζει την ανάγκη για σύγχρονους πόρους μεταφρασμένους από ανθρώπους, παρουσιάζοντας το Parallel Global Voices vol. 2 (PGVv2), μια σημαντική ενημέρωση και επέκταση του αρχικού συνόλου σωμάτων κειμένων Parallel Global Voices που κυκλοφόρησε το 2016. Μέσω της συστηματικής συλλογής δεδομένων από την πλατφόρμα Global Voices έως και τον Αύγουστο του 2025, η έρευνα αυτή παρέχει 8.4 εκατομμύρια στοιχίσεις προτάσεων για διάφορους συνδυασμούς μεταξύ 52 γλωσσών. Σε αντίθεση με τα σύνολα δεδομένων μαζικής συλλογής από τον ιστό, τα νέα σώματα κειμένων δίνουν προτεραιότητα στην προέλευση των πηγών και τη γλωσσική φυσικότητα, προσφέροντας μεταφράσεις παραχθείσες ρητά από ανθρώπους που αποτυπώνουν την υφολογική και διαλεκτική ποικιλομορφία, η οποία είναι απαραίτητη για την αξιολόγηση συστημάτων ΜΜ. Η δεύτερη βασική συμβολή αυτής της εργασίας είναι η εμπειρική αξιολόγηση τριών διαφορετικών αρχιτεκτονικών παραδειγμάτων στο γλωσσικό ζεύγος Αγγλικά-Ελληνικά: εξειδικευμένo συστήματα κωδικοποιητή-αποκωδικοποιητή (NLLB), Μεγάλο Γλωσσικό Μοντέλο με αποκωδικοποιητή μόνο (Llama-Krikri), και μια υβριδική προσαρμογή κωδικοποιητή-αποκωδικοποιητή βασισμένη σε προεκπαιδευμένο LLM μοντέλο με αποκωδικοποιητή μόνο (T5Gemma 2). Η ελληνική γλώσσα παρουσιάζει ιδιαίτερες προκλήσεις για τη ΜΜ λόγω της πλούσιας μορφολογίας, του μη λατινικού συστήματος γραφής και της γενετικής της απομόνωσης, η οποία περιορίζει τις τυπικές ευκαιρίες μεταφοράς μάθησης. Για την αντιμετώπιση αυτού του ζητήματος, η μελέτη εξετάζει ένα σχήμα πολυδιεργασιακής προσαρμογής παραμέτρων (multitask fine-tuning), αξιοποιώντας τη μορφοσυντακτική συγγένεια μεταξύ Ρωσικών και Ελληνικών, και την συγκρίνει με τα αποτελέσματα της εξειδικευμένης προσαρμογής παραμέτρων (domain-specific fine-tuning). Τα πειραματικά αποτελέσματα καταδεικνύουν ένα αξιοσημείωτο ανώτατο όριο απόδοσης (performance ceiling) τόσο για τις εξειδικευμένες όσο και για τις παραγωγικές αρχιτεκτονικές εντός του πεδίου του PGVv2. Στη μονογλωσσική προσαρμογή παραμέτρων το μοντέλο NLLB-600M πέτυχε στατιστική ισοτιμία με το μοντέλο Llama-Krikri-8B φτάνοντας σε βαθμολογίες BLEU 50,46 και 50,21 αντίστοιχα. Αυτό υποδηλώνει ότι οι εξειδικευμένες, μικρότερες αρχιτεκτονικές μπορούν να αντιστοιχίσουν την πιστότητα πολύ μεγαλύτερων μοντέλων LLM, προσφέροντας ταυτόχρονα δεκαπλάσια μείωση στον χρόνο απόκρισης (latency) κατά τη διαδικασία της πρόβλεψης στο επίπεδο μετάφρασης μεμονωμένων προτάσεων. Ενώ NLLB και Llama-Krikri μοντέλα μετά από την προσαρμογή παραμέτρων επέδειξαν σταθερότητα, το μοντέλο T5Gemma 2 παρουσίασε αστάθεια, απαιτώντας την εφαρμογή συγκεκριμένων περιορισμών κατά την αποκωδικοποίηση για τον περιορισμό της εκτενής παραγωγής λόγου και τη διασφάλιση της δομικής ευθυγράμμισης με τις προτάσεις της γλώσσας-στόχου. Επιπλέον, τα πολυδιεργασιακά πειράματα επιβεβαιώνουν ότι η ενσωμάτωση βοηθητικών ρωσικών στοιχίσεων βελτιώνει την απόδοση των μοντέλων, υποκαθιστώντας ενδεχομένως την έλλειψη δεδομένων στο ζεύγος-στόχο μέσω της ενδυνάμωσης κοινών γραμματικών κατηγοριών. Ωστόσο, απαιτείται μελλοντική έρευνα για την ποιοτική αξιολόγηση των αποτελεσμάτων και για να επιβεβαιωθεί ότι οι βελτιώσεις αυτές αποδίδονται ειδικά στη μορφοσυντακτική συγγένεια της ρωσικής γλώσσας και όχι απλώς στη γενικότερη αύξηση του όγκου των δεδομένων εκπαίδευσης. Τα ευρήματα υπογραμμίζουν την αποδοτικότητα παραμέτρων των μοντέλων που είναι προσανατολισμένα σε συγκεκριμένες εργασίες, αποδεικνύοντας ότι η στρατηγική διαγλωσσική μεταφορά μπορεί να μετριάσει τις προκλήσεις της έλλειψης δεδομένων, ενώ οι μικρότερες αρχιτεκτονικές μετά απο την προσαρμογή παραμέτρων μπορούν να ανταγωνιστούν αποτελεσματικά τα πολύ μεγαλύτερα παραγωγικά συστήματα σε εφαρμογές εξειδικευμένου πεδίου.","abstract_html":"Η ανάπτυξη συστημάτων Μηχανικής Μετάφρασης (ΜΜ) παραμένει θεμελιωδώς εξαρτημένη από τη διαθεσιμότητα παράλληλων δεδομένων εκπαίδευσης υψηλής ποιότητας. Η παρούσα εργασία αντιμετωπίζει την ανάγκη για σύγχρονους πόρους μεταφρασμένους από ανθρώπους, παρουσιάζοντας το Parallel Global Voices vol. 2 (PGVv2), μια σημαντική ενημέρωση και επέκταση του αρχικού συνόλου σωμάτων κειμένων Parallel Global Voices που κυκλοφόρησε το 2016. Μέσω της συστηματικής συλλογής δεδομένων από την πλατφόρμα Global Voices έως και τον Αύγουστο του 2025, η έρευνα αυτή παρέχει 8.4 εκατομμύρια στοιχίσεις προτάσεων για διάφορους συνδυασμούς μεταξύ 52 γλωσσών. Σε αντίθεση με τα σύνολα δεδομένων μαζικής συλλογής από τον ιστό, τα νέα σώματα κειμένων δίνουν προτεραιότητα στην προέλευση των πηγών και τη γλωσσική φυσικότητα, προσφέροντας μεταφράσεις παραχθείσες ρητά από ανθρώπους που αποτυπώνουν την υφολογική και διαλεκτική ποικιλομορφία, η οποία είναι απαραίτητη για την αξιολόγηση συστημάτων ΜΜ. Η δεύτερη βασική συμβολή αυτής της εργασίας είναι η εμπειρική αξιολόγηση τριών διαφορετικών αρχιτεκτονικών παραδειγμάτων στο γλωσσικό ζεύγος Αγγλικά-Ελληνικά: εξειδικευμένo συστήματα κωδικοποιητή-αποκωδικοποιητή (NLLB), Μεγάλο Γλωσσικό Μοντέλο με αποκωδικοποιητή μόνο (Llama-Krikri), και μια υβριδική προσαρμογή κωδικοποιητή-αποκωδικοποιητή βασισμένη σε προεκπαιδευμένο LLM μοντέλο με αποκωδικοποιητή μόνο (T5Gemma 2). Η ελληνική γλώσσα παρουσιάζει ιδιαίτερες προκλήσεις για τη ΜΜ λόγω της πλούσιας μορφολογίας, του μη λατινικού συστήματος γραφής και της γενετικής της απομόνωσης, η οποία περιορίζει τις τυπικές ευκαιρίες μεταφοράς μάθησης. Για την αντιμετώπιση αυτού του ζητήματος, η μελέτη εξετάζει ένα σχήμα πολυδιεργασιακής προσαρμογής παραμέτρων (multitask fine-tuning), αξιοποιώντας τη μορφοσυντακτική συγγένεια μεταξύ Ρωσικών και Ελληνικών, και την συγκρίνει με τα αποτελέσματα της εξειδικευμένης προσαρμογής παραμέτρων (domain-specific fine-tuning). Τα πειραματικά αποτελέσματα καταδεικνύουν ένα αξιοσημείωτο ανώτατο όριο απόδοσης (performance ceiling) τόσο για τις εξειδικευμένες όσο και για τις παραγωγικές αρχιτεκτονικές εντός του πεδίου του PGVv2. Στη μονογλωσσική προσαρμογή παραμέτρων το μοντέλο NLLB-600M πέτυχε στατιστική ισοτιμία με το μοντέλο Llama-Krikri-8B φτάνοντας σε βαθμολογίες BLEU 50,46 και 50,21 αντίστοιχα. Αυτό υποδηλώνει ότι οι εξειδικευμένες, μικρότερες αρχιτεκτονικές μπορούν να αντιστοιχίσουν την πιστότητα πολύ μεγαλύτερων μοντέλων LLM, προσφέροντας ταυτόχρονα δεκαπλάσια μείωση στον χρόνο απόκρισης (latency) κατά τη διαδικασία της πρόβλεψης στο επίπεδο μετάφρασης μεμονωμένων προτάσεων. Ενώ NLLB και Llama-Krikri μοντέλα μετά από την προσαρμογή παραμέτρων επέδειξαν σταθερότητα, το μοντέλο T5Gemma 2 παρουσίασε αστάθεια, απαιτώντας την εφαρμογή συγκεκριμένων περιορισμών κατά την αποκωδικοποίηση για τον περιορισμό της εκτενής παραγωγής λόγου και τη διασφάλιση της δομικής ευθυγράμμισης με τις προτάσεις της γλώσσας-στόχου. Επιπλέον, τα πολυδιεργασιακά πειράματα επιβεβαιώνουν ότι η ενσωμάτωση βοηθητικών ρωσικών στοιχίσεων βελτιώνει την απόδοση των μοντέλων, υποκαθιστώντας ενδεχομένως την έλλειψη δεδομένων στο ζεύγος-στόχο μέσω της ενδυνάμωσης κοινών γραμματικών κατηγοριών. Ωστόσο, απαιτείται μελλοντική έρευνα για την ποιοτική αξιολόγηση των αποτελεσμάτων και για να επιβεβαιωθεί ότι οι βελτιώσεις αυτές αποδίδονται ειδικά στη μορφοσυντακτική συγγένεια της ρωσικής γλώσσας και όχι απλώς στη γενικότερη αύξηση του όγκου των δεδομένων εκπαίδευσης. Τα ευρήματα υπογραμμίζουν την αποδοτικότητα παραμέτρων των μοντέλων που είναι προσανατολισμένα σε συγκεκριμένες εργασίες, αποδεικνύοντας ότι η στρατηγική διαγλωσσική μεταφορά μπορεί να μετριάσει τις προκλήσεις της έλλειψης δεδομένων, ενώ οι μικρότερες αρχιτεκτονικές μετά απο την προσαρμογή παραμέτρων μπορούν να ανταγωνιστούν αποτελεσματικά τα πολύ μεγαλύτερα παραγωγικά συστήματα σε εφαρμογές εξειδικευμένου πεδίου.","abstract_has_math":false,"creators":["Alafuzova Elena"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-07-24T01:01:51Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["English"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5359711"],"render_values":[{"text":"uoadl:5359711","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5359711","outbound_label":"Repository record","outbound_source":"dc:identifier"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Alafuzova Elena"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["English"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5359711","https://pergamos.lib.uoa.gr/uoa/dl/object/5359711"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Η ανάπτυξη συστημάτων Μηχανικής Μετάφρασης (ΜΜ) παραμένει θεμελιωδώς εξαρτημένη από τη διαθεσιμότητα παράλληλων δεδομένων εκπαίδευσης υψηλής ποιότητας. Η παρούσα εργασία αντιμετωπίζει την ανάγκη για σύγχρονους πόρους μεταφρασμένους από ανθρώπους, παρουσιάζοντας το Parallel Global Voices vol. 2 (PGVv2), μια σημαντική ενημέρωση και επέκταση του αρχικού συνόλου σωμάτων κειμένων Parallel Global Voices που κυκλοφόρησε το 2016. Μέσω της συστηματικής συλλογής δεδομένων από την πλατφόρμα Global Voices έως και τον Αύγουστο του 2025, η έρευνα αυτή παρέχει 8.4 εκατομμύρια στοιχίσεις προτάσεων για διάφορους συνδυασμούς μεταξύ 52 γλωσσών. Σε αντίθεση με τα σύνολα δεδομένων μαζικής συλλογής από τον ιστό, τα νέα σώματα κειμένων δίνουν προτεραιότητα στην προέλευση των πηγών και τη γλωσσική φυσικότητα, προσφέροντας μεταφράσεις παραχθείσες ρητά από ανθρώπους που αποτυπώνουν την υφολογική και διαλεκτική ποικιλομορφία, η οποία είναι απαραίτητη για την αξιολόγηση συστημάτων ΜΜ. Η δεύτερη βασική συμβολή αυτής της εργασίας είναι η εμπειρική αξιολόγηση τριών διαφορετικών αρχιτεκτονικών παραδειγμάτων στο γλωσσικό ζεύγος Αγγλικά-Ελληνικά: εξειδικευμένo συστήματα κωδικοποιητή-αποκωδικοποιητή (NLLB), Μεγάλο Γλωσσικό Μοντέλο με αποκωδικοποιητή μόνο (Llama-Krikri), και μια υβριδική προσαρμογή κωδικοποιητή-αποκωδικοποιητή βασισμένη σε προεκπαιδευμένο LLM μοντέλο με αποκωδικοποιητή μόνο (T5Gemma 2). Η ελληνική γλώσσα παρουσιάζει ιδιαίτερες προκλήσεις για τη ΜΜ λόγω της πλούσιας μορφολογίας, του μη λατινικού συστήματος γραφής και της γενετικής της απομόνωσης, η οποία περιορίζει τις τυπικές ευκαιρίες μεταφοράς μάθησης. Για την αντιμετώπιση αυτού του ζητήματος, η μελέτη εξετάζει ένα σχήμα πολυδιεργασιακής προσαρμογής παραμέτρων (multitask fine-tuning), αξιοποιώντας τη μορφοσυντακτική συγγένεια μεταξύ Ρωσικών και Ελληνικών, και την συγκρίνει με τα αποτελέσματα της εξειδικευμένης προσαρμογής παραμέτρων (domain-specific fine-tuning). Τα πειραματικά αποτελέσματα καταδεικνύουν ένα αξιοσημείωτο ανώτατο όριο απόδοσης (performance ceiling) τόσο για τις εξειδικευμένες όσο και για τις παραγωγικές αρχιτεκτονικές εντός του πεδίου του PGVv2. Στη μονογλωσσική προσαρμογή παραμέτρων το μοντέλο NLLB-600M πέτυχε στατιστική ισοτιμία με το μοντέλο Llama-Krikri-8B φτάνοντας σε βαθμολογίες BLEU 50,46 και 50,21 αντίστοιχα. Αυτό υποδηλώνει ότι οι εξειδικευμένες, μικρότερες αρχιτεκτονικές μπορούν να αντιστοιχίσουν την πιστότητα πολύ μεγαλύτερων μοντέλων LLM, προσφέροντας ταυτόχρονα δεκαπλάσια μείωση στον χρόνο απόκρισης (latency) κατά τη διαδικασία της πρόβλεψης στο επίπεδο μετάφρασης μεμονωμένων προτάσεων. Ενώ NLLB και Llama-Krikri μοντέλα μετά από την προσαρμογή παραμέτρων επέδειξαν σταθερότητα, το μοντέλο T5Gemma 2 παρουσίασε αστάθεια, απαιτώντας την εφαρμογή συγκεκριμένων περιορισμών κατά την αποκωδικοποίηση για τον περιορισμό της εκτενής παραγωγής λόγου και τη διασφάλιση της δομικής ευθυγράμμισης με τις προτάσεις της γλώσσας-στόχου. Επιπλέον, τα πολυδιεργασιακά πειράματα επιβεβαιώνουν ότι η ενσωμάτωση βοηθητικών ρωσικών στοιχίσεων βελτιώνει την απόδοση των μοντέλων, υποκαθιστώντας ενδεχομένως την έλλειψη δεδομένων στο ζεύγος-στόχο μέσω της ενδυνάμωσης κοινών γραμματικών κατηγοριών. Ωστόσο, απαιτείται μελλοντική έρευνα για την ποιοτική αξιολόγηση των αποτελεσμάτων και για να επιβεβαιωθεί ότι οι βελτιώσεις αυτές αποδίδονται ειδικά στη μορφοσυντακτική συγγένεια της ρωσικής γλώσσας και όχι απλώς στη γενικότερη αύξηση του όγκου των δεδομένων εκπαίδευσης. Τα ευρήματα υπογραμμίζουν την αποδοτικότητα παραμέτρων των μοντέλων που είναι προσανατολισμένα σε συγκεκριμένες εργασίες, αποδεικνύοντας ότι η στρατηγική διαγλωσσική μεταφορά μπορεί να μετριάσει τις προκλήσεις της έλλειψης δεδομένων, ενώ οι μικρότερες αρχιτεκτονικές μετά απο την προσαρμογή παραμέτρων μπορούν να ανταγωνιστούν αποτελεσματικά τα πολύ μεγαλύτερα παραγωγικά συστήματα σε εφαρμογές εξειδικευμένου πεδίου.","The development of Machine Translation (MT) systems remains fundamentally dependent on the availability of high-quality parallel training data. This thesis addresses the need for contemporary, human-authored resources by presenting Parallel Global Voices vol. 2 (PGVv2), a major update and expansion of the original Parallel Global Voices set of corpora released in 2016. By systematically crawling the Global Voices platform through August 2025, this research provides 8.4 million sentence alignments across combinations of 52 languages. Unlike massive web-crawled datasets, new corpora prioritize source provenance and linguistic naturalness, offering explicitly human-produced translations that capture stylistic and dialectal diversity essential for MT evaluation. The second contribution of this work is an empirical evaluation of three distinct architectural paradigms on the English-Greek translation pair: specialized encoder-decoder system (NLLB), decoder-only Large Language Model (Llama-Krikri), and a hybrid encoder-decoder adaptation of pretrained decoder-only LLM (T5Gemma 2). Greek presents unique challenges for MT due to its rich morphology, non-Latin script, and genetic isolation, which limits standard transfer learning opportunities. To address this, the study investigates a multitask fine-tuning regime leveraging the morphosyntactic affinity between Russian and Greek, comparing its efficacy against the results obtained through traditional domain-specific fine-tuning. Experimental results demonstrate a notable performance ceiling for both specialized and generative architectures within the PGVv2 domain. In monolingual fine-tuning, the 600M-parameter NLLB model achieved statistical parity with the 8B-parameter Llama-Krikri, reaching BLEU scores of 50.46 and 50.21, respectively. This suggests that specialized, smaller architectures can match the fidelity of much larger LLMs while offering a ten-fold reduction in inference latency at the sentence level. While fine-tuned NLLB and Llama-Krikri models demonstrated stability, the fine-tuned T5Gemma 2 exhibited fragility, requiring specific decoding constraints to mitigate excessive verbosity and ensure structural alignment with the target segments. Furthermore, multitask experiments confirm that incorporating auxiliary Russian tasks enhances models’ performance, potentially substituting for a lack of target-pair data by reinforcing shared grammatical concepts. However, future work is required to conduct human evaluation of the output and to verify that these improvements are specifically attributable to the morphosyntactic properties of the Russian language rather than a generalized effect of increased training volume. The findings highlight parameter efficiency of task-oriented models, demonstrating that strategic cross-lingual transfer can mitigate the challenges of data scarcity while optimized smaller architectures can effectively compete with much larger generative systems in domain-specific deployment."]},{"key":"dc:title","label":"Title","values":["Parallel Global Voices vol. 2: Multilingual corpora update and a performance analysis of modern translation frameworks on English-Greek"]}]}],"canonical_facts":{"dc:creator":["Alafuzova Elena"],"dc:date":["2026"],"dc:description":["Η ανάπτυξη συστημάτων Μηχανικής Μετάφρασης (ΜΜ) παραμένει θεμελιωδώς εξαρτημένη από τη διαθεσιμότητα παράλληλων δεδομένων εκπαίδευσης υψηλής ποιότητας. Η παρούσα εργασία αντιμετωπίζει την ανάγκη για σύγχρονους πόρους μεταφρασμένους από ανθρώπους, παρουσιάζοντας το Parallel Global Voices vol. 2 (PGVv2), μια σημαντική ενημέρωση και επέκταση του αρχικού συνόλου σωμάτων κειμένων Parallel Global Voices που κυκλοφόρησε το 2016. Μέσω της συστηματικής συλλογής δεδομένων από την πλατφόρμα Global Voices έως και τον Αύγουστο του 2025, η έρευνα αυτή παρέχει 8.4 εκατομμύρια στοιχίσεις προτάσεων για διάφορους συνδυασμούς μεταξύ 52 γλωσσών. Σε αντίθεση με τα σύνολα δεδομένων μαζικής συλλογής από τον ιστό, τα νέα σώματα κειμένων δίνουν προτεραιότητα στην προέλευση των πηγών και τη γλωσσική φυσικότητα, προσφέροντας μεταφράσεις παραχθείσες ρητά από ανθρώπους που αποτυπώνουν την υφολογική και διαλεκτική ποικιλομορφία, η οποία είναι απαραίτητη για την αξιολόγηση συστημάτων ΜΜ. Η δεύτερη βασική συμβολή αυτής της εργασίας είναι η εμπειρική αξιολόγηση τριών διαφορετικών αρχιτεκτονικών παραδειγμάτων στο γλωσσικό ζεύγος Αγγλικά-Ελληνικά: εξειδικευμένo συστήματα κωδικοποιητή-αποκωδικοποιητή (NLLB), Μεγάλο Γλωσσικό Μοντέλο με αποκωδικοποιητή μόνο (Llama-Krikri), και μια υβριδική προσαρμογή κωδικοποιητή-αποκωδικοποιητή βασισμένη σε προεκπαιδευμένο LLM μοντέλο με αποκωδικοποιητή μόνο (T5Gemma 2). Η ελληνική γλώσσα παρουσιάζει ιδιαίτερες προκλήσεις για τη ΜΜ λόγω της πλούσιας μορφολογίας, του μη λατινικού συστήματος γραφής και της γενετικής της απομόνωσης, η οποία περιορίζει τις τυπικές ευκαιρίες μεταφοράς μάθησης. Για την αντιμετώπιση αυτού του ζητήματος, η μελέτη εξετάζει ένα σχήμα πολυδιεργασιακής προσαρμογής παραμέτρων (multitask fine-tuning), αξιοποιώντας τη μορφοσυντακτική συγγένεια μεταξύ Ρωσικών και Ελληνικών, και την συγκρίνει με τα αποτελέσματα της εξειδικευμένης προσαρμογής παραμέτρων (domain-specific fine-tuning). Τα πειραματικά αποτελέσματα καταδεικνύουν ένα αξιοσημείωτο ανώτατο όριο απόδοσης (performance ceiling) τόσο για τις εξειδικευμένες όσο και για τις παραγωγικές αρχιτεκτονικές εντός του πεδίου του PGVv2. Στη μονογλωσσική προσαρμογή παραμέτρων το μοντέλο NLLB-600M πέτυχε στατιστική ισοτιμία με το μοντέλο Llama-Krikri-8B φτάνοντας σε βαθμολογίες BLEU 50,46 και 50,21 αντίστοιχα. Αυτό υποδηλώνει ότι οι εξειδικευμένες, μικρότερες αρχιτεκτονικές μπορούν να αντιστοιχίσουν την πιστότητα πολύ μεγαλύτερων μοντέλων LLM, προσφέροντας ταυτόχρονα δεκαπλάσια μείωση στον χρόνο απόκρισης (latency) κατά τη διαδικασία της πρόβλεψης στο επίπεδο μετάφρασης μεμονωμένων προτάσεων. Ενώ NLLB και Llama-Krikri μοντέλα μετά από την προσαρμογή παραμέτρων επέδειξαν σταθερότητα, το μοντέλο T5Gemma 2 παρουσίασε αστάθεια, απαιτώντας την εφαρμογή συγκεκριμένων περιορισμών κατά την αποκωδικοποίηση για τον περιορισμό της εκτενής παραγωγής λόγου και τη διασφάλιση της δομικής ευθυγράμμισης με τις προτάσεις της γλώσσας-στόχου. Επιπλέον, τα πολυδιεργασιακά πειράματα επιβεβαιώνουν ότι η ενσωμάτωση βοηθητικών ρωσικών στοιχίσεων βελτιώνει την απόδοση των μοντέλων, υποκαθιστώντας ενδεχομένως την έλλειψη δεδομένων στο ζεύγος-στόχο μέσω της ενδυνάμωσης κοινών γραμματικών κατηγοριών. Ωστόσο, απαιτείται μελλοντική έρευνα για την ποιοτική αξιολόγηση των αποτελεσμάτων και για να επιβεβαιωθεί ότι οι βελτιώσεις αυτές αποδίδονται ειδικά στη μορφοσυντακτική συγγένεια της ρωσικής γλώσσας και όχι απλώς στη γενικότερη αύξηση του όγκου των δεδομένων εκπαίδευσης. Τα ευρήματα υπογραμμίζουν την αποδοτικότητα παραμέτρων των μοντέλων που είναι προσανατολισμένα σε συγκεκριμένες εργασίες, αποδεικνύοντας ότι η στρατηγική διαγλωσσική μεταφορά μπορεί να μετριάσει τις προκλήσεις της έλλειψης δεδομένων, ενώ οι μικρότερες αρχιτεκτονικές μετά απο την προσαρμογή παραμέτρων μπορούν να ανταγωνιστούν αποτελεσματικά τα πολύ μεγαλύτερα παραγωγικά συστήματα σε εφαρμογές εξειδικευμένου πεδίου.","The development of Machine Translation (MT) systems remains fundamentally dependent on the availability of high-quality parallel training data. This thesis addresses the need for contemporary, human-authored resources by presenting Parallel Global Voices vol. 2 (PGVv2), a major update and expansion of the original Parallel Global Voices set of corpora released in 2016. By systematically crawling the Global Voices platform through August 2025, this research provides 8.4 million sentence alignments across combinations of 52 languages. Unlike massive web-crawled datasets, new corpora prioritize source provenance and linguistic naturalness, offering explicitly human-produced translations that capture stylistic and dialectal diversity essential for MT evaluation. The second contribution of this work is an empirical evaluation of three distinct architectural paradigms on the English-Greek translation pair: specialized encoder-decoder system (NLLB), decoder-only Large Language Model (Llama-Krikri), and a hybrid encoder-decoder adaptation of pretrained decoder-only LLM (T5Gemma 2). Greek presents unique challenges for MT due to its rich morphology, non-Latin script, and genetic isolation, which limits standard transfer learning opportunities. To address this, the study investigates a multitask fine-tuning regime leveraging the morphosyntactic affinity between Russian and Greek, comparing its efficacy against the results obtained through traditional domain-specific fine-tuning. Experimental results demonstrate a notable performance ceiling for both specialized and generative architectures within the PGVv2 domain. In monolingual fine-tuning, the 600M-parameter NLLB model achieved statistical parity with the 8B-parameter Llama-Krikri, reaching BLEU scores of 50.46 and 50.21, respectively. This suggests that specialized, smaller architectures can match the fidelity of much larger LLMs while offering a ten-fold reduction in inference latency at the sentence level. While fine-tuned NLLB and Llama-Krikri models demonstrated stability, the fine-tuned T5Gemma 2 exhibited fragility, requiring specific decoding constraints to mitigate excessive verbosity and ensure structural alignment with the target segments. Furthermore, multitask experiments confirm that incorporating auxiliary Russian tasks enhances models’ performance, potentially substituting for a lack of target-pair data by reinforcing shared grammatical concepts. However, future work is required to conduct human evaluation of the output and to verify that these improvements are specifically attributable to the morphosyntactic properties of the Russian language rather than a generalized effect of increased training volume. The findings highlight parameter efficiency of task-oriented models, demonstrating that strategic cross-lingual transfer can mitigate the challenges of data scarcity while optimized smaller architectures can effectively compete with much larger generative systems in domain-specific deployment."],"dc:identifier":["uoadl:5359711","https://pergamos.lib.uoa.gr/uoa/dl/object/5359711"],"dc:language":["English"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["Parallel Global Voices vol. 2: Multilingual corpora update and a performance analysis of modern translation frameworks on English-Greek"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-07-24T01:01:51Z"}