{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5410582"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5410582","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"From Form to Meaning: Interlingual Sense-Alignment of Offensive Language with LLMs","abstract":"Η παρούσα διπλωματική εργασία εκκινεί από τη διαπίστωση ότι η μετάφραση προσβλητικών όρων δυσχεραίνεται από τη μεγάλη ιδιωματικότητα της προσβλητικής γλώσσας. Με γνώμονα αυτό το ζητούμενο, η εργασία διερευνά την ευθυγράμμιση προσβλητικών λεξικών σε επίπεδο σημασίας με τη χρήση μεγάλων γλωσσικών μοντέλων, καθώς τέτοια λεξικά δεν είναι ακόμη διαθέσιμα. Επειδή μία από τις γλώσσες που χρησιμοποιούνται στην ευθυγράμμιση, και συγκεκριμένα η Νέα Ελληνική, δεν διαθέτει προσβλητικά λεξικά με σημασιακές περιγραφές, η εργασία παρουσιάζει μια μεθοδολογία ανάπτυξης σημασιακά εμπλουτισμένων προσβλητικών λεξικών με μεγάλα γλωσσικά μοντέλα. Έτσι, αρχικά αναπτύσσεται ένα νέο λεξικό προσβλητικής γλώσσας για τη Νέα Ελληνική από 737 λήμματα του HurtLex-EL μέσω μιας λεξικογραφικής ροής εργασιών υποβοηθούμενης από γλωσσικά μοντέλα, ακολουθούμενης από μη αυτόματη μετα-επιμέλεια και αξιολόγηση. Ο τελικός πόρος περιέχει 1.109 εγγραφές σε επίπεδο σημασίας, με δομημένους ορισμούς, κατηγορίες στόχων και αυθεντικά παραδείγματα χρήσης. Δεύτερον, αξιοποιείται μια μεθοδολογία «γλωσσικού μοντέλου ως κριτή» (LLM-as-a-judge) για την ευθυγράμμιση προσβλητικών σημασιών μεταξύ της Αραβικής, της Βουλγαρικής, της Νέας Ελληνικής, της Γαλλικής και της Ιταλικής, μέσω τριάδων λήμματος–ορισμού–παραδείγματος στις πρωτότυπες γλώσσες. Σε περίπου 2,87 εκατομμύρια συγκρίσεις ανά ζεύγη, η ροή εργασιών παράγει 31 αυστηρές καθολικές σημασιακές κατηγορίες και αποκαλύπτει τόσο επαναλαμβανόμενα διαγλωσσικά μοτίβα όσο και σημαντικά όρια ως προς την ισοδυναμία. Οι κύριες προκλήσεις περιλαμβάνουν αναντιστοιχίες ως προς τη σφοδρότητα, διαφορές στη σημασιακή λεπτομέρεια (granularity), κενά λεξικοποίησης και πολιτισμικά προσδιορισμένες σημασίες. Συνολικά, η εργασία καταδεικνύει ότι τα μεγάλα γλωσσικά μοντέλα μπορούν να υποστηρίξουν την κατασκευή λεξικών με επίγνωση της σημασίας, καθώς και τη διαγλωσσική ευθυγράμμιση της προσβλητικής γλώσσας, υπό την προϋπόθεση ότι τα αποτελέσματά τους πλαισιώνονται από σαφή κριτήρια αξιολόγησης (rubrics), ανθρώπινη επιμέλεια και συστηματική αξιολόγηση.","abstract_html":"Η παρούσα διπλωματική εργασία εκκινεί από τη διαπίστωση ότι η μετάφραση προσβλητικών όρων δυσχεραίνεται από τη μεγάλη ιδιωματικότητα της προσβλητικής γλώσσας. Με γνώμονα αυτό το ζητούμενο, η εργασία διερευνά την ευθυγράμμιση προσβλητικών λεξικών σε επίπεδο σημασίας με τη χρήση μεγάλων γλωσσικών μοντέλων, καθώς τέτοια λεξικά δεν είναι ακόμη διαθέσιμα. Επειδή μία από τις γλώσσες που χρησιμοποιούνται στην ευθυγράμμιση, και συγκεκριμένα η Νέα Ελληνική, δεν διαθέτει προσβλητικά λεξικά με σημασιακές περιγραφές, η εργασία παρουσιάζει μια μεθοδολογία ανάπτυξης σημασιακά εμπλουτισμένων προσβλητικών λεξικών με μεγάλα γλωσσικά μοντέλα. Έτσι, αρχικά αναπτύσσεται ένα νέο λεξικό προσβλητικής γλώσσας για τη Νέα Ελληνική από 737 λήμματα του HurtLex-EL μέσω μιας λεξικογραφικής ροής εργασιών υποβοηθούμενης από γλωσσικά μοντέλα, ακολουθούμενης από μη αυτόματη μετα-επιμέλεια και αξιολόγηση. Ο τελικός πόρος περιέχει 1.109 εγγραφές σε επίπεδο σημασίας, με δομημένους ορισμούς, κατηγορίες στόχων και αυθεντικά παραδείγματα χρήσης. Δεύτερον, αξιοποιείται μια μεθοδολογία «γλωσσικού μοντέλου ως κριτή» (LLM-as-a-judge) για την ευθυγράμμιση προσβλητικών σημασιών μεταξύ της Αραβικής, της Βουλγαρικής, της Νέας Ελληνικής, της Γαλλικής και της Ιταλικής, μέσω τριάδων λήμματος–ορισμού–παραδείγματος στις πρωτότυπες γλώσσες. Σε περίπου 2,87 εκατομμύρια συγκρίσεις ανά ζεύγη, η ροή εργασιών παράγει 31 αυστηρές καθολικές σημασιακές κατηγορίες και αποκαλύπτει τόσο επαναλαμβανόμενα διαγλωσσικά μοτίβα όσο και σημαντικά όρια ως προς την ισοδυναμία. Οι κύριες προκλήσεις περιλαμβάνουν αναντιστοιχίες ως προς τη σφοδρότητα, διαφορές στη σημασιακή λεπτομέρεια (granularity), κενά λεξικοποίησης και πολιτισμικά προσδιορισμένες σημασίες. Συνολικά, η εργασία καταδεικνύει ότι τα μεγάλα γλωσσικά μοντέλα μπορούν να υποστηρίξουν την κατασκευή λεξικών με επίγνωση της σημασίας, καθώς και τη διαγλωσσική ευθυγράμμιση της προσβλητικής γλώσσας, υπό την προϋπόθεση ότι τα αποτελέσματά τους πλαισιώνονται από σαφή κριτήρια αξιολόγησης (rubrics), ανθρώπινη επιμέλεια και συστηματική αξιολόγηση.","abstract_has_math":false,"creators":["Ρουσσοπούλου Μαρία-Αλεξάνδρα","Roussopoulou Maria-Alexandra"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-07-24T01:02:36Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["English"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5410582"],"render_values":[{"text":"uoadl:5410582","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5410582","outbound_label":"Repository record","outbound_source":"dc:identifier"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Ρουσσοπούλου Μαρία-Αλεξάνδρα","Roussopoulou Maria-Alexandra"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["English"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5410582","https://pergamos.lib.uoa.gr/uoa/dl/object/5410582"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Η παρούσα διπλωματική εργασία εκκινεί από τη διαπίστωση ότι η μετάφραση προσβλητικών όρων δυσχεραίνεται από τη μεγάλη ιδιωματικότητα της προσβλητικής γλώσσας. Με γνώμονα αυτό το ζητούμενο, η εργασία διερευνά την ευθυγράμμιση προσβλητικών λεξικών σε επίπεδο σημασίας με τη χρήση μεγάλων γλωσσικών μοντέλων, καθώς τέτοια λεξικά δεν είναι ακόμη διαθέσιμα. Επειδή μία από τις γλώσσες που χρησιμοποιούνται στην ευθυγράμμιση, και συγκεκριμένα η Νέα Ελληνική, δεν διαθέτει προσβλητικά λεξικά με σημασιακές περιγραφές, η εργασία παρουσιάζει μια μεθοδολογία ανάπτυξης σημασιακά εμπλουτισμένων προσβλητικών λεξικών με μεγάλα γλωσσικά μοντέλα. Έτσι, αρχικά αναπτύσσεται ένα νέο λεξικό προσβλητικής γλώσσας για τη Νέα Ελληνική από 737 λήμματα του HurtLex-EL μέσω μιας λεξικογραφικής ροής εργασιών υποβοηθούμενης από γλωσσικά μοντέλα, ακολουθούμενης από μη αυτόματη μετα-επιμέλεια και αξιολόγηση. Ο τελικός πόρος περιέχει 1.109 εγγραφές σε επίπεδο σημασίας, με δομημένους ορισμούς, κατηγορίες στόχων και αυθεντικά παραδείγματα χρήσης. Δεύτερον, αξιοποιείται μια μεθοδολογία «γλωσσικού μοντέλου ως κριτή» (LLM-as-a-judge) για την ευθυγράμμιση προσβλητικών σημασιών μεταξύ της Αραβικής, της Βουλγαρικής, της Νέας Ελληνικής, της Γαλλικής και της Ιταλικής, μέσω τριάδων λήμματος–ορισμού–παραδείγματος στις πρωτότυπες γλώσσες. Σε περίπου 2,87 εκατομμύρια συγκρίσεις ανά ζεύγη, η ροή εργασιών παράγει 31 αυστηρές καθολικές σημασιακές κατηγορίες και αποκαλύπτει τόσο επαναλαμβανόμενα διαγλωσσικά μοτίβα όσο και σημαντικά όρια ως προς την ισοδυναμία. Οι κύριες προκλήσεις περιλαμβάνουν αναντιστοιχίες ως προς τη σφοδρότητα, διαφορές στη σημασιακή λεπτομέρεια (granularity), κενά λεξικοποίησης και πολιτισμικά προσδιορισμένες σημασίες. Συνολικά, η εργασία καταδεικνύει ότι τα μεγάλα γλωσσικά μοντέλα μπορούν να υποστηρίξουν την κατασκευή λεξικών με επίγνωση της σημασίας, καθώς και τη διαγλωσσική ευθυγράμμιση της προσβλητικής γλώσσας, υπό την προϋπόθεση ότι τα αποτελέσματά τους πλαισιώνονται από σαφή κριτήρια αξιολόγησης (rubrics), ανθρώπινη επιμέλεια και συστηματική αξιολόγηση.","This thesis starts from the observation that the translation of offensive terms is impeded by the considerable idiomaticity of offensive language. With this desidaratum in mind, the thesis investigates the alignment of offensive lexica at sense level with LLMs since such lexica are not available as yet. Because one of the languages used in the alignment, namely Modern Greek, has no offensive lexica with sense descriptions, the thesis presents a methodology of developing sense enriched offensive lexica with LLMs. So, first a new Modern Greek offensive lexicon is developed from 737 HurtLex-EL lemmas through an LLM-assisted lexicographic pipeline, followed by manual post-editing and evaluation. The final resource contains 1,109 sense-level entries with structured definitions, target categories, and authentic usage examples. Second, an LLM-as-a-judge methodology is used to align offensive senses across Arabic, Bulgarian, Modern Greek, French, and Italian through lemma–definition–example triples in the original languages. Across approximately 2.87 million pairwise comparisons, the pipeline produces 31 strict global sense categories and reveals both recurrent cross-lingual patterns and important limits to equivalence. The main challenges include severity mismatches, sense granularity differences, lexicalisation gaps, and culture-bound meanings. Overall, the thesis shows that LLMs can support sense-aware lexicon construction and interlingual offensive-language alignment, provided that their outputs are constrained by clear rubrics, human curation, and systematic evaluation."]},{"key":"dc:title","label":"Title","values":["From Form to Meaning: Interlingual Sense-Alignment of Offensive Language with LLMs"]}]}],"canonical_facts":{"dc:creator":["Ρουσσοπούλου Μαρία-Αλεξάνδρα","Roussopoulou Maria-Alexandra"],"dc:date":["2026"],"dc:description":["Η παρούσα διπλωματική εργασία εκκινεί από τη διαπίστωση ότι η μετάφραση προσβλητικών όρων δυσχεραίνεται από τη μεγάλη ιδιωματικότητα της προσβλητικής γλώσσας. Με γνώμονα αυτό το ζητούμενο, η εργασία διερευνά την ευθυγράμμιση προσβλητικών λεξικών σε επίπεδο σημασίας με τη χρήση μεγάλων γλωσσικών μοντέλων, καθώς τέτοια λεξικά δεν είναι ακόμη διαθέσιμα. Επειδή μία από τις γλώσσες που χρησιμοποιούνται στην ευθυγράμμιση, και συγκεκριμένα η Νέα Ελληνική, δεν διαθέτει προσβλητικά λεξικά με σημασιακές περιγραφές, η εργασία παρουσιάζει μια μεθοδολογία ανάπτυξης σημασιακά εμπλουτισμένων προσβλητικών λεξικών με μεγάλα γλωσσικά μοντέλα. Έτσι, αρχικά αναπτύσσεται ένα νέο λεξικό προσβλητικής γλώσσας για τη Νέα Ελληνική από 737 λήμματα του HurtLex-EL μέσω μιας λεξικογραφικής ροής εργασιών υποβοηθούμενης από γλωσσικά μοντέλα, ακολουθούμενης από μη αυτόματη μετα-επιμέλεια και αξιολόγηση. Ο τελικός πόρος περιέχει 1.109 εγγραφές σε επίπεδο σημασίας, με δομημένους ορισμούς, κατηγορίες στόχων και αυθεντικά παραδείγματα χρήσης. Δεύτερον, αξιοποιείται μια μεθοδολογία «γλωσσικού μοντέλου ως κριτή» (LLM-as-a-judge) για την ευθυγράμμιση προσβλητικών σημασιών μεταξύ της Αραβικής, της Βουλγαρικής, της Νέας Ελληνικής, της Γαλλικής και της Ιταλικής, μέσω τριάδων λήμματος–ορισμού–παραδείγματος στις πρωτότυπες γλώσσες. Σε περίπου 2,87 εκατομμύρια συγκρίσεις ανά ζεύγη, η ροή εργασιών παράγει 31 αυστηρές καθολικές σημασιακές κατηγορίες και αποκαλύπτει τόσο επαναλαμβανόμενα διαγλωσσικά μοτίβα όσο και σημαντικά όρια ως προς την ισοδυναμία. Οι κύριες προκλήσεις περιλαμβάνουν αναντιστοιχίες ως προς τη σφοδρότητα, διαφορές στη σημασιακή λεπτομέρεια (granularity), κενά λεξικοποίησης και πολιτισμικά προσδιορισμένες σημασίες. Συνολικά, η εργασία καταδεικνύει ότι τα μεγάλα γλωσσικά μοντέλα μπορούν να υποστηρίξουν την κατασκευή λεξικών με επίγνωση της σημασίας, καθώς και τη διαγλωσσική ευθυγράμμιση της προσβλητικής γλώσσας, υπό την προϋπόθεση ότι τα αποτελέσματά τους πλαισιώνονται από σαφή κριτήρια αξιολόγησης (rubrics), ανθρώπινη επιμέλεια και συστηματική αξιολόγηση.","This thesis starts from the observation that the translation of offensive terms is impeded by the considerable idiomaticity of offensive language. With this desidaratum in mind, the thesis investigates the alignment of offensive lexica at sense level with LLMs since such lexica are not available as yet. Because one of the languages used in the alignment, namely Modern Greek, has no offensive lexica with sense descriptions, the thesis presents a methodology of developing sense enriched offensive lexica with LLMs. So, first a new Modern Greek offensive lexicon is developed from 737 HurtLex-EL lemmas through an LLM-assisted lexicographic pipeline, followed by manual post-editing and evaluation. The final resource contains 1,109 sense-level entries with structured definitions, target categories, and authentic usage examples. Second, an LLM-as-a-judge methodology is used to align offensive senses across Arabic, Bulgarian, Modern Greek, French, and Italian through lemma–definition–example triples in the original languages. Across approximately 2.87 million pairwise comparisons, the pipeline produces 31 strict global sense categories and reveals both recurrent cross-lingual patterns and important limits to equivalence. The main challenges include severity mismatches, sense granularity differences, lexicalisation gaps, and culture-bound meanings. Overall, the thesis shows that LLMs can support sense-aware lexicon construction and interlingual offensive-language alignment, provided that their outputs are constrained by clear rubrics, human curation, and systematic evaluation."],"dc:identifier":["uoadl:5410582","https://pergamos.lib.uoa.gr/uoa/dl/object/5410582"],"dc:language":["English"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["From Form to Meaning: Interlingual Sense-Alignment of Offensive Language with LLMs"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-07-24T01:02:36Z"}