Back to results

National and Kapodistrian University of Athens

Construction and Annotation of a Greek Corpus of Archaeological Texts

Abstract

dc:description

Η αρχαιολογία σήμερα έρχεται αντιμέτωπη με έναν ταχέως αυξανόμενο όγκο δεδομένων, μεγάλο μέρος των οποίων έχει τη μορφή κειμένου. Στην περίπτωση της Ελλάδας, η οποία διαθέτει έναν από τους πιο πυκνούς αρχαιολογικούς χάρτες παγκοσμίως, ο όγκος των ανασκαφικών εκθέσεων, των καταλόγων και των επιστημονικών δημοσιεύσεων είναι ιδιαίτερα μεγάλος. Η συστηματική διαχείριση και ανάλυση αυτής της πληροφορίας καθίσταται ολοένα και δυσκολότερη με τη χρήση αποκλειστικά παραδοσιακών μεθόδων. Μια υποσχόμενη προσέγγιση για την εξόρυξη δομημένης πληροφορίας από αρχαιολογικά κείμενα είναι η Αναγνώριση Ονοματικών Οντοτήτων (Named Entity Recognition – NER). Η παρούσα εργασία παρουσιάζει την ανάπτυξη ενός συνόλου δεδομένων εκπαίδευσης και αξιολόγησης που βασίζεται σε κείμενα με αρχαιολογικό περιεχόμενο. Ένα σώμα κειμένων, αποτελούμενο από 324 προτάσεις, επισημειώθηκε χειροκίνητα βάσει ενός σχήματος που περιλαμβάνει οκτώ τύπους οντοτήτων: Artefact (Τεχνούργημα), Period (Περίοδος), Location (Τοποθεσία), Context (Κατασκευές/Δομές), Material (Υλικό), Species (Είδος), Person (Πρόσωπο) και Feature (Χαρακτηριστικό). Η συμφωνία μεταξύ των δύο επισημειωτών (IAA), υπολογιζόμενη μέσω της τιμής micro-F1, ανήλθε σε 0.91 μετά την αναθεώρηση των οδηγιών επισημείωσης, υποδηλώνοντας υψηλή συνέπεια στη διαδικασία επισημείωσης. Το σύνολο δεδομένων χρησιμοποιήθηκε για την αξιολόγηση και την προσαρμογή του μοντέλου GLiNER2 (fastino/gliner2-multi-v1) στην αναγνώριση αρχαιολογικών οντοτήτων σε ελληνικά κείμενα, βάσει του ίδιου σχήματος επισημείωσης. Αρχικά, το μοντέλο αξιολογήθηκε σε συνθήκη μηδενικής εκπαίδευσης (zero-shot), αξιοποιώντας μόνο την περιγραφή των οντοτήτων σε φυσική γλώσσα. Στη συνέχεια, πραγματοποιήθηκε εποπτευόμενη προσαρμογή (supervised fine-tuning) του μοντέλου, το οποίο πέτυχε τελικό micro-F1 score 0.65 στο ανεξάρτητο, ανθρώπινα επισημειωμένο σύνολο ελέγχου αναφοράς (test set). Τα αποτελέσματα έδειξαν ότι η προσαρμογή βελτίωσε την απόδοση του μοντέλου σε σχέση με τη zero-shot αξιολόγηση, ενώ παράλληλα ανέδειξαν και τις προκλήσεις που προκύπτουν από την εξειδικευμένη αρχαιολογική ορολογία, τις πολυλεκτικές οντότητες, τη γλωσσική αμφισημία και τη συντακτική πολυπλοκότητα των ελληνικών αρχαιολογικών κειμένων. Τέλος, εξετάστηκε πιλοτικά η χρήση συνθετικών επισημειωμένων δεδομένων ως μέθοδος εμπλουτισμού του συνόλου εκπαίδευσης σε περιβάλλον περιορισμένων πόρων. Συνολικά, η εργασία φιλοδοξεί να δημιουργήσει τον πρώτο εξειδικευμένο πόρο για την εφαρμογή NER στην ελληνική αρχαιολογία και να θέσει μια βάση για μελλοντική έρευνα στην εξαγωγή και οργάνωση αρχαιολογικής πληροφορίας από ελληνικά κείμενα.

Author and committee

dc:creator, dc:contributor.*
Authors dc:creator
  • Αλεξανδροπούλου Σταυρούλα
  • Alexandropoulou Stavroula

Subjects

dc:subject × 2

Rights

Language dc:language
English

Identifiers

dc:identifier.*
Identifier
uoadl:5410546
OAI identifier oai:identifier
oai:lib.uoa.gr:uoadl:5410546

Chain of custody

source
Harvested from
National and Kapodistrian University of Athens
Base URL
pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

Αλεξανδροπούλου Σταυρούλα; Alexandropoulou Stavroula. Construction and Annotation of a Greek Corpus of Archaeological Texts. 2026. https://pergamos.lib.uoa.gr/uoa/dl/object/5410546