{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5426110"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5426110","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"Writer Identification","abstract":"Η αναγνώριση γραφέα αποσκοπεί στον εντοπισμό εγγράφων που έχουν γραφτεί από το ίδιο άτομο, μέσω της ανάλυσης της οπτικής εμφάνισης του γραφικού χαρακτήρα. Η παρούσα διπλωματική εργασία μελετά την ανάκτηση γραφέα από στατικές εικόνες χειρόγραφων εγγράφων, ανεξάρτητα από το περιεχόμενο του κειμένου, χρησιμοποιώντας το σύνολο δεδομένων ICDAR 2017 Historical-WI. Το τμήμα TRAIN περιλαμβάνει 1.182 σελίδες από 394 γραφείς, ενώ το τμήμα TEST περιλαμβάνει 3.600 σελίδες από 720 διαφορετικούς γραφείς. Κάθε σελίδα του TEST χρησιμοποιείται ως ερώτημα αναζήτησης έναντι των υπόλοιπων σελίδων του TEST, με τέσσερις σχετικές σελίδες από τον ίδιο γραφέα. Αξιολογούνται δύο προσεγγίσεις. Η Φάση 1 χρησιμοποιεί μία βασική μέθοδο που βασίζεται στο SRS-LBP και στην PCA (Principal Component Analysis). Δώδεκα ιστογράμματα, τα οποία υπολογίζονται σε διαφορετικές ακτίνες, σχηματίζουν έναν περιγραφέα σελίδας 3.072 διαστάσεων. Η PCA προσαρμόζεται στα δεδομένα TRAIN και μειώνει τον περιγραφέα στις 200 διαστάσεις. Στη συνέχεια εφαρμόζονται μετασχηματισμός τετραγωνικής ρίζας με διατήρηση του προσήμου και κανονικοποίηση L2, ενώ οι σελίδες συγκρίνονται με χρήση της τετραγωνισμένης Ευκλείδειας απόστασης. Η προσέγγιση αυτή επιτυγχάνει Top-1 ίσο με 74,14% και mAP ίση με 52,57%. Η Φάση 2 επανυλοποιεί τα βασικά στάδια της μεθόδου που προτάθηκε από τους Christlein et al. Οι περιγραφείς RootSIFT, οι οποίοι εξάγονται από σημεία ενδιαφέροντος παρόμοια με εκείνα του R-SIFT, ομαδοποιούνται ώστε να δημιουργηθούν υποκατάστατες κλάσεις. Στη συνέχεια, τα τμήματα εικόνας και οι αντίστοιχες ετικέτες συστάδων χρησιμοποιούνται για την εκπαίδευση ενός ResNet-20. Το δίκτυο παράγει τοπικούς περιγραφείς 64 διαστάσεων, οι οποίοι συναθροίζονται σε περιγραφείς σελίδας με χρήση πέντε λεξικών VLAD. Μετά την εφαρμογή PCA whitening και τη μείωση στις 640 διαστάσεις, η άμεση ανάκτηση με ομοιότητα συνημιτόνου επιτυγχάνει Top-1 ίσο με 86,69% και mAP ίση με 70,28%. Η Κωδικοποίηση Χαρακτηριστικών E-SVM (E-SVM Feature Encoding) χρησιμοποιεί κάθε σελίδα του TEST ως ένα θετικό παράδειγμα και τους περιγραφείς των σελίδων του TRAIN ως αρνητικά παραδείγματα. Το τελικό αυτό στάδιο αυξάνει τα αποτελέσματα σε Top-1 ίσο με 87,47% και mAP ίση με 71,70%. Η σύγκριση δείχνει ότι η εκπαιδευμένη αναπαράσταση από τοπικά σε καθολικά χαρακτηριστικά προσφέρει σαφή βελτίωση σε σχέση με τη βασική μέθοδο προκαθορισμένων χαρακτηριστικών. Η Κωδικοποίηση Χαρακτηριστικών E-SVM παρέχει μία μικρότερη πρόσθετη βελτίωση. Όλα τα στοιχεία που απαιτούν προσαρμογή ή εκπαίδευση χρησιμοποιούν δεδομένα TRAIN, ενώ οι ετικέτες των γραφέων του TEST χρησιμοποιούνται μόνο για την τελική αξιολόγηση. Δεν χρησιμοποιούνται εξωτερικά δεδομένα εκπαίδευσης ούτε ανακατάταξη της συλλογής TEST. Οι διαφορές από τη δημοσιευμένη μέθοδο τεκμηριώνονται και η μέθοδος της Φάσης 2 παρουσιάζεται ως επανυλοποίηση και όχι ως ακριβής αναπαραγωγή του αρχικού λογισμικού.","abstract_html":"Η αναγνώριση γραφέα αποσκοπεί στον εντοπισμό εγγράφων που έχουν γραφτεί από το ίδιο άτομο, μέσω της ανάλυσης της οπτικής εμφάνισης του γραφικού χαρακτήρα. Η παρούσα διπλωματική εργασία μελετά την ανάκτηση γραφέα από στατικές εικόνες χειρόγραφων εγγράφων, ανεξάρτητα από το περιεχόμενο του κειμένου, χρησιμοποιώντας το σύνολο δεδομένων ICDAR 2017 Historical-WI. Το τμήμα TRAIN περιλαμβάνει 1.182 σελίδες από 394 γραφείς, ενώ το τμήμα TEST περιλαμβάνει 3.600 σελίδες από 720 διαφορετικούς γραφείς. Κάθε σελίδα του TEST χρησιμοποιείται ως ερώτημα αναζήτησης έναντι των υπόλοιπων σελίδων του TEST, με τέσσερις σχετικές σελίδες από τον ίδιο γραφέα. Αξιολογούνται δύο προσεγγίσεις. Η Φάση 1 χρησιμοποιεί μία βασική μέθοδο που βασίζεται στο SRS-LBP και στην PCA (Principal Component Analysis). Δώδεκα ιστογράμματα, τα οποία υπολογίζονται σε διαφορετικές ακτίνες, σχηματίζουν έναν περιγραφέα σελίδας 3.072 διαστάσεων. Η PCA προσαρμόζεται στα δεδομένα TRAIN και μειώνει τον περιγραφέα στις 200 διαστάσεις. Στη συνέχεια εφαρμόζονται μετασχηματισμός τετραγωνικής ρίζας με διατήρηση του προσήμου και κανονικοποίηση L2, ενώ οι σελίδες συγκρίνονται με χρήση της τετραγωνισμένης Ευκλείδειας απόστασης. Η προσέγγιση αυτή επιτυγχάνει Top-1 ίσο με 74,14% και mAP ίση με 52,57%. Η Φάση 2 επανυλοποιεί τα βασικά στάδια της μεθόδου που προτάθηκε από τους Christlein et al. Οι περιγραφείς RootSIFT, οι οποίοι εξάγονται από σημεία ενδιαφέροντος παρόμοια με εκείνα του R-SIFT, ομαδοποιούνται ώστε να δημιουργηθούν υποκατάστατες κλάσεις. Στη συνέχεια, τα τμήματα εικόνας και οι αντίστοιχες ετικέτες συστάδων χρησιμοποιούνται για την εκπαίδευση ενός ResNet-20. Το δίκτυο παράγει τοπικούς περιγραφείς 64 διαστάσεων, οι οποίοι συναθροίζονται σε περιγραφείς σελίδας με χρήση πέντε λεξικών VLAD. Μετά την εφαρμογή PCA whitening και τη μείωση στις 640 διαστάσεις, η άμεση ανάκτηση με ομοιότητα συνημιτόνου επιτυγχάνει Top-1 ίσο με 86,69% και mAP ίση με 70,28%. Η Κωδικοποίηση Χαρακτηριστικών E-SVM (E-SVM Feature Encoding) χρησιμοποιεί κάθε σελίδα του TEST ως ένα θετικό παράδειγμα και τους περιγραφείς των σελίδων του TRAIN ως αρνητικά παραδείγματα. Το τελικό αυτό στάδιο αυξάνει τα αποτελέσματα σε Top-1 ίσο με 87,47% και mAP ίση με 71,70%. Η σύγκριση δείχνει ότι η εκπαιδευμένη αναπαράσταση από τοπικά σε καθολικά χαρακτηριστικά προσφέρει σαφή βελτίωση σε σχέση με τη βασική μέθοδο προκαθορισμένων χαρακτηριστικών. Η Κωδικοποίηση Χαρακτηριστικών E-SVM παρέχει μία μικρότερη πρόσθετη βελτίωση. Όλα τα στοιχεία που απαιτούν προσαρμογή ή εκπαίδευση χρησιμοποιούν δεδομένα TRAIN, ενώ οι ετικέτες των γραφέων του TEST χρησιμοποιούνται μόνο για την τελική αξιολόγηση. Δεν χρησιμοποιούνται εξωτερικά δεδομένα εκπαίδευσης ούτε ανακατάταξη της συλλογής TEST. Οι διαφορές από τη δημοσιευμένη μέθοδο τεκμηριώνονται και η μέθοδος της Φάσης 2 παρουσιάζεται ως επανυλοποίηση και όχι ως ακριβής αναπαραγωγή του αρχικού λογισμικού.","abstract_has_math":false,"creators":["Δουκάκης Γεώργιος","Doukakis Georgios"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-08-21T16:41:59Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["English"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5426110"],"render_values":[{"text":"uoadl:5426110","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5426110","outbound_label":"Repository record","outbound_source":"dc:identifier"},"source_record":{"url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh?verb=GetRecord&metadataPrefix=oai_dc&identifier=oai%3Alib.uoa.gr%3Auoadl%3A5426110","prefix":"oai_dc"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["Δουκάκης Γεώργιος","Doukakis Georgios"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["English"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5426110","https://pergamos.lib.uoa.gr/uoa/dl/object/5426110"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Η αναγνώριση γραφέα αποσκοπεί στον εντοπισμό εγγράφων που έχουν γραφτεί από το ίδιο άτομο, μέσω της ανάλυσης της οπτικής εμφάνισης του γραφικού χαρακτήρα. Η παρούσα διπλωματική εργασία μελετά την ανάκτηση γραφέα από στατικές εικόνες χειρόγραφων εγγράφων, ανεξάρτητα από το περιεχόμενο του κειμένου, χρησιμοποιώντας το σύνολο δεδομένων ICDAR 2017 Historical-WI. Το τμήμα TRAIN περιλαμβάνει 1.182 σελίδες από 394 γραφείς, ενώ το τμήμα TEST περιλαμβάνει 3.600 σελίδες από 720 διαφορετικούς γραφείς. Κάθε σελίδα του TEST χρησιμοποιείται ως ερώτημα αναζήτησης έναντι των υπόλοιπων σελίδων του TEST, με τέσσερις σχετικές σελίδες από τον ίδιο γραφέα. Αξιολογούνται δύο προσεγγίσεις. Η Φάση 1 χρησιμοποιεί μία βασική μέθοδο που βασίζεται στο SRS-LBP και στην PCA (Principal Component Analysis). Δώδεκα ιστογράμματα, τα οποία υπολογίζονται σε διαφορετικές ακτίνες, σχηματίζουν έναν περιγραφέα σελίδας 3.072 διαστάσεων. Η PCA προσαρμόζεται στα δεδομένα TRAIN και μειώνει τον περιγραφέα στις 200 διαστάσεις. Στη συνέχεια εφαρμόζονται μετασχηματισμός τετραγωνικής ρίζας με διατήρηση του προσήμου και κανονικοποίηση L2, ενώ οι σελίδες συγκρίνονται με χρήση της τετραγωνισμένης Ευκλείδειας απόστασης. Η προσέγγιση αυτή επιτυγχάνει Top-1 ίσο με 74,14% και mAP ίση με 52,57%. Η Φάση 2 επανυλοποιεί τα βασικά στάδια της μεθόδου που προτάθηκε από τους Christlein et al. Οι περιγραφείς RootSIFT, οι οποίοι εξάγονται από σημεία ενδιαφέροντος παρόμοια με εκείνα του R-SIFT, ομαδοποιούνται ώστε να δημιουργηθούν υποκατάστατες κλάσεις. Στη συνέχεια, τα τμήματα εικόνας και οι αντίστοιχες ετικέτες συστάδων χρησιμοποιούνται για την εκπαίδευση ενός ResNet-20. Το δίκτυο παράγει τοπικούς περιγραφείς 64 διαστάσεων, οι οποίοι συναθροίζονται σε περιγραφείς σελίδας με χρήση πέντε λεξικών VLAD. Μετά την εφαρμογή PCA whitening και τη μείωση στις 640 διαστάσεις, η άμεση ανάκτηση με ομοιότητα συνημιτόνου επιτυγχάνει Top-1 ίσο με 86,69% και mAP ίση με 70,28%. Η Κωδικοποίηση Χαρακτηριστικών E-SVM (E-SVM Feature Encoding) χρησιμοποιεί κάθε σελίδα του TEST ως ένα θετικό παράδειγμα και τους περιγραφείς των σελίδων του TRAIN ως αρνητικά παραδείγματα. Το τελικό αυτό στάδιο αυξάνει τα αποτελέσματα σε Top-1 ίσο με 87,47% και mAP ίση με 71,70%. Η σύγκριση δείχνει ότι η εκπαιδευμένη αναπαράσταση από τοπικά σε καθολικά χαρακτηριστικά προσφέρει σαφή βελτίωση σε σχέση με τη βασική μέθοδο προκαθορισμένων χαρακτηριστικών. Η Κωδικοποίηση Χαρακτηριστικών E-SVM παρέχει μία μικρότερη πρόσθετη βελτίωση. Όλα τα στοιχεία που απαιτούν προσαρμογή ή εκπαίδευση χρησιμοποιούν δεδομένα TRAIN, ενώ οι ετικέτες των γραφέων του TEST χρησιμοποιούνται μόνο για την τελική αξιολόγηση. Δεν χρησιμοποιούνται εξωτερικά δεδομένα εκπαίδευσης ούτε ανακατάταξη της συλλογής TEST. Οι διαφορές από τη δημοσιευμένη μέθοδο τεκμηριώνονται και η μέθοδος της Φάσης 2 παρουσιάζεται ως επανυλοποίηση και όχι ως ακριβής αναπαραγωγή του αρχικού λογισμικού.","Writer identification aims to find documents written by the same person by analysing the visual appearance of handwriting. This thesis studies offline, text-independent writer retrieval using the ICDAR 2017 Historical-WI dataset. The TRAIN partition contains 1,182 pages from 394 writers, while the TEST partition contains 3,600 pages from 720 different writers. Each TEST page is used as a query against the remaining TEST pages, with four relevant pages from the same writer. Two approaches are evaluated. Phase 1 uses an SRS-LBP-based baseline with Principal Component Analysis. Twelve histograms, computed at different radii, form a 3,072-dimensional page descriptor. PCA is fitted on TRAIN and reduces the descriptor to 200 dimensions. Signed square-root and L2 normalisation are then applied, and the pages are compared using squared Euclidean distance. This approach achieves 74.14% Top-1 and 52.57% mean Average Precision (mAP). Phase 2 re-implements the main stages of the method proposed by Christlein et al. RootSIFT descriptors extracted from R-SIFT-like keypoints are clustered to create surrogate classes. Image patches and their corresponding cluster labels are then used to train a ResNet-20. The network produces 64-dimensional local descriptors, which are aggregated into page descriptors using five VLAD codebooks. After PCA whitening to 640 dimensions, direct cosine retrieval achieves 86.69% Top-1 and 70.28% mAP. E-SVM Feature Encoding uses each TEST page as one positive example and the TRAIN page descriptors as negatives. This final stage increases the results to 87.47% Top-1 and 71.70% mAP. The comparison shows that the learned local-to-global representation gives a clear improvement over the handcrafted baseline. E-SVM Feature Encoding provides a smaller additional gain. All fitted components use TRAIN data, and TEST writer labels are used only for the final evaluation. No external training data or TEST-gallery reranking is used. The differences from the published method are documented, and the Phase 2 method is presented as a re-implementation rather than an exact reproduction of the original software."]},{"key":"dc:title","label":"Title","values":["Writer Identification"]}]}],"canonical_facts":{"dc:creator":["Δουκάκης Γεώργιος","Doukakis Georgios"],"dc:date":["2026"],"dc:description":["Η αναγνώριση γραφέα αποσκοπεί στον εντοπισμό εγγράφων που έχουν γραφτεί από το ίδιο άτομο, μέσω της ανάλυσης της οπτικής εμφάνισης του γραφικού χαρακτήρα. Η παρούσα διπλωματική εργασία μελετά την ανάκτηση γραφέα από στατικές εικόνες χειρόγραφων εγγράφων, ανεξάρτητα από το περιεχόμενο του κειμένου, χρησιμοποιώντας το σύνολο δεδομένων ICDAR 2017 Historical-WI. Το τμήμα TRAIN περιλαμβάνει 1.182 σελίδες από 394 γραφείς, ενώ το τμήμα TEST περιλαμβάνει 3.600 σελίδες από 720 διαφορετικούς γραφείς. Κάθε σελίδα του TEST χρησιμοποιείται ως ερώτημα αναζήτησης έναντι των υπόλοιπων σελίδων του TEST, με τέσσερις σχετικές σελίδες από τον ίδιο γραφέα. Αξιολογούνται δύο προσεγγίσεις. Η Φάση 1 χρησιμοποιεί μία βασική μέθοδο που βασίζεται στο SRS-LBP και στην PCA (Principal Component Analysis). Δώδεκα ιστογράμματα, τα οποία υπολογίζονται σε διαφορετικές ακτίνες, σχηματίζουν έναν περιγραφέα σελίδας 3.072 διαστάσεων. Η PCA προσαρμόζεται στα δεδομένα TRAIN και μειώνει τον περιγραφέα στις 200 διαστάσεις. Στη συνέχεια εφαρμόζονται μετασχηματισμός τετραγωνικής ρίζας με διατήρηση του προσήμου και κανονικοποίηση L2, ενώ οι σελίδες συγκρίνονται με χρήση της τετραγωνισμένης Ευκλείδειας απόστασης. Η προσέγγιση αυτή επιτυγχάνει Top-1 ίσο με 74,14% και mAP ίση με 52,57%. Η Φάση 2 επανυλοποιεί τα βασικά στάδια της μεθόδου που προτάθηκε από τους Christlein et al. Οι περιγραφείς RootSIFT, οι οποίοι εξάγονται από σημεία ενδιαφέροντος παρόμοια με εκείνα του R-SIFT, ομαδοποιούνται ώστε να δημιουργηθούν υποκατάστατες κλάσεις. Στη συνέχεια, τα τμήματα εικόνας και οι αντίστοιχες ετικέτες συστάδων χρησιμοποιούνται για την εκπαίδευση ενός ResNet-20. Το δίκτυο παράγει τοπικούς περιγραφείς 64 διαστάσεων, οι οποίοι συναθροίζονται σε περιγραφείς σελίδας με χρήση πέντε λεξικών VLAD. Μετά την εφαρμογή PCA whitening και τη μείωση στις 640 διαστάσεις, η άμεση ανάκτηση με ομοιότητα συνημιτόνου επιτυγχάνει Top-1 ίσο με 86,69% και mAP ίση με 70,28%. Η Κωδικοποίηση Χαρακτηριστικών E-SVM (E-SVM Feature Encoding) χρησιμοποιεί κάθε σελίδα του TEST ως ένα θετικό παράδειγμα και τους περιγραφείς των σελίδων του TRAIN ως αρνητικά παραδείγματα. Το τελικό αυτό στάδιο αυξάνει τα αποτελέσματα σε Top-1 ίσο με 87,47% και mAP ίση με 71,70%. Η σύγκριση δείχνει ότι η εκπαιδευμένη αναπαράσταση από τοπικά σε καθολικά χαρακτηριστικά προσφέρει σαφή βελτίωση σε σχέση με τη βασική μέθοδο προκαθορισμένων χαρακτηριστικών. Η Κωδικοποίηση Χαρακτηριστικών E-SVM παρέχει μία μικρότερη πρόσθετη βελτίωση. Όλα τα στοιχεία που απαιτούν προσαρμογή ή εκπαίδευση χρησιμοποιούν δεδομένα TRAIN, ενώ οι ετικέτες των γραφέων του TEST χρησιμοποιούνται μόνο για την τελική αξιολόγηση. Δεν χρησιμοποιούνται εξωτερικά δεδομένα εκπαίδευσης ούτε ανακατάταξη της συλλογής TEST. Οι διαφορές από τη δημοσιευμένη μέθοδο τεκμηριώνονται και η μέθοδος της Φάσης 2 παρουσιάζεται ως επανυλοποίηση και όχι ως ακριβής αναπαραγωγή του αρχικού λογισμικού.","Writer identification aims to find documents written by the same person by analysing the visual appearance of handwriting. This thesis studies offline, text-independent writer retrieval using the ICDAR 2017 Historical-WI dataset. The TRAIN partition contains 1,182 pages from 394 writers, while the TEST partition contains 3,600 pages from 720 different writers. Each TEST page is used as a query against the remaining TEST pages, with four relevant pages from the same writer. Two approaches are evaluated. Phase 1 uses an SRS-LBP-based baseline with Principal Component Analysis. Twelve histograms, computed at different radii, form a 3,072-dimensional page descriptor. PCA is fitted on TRAIN and reduces the descriptor to 200 dimensions. Signed square-root and L2 normalisation are then applied, and the pages are compared using squared Euclidean distance. This approach achieves 74.14% Top-1 and 52.57% mean Average Precision (mAP). Phase 2 re-implements the main stages of the method proposed by Christlein et al. RootSIFT descriptors extracted from R-SIFT-like keypoints are clustered to create surrogate classes. Image patches and their corresponding cluster labels are then used to train a ResNet-20. The network produces 64-dimensional local descriptors, which are aggregated into page descriptors using five VLAD codebooks. After PCA whitening to 640 dimensions, direct cosine retrieval achieves 86.69% Top-1 and 70.28% mAP. E-SVM Feature Encoding uses each TEST page as one positive example and the TRAIN page descriptors as negatives. This final stage increases the results to 87.47% Top-1 and 71.70% mAP. The comparison shows that the learned local-to-global representation gives a clear improvement over the handcrafted baseline. E-SVM Feature Encoding provides a smaller additional gain. All fitted components use TRAIN data, and TEST writer labels are used only for the final evaluation. No external training data or TEST-gallery reranking is used. The differences from the published method are documented, and the Phase 2 method is presented as a re-implementation rather than an exact reproduction of the original software."],"dc:identifier":["uoadl:5426110","https://pergamos.lib.uoa.gr/uoa/dl/object/5426110"],"dc:language":["English"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["Writer Identification"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-08-21T16:41:59Z"}