Abstract
dc:descriptionΗ αναγνώριση γραφέα αποσκοπεί στον εντοπισμό εγγράφων που έχουν γραφτεί από το ίδιο άτομο, μέσω της ανάλυσης της οπτικής εμφάνισης του γραφικού χαρακτήρα. Η παρούσα διπλωματική εργασία μελετά την ανάκτηση γραφέα από στατικές εικόνες χειρόγραφων εγγράφων, ανεξάρτητα από το περιεχόμενο του κειμένου, χρησιμοποιώντας το σύνολο δεδομένων ICDAR 2017 Historical-WI. Το τμήμα TRAIN περιλαμβάνει 1.182 σελίδες από 394 γραφείς, ενώ το τμήμα TEST περιλαμβάνει 3.600 σελίδες από 720 διαφορετικούς γραφείς. Κάθε σελίδα του TEST χρησιμοποιείται ως ερώτημα αναζήτησης έναντι των υπόλοιπων σελίδων του TEST, με τέσσερις σχετικές σελίδες από τον ίδιο γραφέα. Αξιολογούνται δύο προσεγγίσεις. Η Φάση 1 χρησιμοποιεί μία βασική μέθοδο που βασίζεται στο SRS-LBP και στην PCA (Principal Component Analysis). Δώδεκα ιστογράμματα, τα οποία υπολογίζονται σε διαφορετικές ακτίνες, σχηματίζουν έναν περιγραφέα σελίδας 3.072 διαστάσεων. Η PCA προσαρμόζεται στα δεδομένα TRAIN και μειώνει τον περιγραφέα στις 200 διαστάσεις. Στη συνέχεια εφαρμόζονται μετασχηματισμός τετραγωνικής ρίζας με διατήρηση του προσήμου και κανονικοποίηση L2, ενώ οι σελίδες συγκρίνονται με χρήση της τετραγωνισμένης Ευκλείδειας απόστασης. Η προσέγγιση αυτή επιτυγχάνει Top-1 ίσο με 74,14% και mAP ίση με 52,57%. Η Φάση 2 επανυλοποιεί τα βασικά στάδια της μεθόδου που προτάθηκε από τους Christlein et al. Οι περιγραφείς RootSIFT, οι οποίοι εξάγονται από σημεία ενδιαφέροντος παρόμοια με εκείνα του R-SIFT, ομαδοποιούνται ώστε να δημιουργηθούν υποκατάστατες κλάσεις. Στη συνέχεια, τα τμήματα εικόνας και οι αντίστοιχες ετικέτες συστάδων χρησιμοποιούνται για την εκπαίδευση ενός ResNet-20. Το δίκτυο παράγει τοπικούς περιγραφείς 64 διαστάσεων, οι οποίοι συναθροίζονται σε περιγραφείς σελίδας με χρήση πέντε λεξικών VLAD. Μετά την εφαρμογή PCA whitening και τη μείωση στις 640 διαστάσεις, η άμεση ανάκτηση με ομοιότητα συνημιτόνου επιτυγχάνει Top-1 ίσο με 86,69% και mAP ίση με 70,28%. Η Κωδικοποίηση Χαρακτηριστικών E-SVM (E-SVM Feature Encoding) χρησιμοποιεί κάθε σελίδα του TEST ως ένα θετικό παράδειγμα και τους περιγραφείς των σελίδων του TRAIN ως αρνητικά παραδείγματα. Το τελικό αυτό στάδιο αυξάνει τα αποτελέσματα σε Top-1 ίσο με 87,47% και mAP ίση με 71,70%. Η σύγκριση δείχνει ότι η εκπαιδευμένη αναπαράσταση από τοπικά σε καθολικά χαρακτηριστικά προσφέρει σαφή βελτίωση σε σχέση με τη βασική μέθοδο προκαθορισμένων χαρακτηριστικών. Η Κωδικοποίηση Χαρακτηριστικών E-SVM παρέχει μία μικρότερη πρόσθετη βελτίωση. Όλα τα στοιχεία που απαιτούν προσαρμογή ή εκπαίδευση χρησιμοποιούν δεδομένα TRAIN, ενώ οι ετικέτες των γραφέων του TEST χρησιμοποιούνται μόνο για την τελική αξιολόγηση. Δεν χρησιμοποιούνται εξωτερικά δεδομένα εκπαίδευσης ούτε ανακατάταξη της συλλογής TEST. Οι διαφορές από τη δημοσιευμένη μέθοδο τεκμηριώνονται και η μέθοδος της Φάσης 2 παρουσιάζεται ως επανυλοποίηση και όχι ως ακριβής αναπαραγωγή του αρχικού λογισμικού.
Author and committee
dc:creator, dc:contributor.*- Authors dc:creator
-
- Δουκάκης Γεώργιος
- Doukakis Georgios
Subjects
dc:subject × 2Rights
- Language dc:language
- English
Identifiers
dc:identifier.*- Identifier
- uoadl:5426110