National and Kapodistrian University of Athens
Contextual Bandits with Neural Networks and Trees
Abstract
dc:descriptionΠολλά προβλήματα περιλαμβάνουν τη λήψη διαδοχικών αποφάσεων υπό συν- θήκες αβεβαιότητας, όπου πρέπει να εξισορροπηθεί η εξερεύνηση (exploration) με την εκμετάλλευση (exploitation). Τα bandits παρέχουν ένα απλό μοντέλο για αυτό το δίλημμα. Τα contextual bandits αποτελούν μια πολύ σημαντική κατηγορία, όπου ο πράκτορας(agent) έχει πρόσβαση σε πρόσθετες πληροφορίες που μπορεί να βοηθήσουν στην πρόβλεψη της ποιότητας των ενεργειών του. Αυτό το πλαίσιο χρησιμοποιείται ευρέως σε πλήθος εφαρμογών. Η παρούσα διπλωματική εργασία παρέχει μια εισαγωγή στο πλαίσιο των bandits και επικεντρώνεται στα contextual bandits. Εισάγεται η βασική σημειογραφία που χρησιμοποιείται εκτενώς στη βιβλιογραφία, μαζί με αλγορίθμους, συμπερ- ιλαμβανομένων των ε-greedy, Upper Confidence Bound (UCB) και Thompson Sampling, οι οποίοι χρησιμοποιούνται για τη μείωση της μεταμέλειας (regret). Στη συνέχεια, η εργασία ανασκοπεί δύο από τις σημαντικότερες μεθό- δους στατιστικής μάθησης που χρησιμοποιούνται για τη μοντελοποίηση των σχέσεων μεταξύ πλαισίου και ανταμοιβής, συγκεκριμένα τα δέντρα απόφασης (και ensembles όπως τα τυχαία δάση) και τα νευρωνικά δίκτυα, συμπεριλαμ- βανομένου του Neural Tangent Kernel (NTK). Τέλος, η εργασία συνοψίζει τις βασικές ιδέες ορισμένων εμβληματικών ερ- γασιών, στις οποίες οι στατιστικές μέθοδοι αυτές χρησιμοποιήθηκαν για την προσέγγιση της συνάρτησης πλαισίου-ανταμοιβής στα contextual bandits.
Author and committee
dc:creator, dc:contributor.*- Authors dc:creator
-
- ΚΩΝΣΤΑΝΤΑΤΟΣ ΚΩΝΣΤΑΝΤΙΝΟΣ
- KONSTANTATOS KONSTANTINOS
Subjects
dc:subject × 2Rights
- Language dc:language
- English
Identifiers
dc:identifier.*- Identifier
- uoadl:5358913
- OAI identifier oai:identifier
- oai:lib.uoa.gr:uoadl:5358913