{"id":{"repo_id":"athens","oai_identifier":"oai:lib.uoa.gr:uoadl:5358913"},"canonical_url":"https://search.dev.ndltd.org/etd/athens/oai:lib.uoa.gr:uoadl:5358913","repository":{"repo_id":"athens","name":"National and Kapodistrian University of Athens","base_url":"https://pergamos.lib.uoa.gr/uoa/dl/frontend/oaipmh"},"display":{"title":"Contextual Bandits with Neural Networks and Trees","abstract":"Πολλά προβλήματα περιλαμβάνουν τη λήψη διαδοχικών αποφάσεων υπό συν- θήκες αβεβαιότητας, όπου πρέπει να εξισορροπηθεί η εξερεύνηση (exploration) με την εκμετάλλευση (exploitation). Τα bandits παρέχουν ένα απλό μοντέλο για αυτό το δίλημμα. Τα contextual bandits αποτελούν μια πολύ σημαντική κατηγορία, όπου ο πράκτορας(agent) έχει πρόσβαση σε πρόσθετες πληροφορίες που μπορεί να βοηθήσουν στην πρόβλεψη της ποιότητας των ενεργειών του. Αυτό το πλαίσιο χρησιμοποιείται ευρέως σε πλήθος εφαρμογών. Η παρούσα διπλωματική εργασία παρέχει μια εισαγωγή στο πλαίσιο των bandits και επικεντρώνεται στα contextual bandits. Εισάγεται η βασική σημειογραφία που χρησιμοποιείται εκτενώς στη βιβλιογραφία, μαζί με αλγορίθμους, συμπερ- ιλαμβανομένων των ε-greedy, Upper Confidence Bound (UCB) και Thompson Sampling, οι οποίοι χρησιμοποιούνται για τη μείωση της μεταμέλειας (regret). Στη συνέχεια, η εργασία ανασκοπεί δύο από τις σημαντικότερες μεθό- δους στατιστικής μάθησης που χρησιμοποιούνται για τη μοντελοποίηση των σχέσεων μεταξύ πλαισίου και ανταμοιβής, συγκεκριμένα τα δέντρα απόφασης (και ensembles όπως τα τυχαία δάση) και τα νευρωνικά δίκτυα, συμπεριλαμ- βανομένου του Neural Tangent Kernel (NTK). Τέλος, η εργασία συνοψίζει τις βασικές ιδέες ορισμένων εμβληματικών ερ- γασιών, στις οποίες οι στατιστικές μέθοδοι αυτές χρησιμοποιήθηκαν για την προσέγγιση της συνάρτησης πλαισίου-ανταμοιβής στα contextual bandits.","abstract_html":"Πολλά προβλήματα περιλαμβάνουν τη λήψη διαδοχικών αποφάσεων υπό συν- θήκες αβεβαιότητας, όπου πρέπει να εξισορροπηθεί η εξερεύνηση (exploration) με την εκμετάλλευση (exploitation). Τα bandits παρέχουν ένα απλό μοντέλο για αυτό το δίλημμα. Τα contextual bandits αποτελούν μια πολύ σημαντική κατηγορία, όπου ο πράκτορας(agent) έχει πρόσβαση σε πρόσθετες πληροφορίες που μπορεί να βοηθήσουν στην πρόβλεψη της ποιότητας των ενεργειών του. Αυτό το πλαίσιο χρησιμοποιείται ευρέως σε πλήθος εφαρμογών. Η παρούσα διπλωματική εργασία παρέχει μια εισαγωγή στο πλαίσιο των bandits και επικεντρώνεται στα contextual bandits. Εισάγεται η βασική σημειογραφία που χρησιμοποιείται εκτενώς στη βιβλιογραφία, μαζί με αλγορίθμους, συμπερ- ιλαμβανομένων των ε-greedy, Upper Confidence Bound (UCB) και Thompson Sampling, οι οποίοι χρησιμοποιούνται για τη μείωση της μεταμέλειας (regret). Στη συνέχεια, η εργασία ανασκοπεί δύο από τις σημαντικότερες μεθό- δους στατιστικής μάθησης που χρησιμοποιούνται για τη μοντελοποίηση των σχέσεων μεταξύ πλαισίου και ανταμοιβής, συγκεκριμένα τα δέντρα απόφασης (και ensembles όπως τα τυχαία δάση) και τα νευρωνικά δίκτυα, συμπεριλαμ- βανομένου του Neural Tangent Kernel (NTK). Τέλος, η εργασία συνοψίζει τις βασικές ιδέες ορισμένων εμβληματικών ερ- γασιών, στις οποίες οι στατιστικές μέθοδοι αυτές χρησιμοποιήθηκαν για την προσέγγιση της συνάρτησης πλαισίου-ανταμοιβής στα contextual bandits.","abstract_has_math":false,"creators":["ΚΩΝΣΤΑΝΤΑΤΟΣ ΚΩΝΣΤΑΝΤΙΝΟΣ","KONSTANTATOS KONSTANTINOS"],"institution":null,"degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":[],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026","date_published":"2026","updated_at":"2026-07-24T01:01:49Z","subjects":["Θετικές Επιστήμες","Science"],"languages":["English"],"rights":[],"rights_urls":[],"identifier_entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5358913"],"render_values":[{"text":"uoadl:5358913","href":null,"code":true}]}]},"links":{"outbound_url":"https://pergamos.lib.uoa.gr/uoa/dl/object/5358913","outbound_label":"Repository record","outbound_source":"dc:identifier"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:creator","label":"Author","values":["ΚΩΝΣΤΑΝΤΑΤΟΣ ΚΩΝΣΤΑΝΤΙΝΟΣ","KONSTANTATOS KONSTANTINOS"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026"]},{"key":"dc:type","label":"Dc Type","values":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Θετικές Επιστήμες","Science"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["English"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["uoadl:5358913","https://pergamos.lib.uoa.gr/uoa/dl/object/5358913"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Πολλά προβλήματα περιλαμβάνουν τη λήψη διαδοχικών αποφάσεων υπό συν- θήκες αβεβαιότητας, όπου πρέπει να εξισορροπηθεί η εξερεύνηση (exploration) με την εκμετάλλευση (exploitation). Τα bandits παρέχουν ένα απλό μοντέλο για αυτό το δίλημμα. Τα contextual bandits αποτελούν μια πολύ σημαντική κατηγορία, όπου ο πράκτορας(agent) έχει πρόσβαση σε πρόσθετες πληροφορίες που μπορεί να βοηθήσουν στην πρόβλεψη της ποιότητας των ενεργειών του. Αυτό το πλαίσιο χρησιμοποιείται ευρέως σε πλήθος εφαρμογών. Η παρούσα διπλωματική εργασία παρέχει μια εισαγωγή στο πλαίσιο των bandits και επικεντρώνεται στα contextual bandits. Εισάγεται η βασική σημειογραφία που χρησιμοποιείται εκτενώς στη βιβλιογραφία, μαζί με αλγορίθμους, συμπερ- ιλαμβανομένων των ε-greedy, Upper Confidence Bound (UCB) και Thompson Sampling, οι οποίοι χρησιμοποιούνται για τη μείωση της μεταμέλειας (regret). Στη συνέχεια, η εργασία ανασκοπεί δύο από τις σημαντικότερες μεθό- δους στατιστικής μάθησης που χρησιμοποιούνται για τη μοντελοποίηση των σχέσεων μεταξύ πλαισίου και ανταμοιβής, συγκεκριμένα τα δέντρα απόφασης (και ensembles όπως τα τυχαία δάση) και τα νευρωνικά δίκτυα, συμπεριλαμ- βανομένου του Neural Tangent Kernel (NTK). Τέλος, η εργασία συνοψίζει τις βασικές ιδέες ορισμένων εμβληματικών ερ- γασιών, στις οποίες οι στατιστικές μέθοδοι αυτές χρησιμοποιήθηκαν για την προσέγγιση της συνάρτησης πλαισίου-ανταμοιβής στα contextual bandits.","Many problems involve sequential decision-making under uncertainty, where one must balance exploration and exploitation. Bandits provide a simple model for this dilemma. Contextual bandits is a very important category of bandits, where the agent has access to additional information that may help predict the quality of the actions. This framework is widely used in applications. This thesis provides an introduction to the bandit framework and focuses on contextual bandits. Basic notation that is used extensively in the bandit literature is introduced, along with standard algorithms including ε-greedy, Upper Confidence Bound, and Thompson Sampling which are used to reduce regret. The thesis then reviews two of the most important statistical learning methods used to model context–reward relationships, namely decision trees (and ensembles such as random forests) and neural networks, including the neural tangent kernel. The thesis also summarizes key ideas of some milestone papers, in which these methods were used to approximate the context-reward function in contextual bandits."]},{"key":"dc:title","label":"Title","values":["Contextual Bandits with Neural Networks and Trees"]}]}],"canonical_facts":{"dc:creator":["ΚΩΝΣΤΑΝΤΑΤΟΣ ΚΩΝΣΤΑΝΤΙΝΟΣ","KONSTANTATOS KONSTANTINOS"],"dc:date":["2026"],"dc:description":["Πολλά προβλήματα περιλαμβάνουν τη λήψη διαδοχικών αποφάσεων υπό συν- θήκες αβεβαιότητας, όπου πρέπει να εξισορροπηθεί η εξερεύνηση (exploration) με την εκμετάλλευση (exploitation). Τα bandits παρέχουν ένα απλό μοντέλο για αυτό το δίλημμα. Τα contextual bandits αποτελούν μια πολύ σημαντική κατηγορία, όπου ο πράκτορας(agent) έχει πρόσβαση σε πρόσθετες πληροφορίες που μπορεί να βοηθήσουν στην πρόβλεψη της ποιότητας των ενεργειών του. Αυτό το πλαίσιο χρησιμοποιείται ευρέως σε πλήθος εφαρμογών. Η παρούσα διπλωματική εργασία παρέχει μια εισαγωγή στο πλαίσιο των bandits και επικεντρώνεται στα contextual bandits. Εισάγεται η βασική σημειογραφία που χρησιμοποιείται εκτενώς στη βιβλιογραφία, μαζί με αλγορίθμους, συμπερ- ιλαμβανομένων των ε-greedy, Upper Confidence Bound (UCB) και Thompson Sampling, οι οποίοι χρησιμοποιούνται για τη μείωση της μεταμέλειας (regret). Στη συνέχεια, η εργασία ανασκοπεί δύο από τις σημαντικότερες μεθό- δους στατιστικής μάθησης που χρησιμοποιούνται για τη μοντελοποίηση των σχέσεων μεταξύ πλαισίου και ανταμοιβής, συγκεκριμένα τα δέντρα απόφασης (και ensembles όπως τα τυχαία δάση) και τα νευρωνικά δίκτυα, συμπεριλαμ- βανομένου του Neural Tangent Kernel (NTK). Τέλος, η εργασία συνοψίζει τις βασικές ιδέες ορισμένων εμβληματικών ερ- γασιών, στις οποίες οι στατιστικές μέθοδοι αυτές χρησιμοποιήθηκαν για την προσέγγιση της συνάρτησης πλαισίου-ανταμοιβής στα contextual bandits.","Many problems involve sequential decision-making under uncertainty, where one must balance exploration and exploitation. Bandits provide a simple model for this dilemma. Contextual bandits is a very important category of bandits, where the agent has access to additional information that may help predict the quality of the actions. This framework is widely used in applications. This thesis provides an introduction to the bandit framework and focuses on contextual bandits. Basic notation that is used extensively in the bandit literature is introduced, along with standard algorithms including ε-greedy, Upper Confidence Bound, and Thompson Sampling which are used to reduce regret. The thesis then reviews two of the most important statistical learning methods used to model context–reward relationships, namely decision trees (and ensembles such as random forests) and neural networks, including the neural tangent kernel. The thesis also summarizes key ideas of some milestone papers, in which these methods were used to approximate the context-reward function in contextual bandits."],"dc:identifier":["uoadl:5358913","https://pergamos.lib.uoa.gr/uoa/dl/object/5358913"],"dc:language":["English"],"dc:subject":["Θετικές Επιστήμες","Science"],"dc:title":["Contextual Bandits with Neural Networks and Trees"],"dc:type":["born_digital_postgraduate_thesis","Διπλωματική Εργασία","Postgraduate Thesis"]},"updated_at":"2026-07-24T01:01:49Z"}