Συντάχθηκε 10-07-2026 11:16
Τόπος:
Σύνδεσμος τηλεδιάσκεψης
Έναρξη: 15/07/2026 12:00
Λήξη: 15/07/2026 13:00
ΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗΣ
Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών
Πρόγραμμα Προπτυχιακών Σπουδών
ΠΑΡΟΥΣΙΑΣΗ ΔΙΠΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ
ΠΕΤΡΟΥ ΜΠΙΜΠΙΡΗ
με θέμα
Μηχανισμοί Ψηφοφοριών ως Τεχνική Συμψηφισμού Μεντόρων Ενισχυτικής Μάθησης μέσω Μίμησης
Voting Mechanisms as a Mentor Aggregation Technique for Imitation Reinforcement Learning
Εξεταστική Επιτροπή
Καθηγητής Γεώργιος Χαλκιαδάκης (επιβλέπων)
Καθηγητής Θρασύβουλος Σπυρόπουλος
Καθηγητής Μιχαήλ Λαγουδάκης
Περίληψη
Την τελευταία δεκαετία η μηχανική μάθηση έχει γίνει εξαιρετικά δημοφιλής, καθώς προσφέρει λύσεις σε προβλήματα στα οποία οι συμβατικοί αλγόριθμοι υστερούν. Ένα πολλά υποσχόμενο υπό-πεδίο της μηχανικής μάθησης είναι η μάθηση από μίμηση (imitation learning), όπου ένας πράκτορας-μαθητής παρακολουθεί έναν μέντορα να εκτελεί κάποια διαδικασία (επίδειξη - demonstration) και χρησιμοποιεί την εμπειρία αυτή προς όφελος του. Μια από τις μεγαλύτερες προκλήσεις της μάθησης από μίμηση είναι ότι ο μέντορας πρέπει να είναι βέλτιστος, πράγμα το οποίο είναι εξαιρετικά σπάνιο (ή και αδύνατο) στην πράξη. Αντίθετα, υπάρχει πληθώρα πιθανών μεντόρων που πετυχαίνουν αφενός καλά αποτελέσματα, παρουσιάζοντας ωστόσο αστοχίες και λάθη τα οποία ένας βέλτιστος μέντορας θα απέφευγε.
Στην εργασία αυτή παρουσιάζεται ένας αλγόριθμος συνδυασμού μη-βέλτιστων μεντόρων στα πλαίσια της έμμεσης μάθησης μέσω μίμησης. Δεδομένων επιδείξεων από μη-βέλτιστους μέντορες, ο σκοπός μας είναι να δημιουργήσουμε νέες επιδείξεις, αποφεύγοντας τα σφάλματα στα οποία υπέπεσαν οι μέντορες. Οι νέες αυτές επιδείξεις μπορούν να χρησιμοποιηθούν για να εκπαιδευτούν πράκτορες γρηγορότερα και πιο αποτελεσματικά.
Η βάση πάνω στη οποία αναπτύσσονται οι προτεινόμενες μέθοδοι είναι η παρατήρηση ότι “υπάρχουν λίγοι τρόποι για να πετύχει κανείς ενώ πολλοί για να αποτύχει”, οπότε οι μέντορες τείνουν να συμφωνούν όταν πράττουν σωστά ενώ διαφωνούν όταν σφάλλουν. Η συμφωνία των μεντόρων δρα συνεπώς ως ένδειξη ποιότητας μιας δεδομένης πράξης, οπότε προτείνεται η χρήση ψηφοφορίας για να προκύψουν οι νέες επιδείξεις. Για την ψηφοφορία χρησιμοποιείται ο μηχανισμός της σχετικής πλειοψηφίας, γύρω από τον οποίο αναπτύσσεται ο βασικός αλγόριθμος που προτείνεται σε αυτή την εργασία.
Προτείνονται επίσης δύο εναλλακτικές, εκ των οποίων η μία επιτρέπει την χρήση ευρετικής για την ποιότητα κάθε επίδειξης ως βάρος στην ψηφοφορία, ενώ η άλλη λειτουργεί χωρίς να αλληλεπιδρά με το περιβάλλον. Η απόδοση των αλγορίθμων παρουσιάζεται σε πειράματα όπου συνδυάζονται με γνωστή τεχνική για έμμεση μάθηση μέσω μίμησης (Behavioral Cloning from Observation, BCO), καθιστώντας δυνατή την εκπαίδευση ενός μοντέλου από δεδομένα τα οποία αρχικά ήταν ανεπαρκή για αυτό τον σκοπό. Επιβεβαιώνεται επίσης πειραματικά η υπόθεση ότι η ψηφοφορία επιλέγει τους βέλτιστους μέντορες συχνότερα από τους υπόλοιπους, εξηγώντας ουσιαστικά τον τρόπο λειτουργίας της προτεινόμενης προσέγγισης.
Abstract
During the last decade machine learning has gained a lot of popularity, due to its ability to tackle problems that conventional algorithms struggle with. A vibrant subfield of machine learning research is imitation learning, where an agent observes a mentor perform a task and leverages their experience to its advantage. One of the challenges in imitation learning is the need for optimal mentors, which are rare in practice, while sub-optimal ones are readily available.
This thesis proposes an algorithm for mentor aggregation in implicit imitation learning. Given a set of state-only demonstrations from sub-optimal mentors, our goal is to produce a dataset that minimizes the effects of those suboptimalities, allowing for greater sample efficiency and better performance.
The basis of our mentor aggregation approach is the idea that there are more ways to fail than to succeed, and thus mentor actions match when right and differ when wrong. Mentor consensus becomes then an indicator of action quality. In order to identify such a consensus, we leverage a method from the social choice theory literature, Plurality Voting, and employ it to aggregate the mentor “opinions” as described by their demonstrations.
We present a main approach and two alternative versions, one incorporating a demonstration quality heuristic to weigh the votes and one requiring no environment interaction. We showcase the effectiveness of our approach alongside a known algorithm for behavioral cloning, Behavioral Cloning from Observation (BCO). We also verify our hypothesis that voting selects optimal mentors more frequently than sub-optimal ones experimentally.