BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//TUC//Events//EN
CALSCALE:GREGORIAN
BEGIN:VTIMEZONE
TZID:Europe/Athens
TZNAME:EEST
DTSTART:19700329T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0300
TZNAME:EET
DTSTART:19701025T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
CREATED:20260623T115537Z
LAST-MODIFIED:20260623T115537Z
DTSTAMP:20260717T020339Z
UID:1784243019@tuc.gr
SUMMARY:Παρουσίαση Διπλωματικής Εργασίας κ. 
 Αθανασίου Κασσελά - Σχολή ΗΜΜΥ
LOCATION:
DESCRIPTION:https://www.tuc.gr/el/to-polytechnei
 o/ilektronikes-ypiresies/imerologio/
 imerologio-ekdiloseon-1?tx_tucevents
 2_tuceventsdisplay%5Baction%5D=show&
 tx_tucevents2_tuceventsdisplay%5Bcon
 troller%5D=Event&tx_tucevents2_tucev
 entsdisplay%5Bevent%5D=8491&cHash=5f
 130fde71f89fdf359ac571c689ae7a\nΠΟΛΥ
 ΤΕΧΝΕΙΟ ΚΡΗΤΗΣ\n Σχολή Ηλεκτρολόγων 
 Μηχανικών και Μηχανικών Υπολογιστών\
 n Πρόγραμμα Προπτυχιακών Σπουδών\n Π
 ΑΡΟΥΣΙΑΣΗ ΔΙΠΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ\n Αθ
 ανασίου Κασσελά\n με θέμα\n Βαθιά Εν
 ισχυτική Μάθηση σε Στρατηγικά Περιβά
 λλοντα Πραγματικού Χρόνου\n Deep Rei
 nforcement Learning in a Real Time S
 trategy Environment\n Εξεταστική Επι
 τροπή\n Καθηγητής Γεώργιος Χαλκιαδάκ
 ης (επιβλέπων)\n Καθηγητής Μιχαήλ Λα
 γουδάκης \n Καθηγητής Θρασύβουλος Σπ
 υρόπουλος\n Περίληψη\n Τα παιχνίδια 
 στρατηγικής σε πραγματικό χρόνο, όπω
 ς το StarCraft II, ανήκουν στα πιο δ
 ύσκολα περιβάλλοντα για την τεχνητή 
 νοημοσύνη. Ο παίκτης πρέπει να μαζεύ
 ει πόρους, να χτίζει στρατό και να δ
 ίνει μάχες, όλα σε πραγματικό χρόνο,
  ενώ βλέπει μόνο το κομμάτι του χάρτ
 η που έχουν ήδη επισκεφθεί οι δικές 
 του μονάδες. Η παρούσα διπλωματική ε
 ργασία μελετά πώς ένας τεχνητός πράκ
 τορας μπορεί να εκπαιδευτεί σε τέτοι
 α παιχνίδια με τη βοήθεια της βαθιάς
  ενισχυτικής μάθησης, μιας τεχνικής 
 στην οποία ο πράκτορας βελτιώνει τη 
 συμπεριφορά του επιλέγοντας ενέργειε
 ς και αξιολογώντας την ανταμοιβή που
  λαμβάνει. \n Υλοποιούμε δύο τέτοιου
 ς πράκτορες, έναν από καθεμία από τι
 ς δύο κύριες κατηγορίες της βαθιάς ε
 νισχυτικής μάθησης και τους εκπαιδεύ
 ουμε υπό τις ίδιες συνθήκες σε τέσσε
 ρα σύντομα εκπαιδευτικά σενάρια του 
 StarCraft II που έχει δημοσιεύσει η 
 ερευνητική μονάδα γνωστής μεγάλης ετ
 αιρείας πληροφορικής. Για τη διασφάλ
 ιση μιας δίκαιης σύγκρισης, χρησιμοπ
 οιούμε μια πληρέστερη αναπαράσταση τ
 ης κατάστασης του περιβάλλοντος, προ
 σθέτουμε μια νέα δυνατότητα που επιτ
 ρέπει στον πράκτορα να επιλέγει ποια
  μονάδα θα ελέγξει και αποφεύγουμε τ
 η διαμόρφωση της ανταμοιβής, ώστε οι
  πράκτορες να μαθαίνουν αποκλειστικά
  από την πρωτογενή βαθμολογία του πα
 ιχνιδιού. \n Στα πιο εύκολα σενάρια 
 οι πράκτορες σημειώνουν επιδόσεις συ
 γκρίσιμες με άλλες μελέτες μικρής κλ
 ίμακας, καθώς επίσης χρησιμοποιούμε 
 σημαντικά μικρότερο υπολογιστικό πόρ
 ο σε σχέση με μεγάλες ερευνητικές ομ
 άδες. Στο πιο απαιτητικό σενάριο, όπ
 ου απαιτείται η ανάπτυξη οικονομίας 
 και η παραγωγή στρατού από το μηδέν,
  οι πράκτορες δεν καταφέρνουν να ανα
 πτύξουν μια αποτελεσματική στρατηγικ
 ή, κάτι που επιβεβαιώνει τη γνωστή α
 δυναμία της μεθόδου όταν οι ανταμοιβ
 ές είναι σπάνιες και ο χρονικός ορίζ
 οντας μεγάλος. Το τελευταίο κεφάλαιο
  συζητά τους περιορισμούς της υλοποί
 ησής μας και προτείνει κατευθύνσεις 
 για μελλοντική έρευνα, όπως ιεραρχικ
 ές μεθόδους, αναδρομική μνήμη και κα
 λύτερα σήματα ανταμοιβής.\n Abstract
  \n Real-time strategy games such as
  StarCraft II are difficult testbeds
  for artificial intelligence because
  a player has to manage economy, pro
 duction, movement, and combat at the
  same time. The player also acts und
 er partial observability, seeing onl
 y the parts of the map that their ow
 n units have already visited. This t
 hesis studies how an agent can learn
  to play in this environment, using 
 Deep Reinforcement Learning, a learn
 ing paradigm in which the agent impr
 oves by interacting with the game an
 d adapting its behaviour via employi
 ng Deep Neural Networks to evaluate 
 its decision policy based on reward 
 signals it receives from the environ
 ment. \n We implement two agents fro
 m different families of Deep Reinfor
 cement Learning: a Deep Q-Network ag
 ent and a synchronous Advantage Acto
 r-Critic agent. Both are implemented
  in TensorFlow 2 and trained under t
 he same conditions on four short PyS
 C2 mini-games released with DeepMind
 ’s StarCraft II research environment
 . To ensure a fair comparison, both 
 agents use the same two-channel scre
 en representation, the same action-a
 rgument factorisation, and the same 
 decision rate. We also add a unit-se
 lection head for the A2C agent and k
 eep the reward signal unshaped, so b
 oth agents learn only from the scori
 ng rules provided by PySC2. \n On th
 e easier scenarios the agents reach 
 scores that are competitive with oth
 er small-scale studies on the same e
 nvironment, despite the much smaller
  compute budget available for this p
 roject. On the hardest scenario, the
  agents do not learn an effective pr
 oduction policy. This result is cons
 istent with a known limitation of fl
 at approaches when rewards are rare 
 and the time horizon is long. The fi
 nal chapter discusses the limitation
 s of our implementation and suggests
  future research directions, such as
  hierarchical methods, recurrent mem
 ory, and better reward signals.  \n
STATUS:CONFIRMED
ORGANIZER;RSVP=FALSE;CN=TUC;CUTYPE=TUC:mailto:webmaster@tuc.gr
DTSTART:20260709T120000
DTEND:20260709T130000
TRANSP:OPAQUE
CLASS:DEFAULT
END:VEVENT
END:VCALENDAR