BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//TUC//Events//EN
CALSCALE:GREGORIAN
BEGIN:VTIMEZONE
TZID:Europe/Athens
TZNAME:EEST
DTSTART:19700329T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0300
TZNAME:EET
DTSTART:19701025T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
CREATED:20260708T143350Z
LAST-MODIFIED:20260708T143350Z
DTSTAMP:20260717T023752Z
UID:1784245072@tuc.gr
SUMMARY:Παρουσίαση διπλωματικής εργασίας κ. 
 Χαράλαμπου Χούλη - Σχολή ΗΜΜΥ
LOCATION:
DESCRIPTION:https://www.tuc.gr/el/to-polytechnei
 o/ilektronikes-ypiresies/imerologio/
 imerologio-ekdiloseon-1?tx_tucevents
 2_tuceventsdisplay%5Baction%5D=show&
 tx_tucevents2_tuceventsdisplay%5Bcon
 troller%5D=Event&tx_tucevents2_tucev
 entsdisplay%5Bevent%5D=8562&cHash=3c
 edb9913b152302dc9e2bced6a9bce2\nΠΟΛΥ
 ΤΕΧΝΕΙΟ ΚΡΗΤΗΣ\n Σχολή Ηλεκτρολόγων 
 Μηχανικών και Μηχανικών Υπολογιστών\
 n Πρόγραμμα Προπτυχιακών Σπουδών\n Π
 ΑΡΟΥΣΙΑΣΗ ΔΙΠΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ\n Χα
 ράλαμπου Χούλη \n με θέμα\n Αλγόριθμ
 οι Επιγραμμικής Μάθησης για τη Βελτι
 στοποίηση Συστάσεων σε Περιβάλλοντα 
 Πολυεκπομπής Περιεχομένου \n Online 
 Learning Algorithms for Recommendati
 on Optimization in Multicast Content
  Environments\n Εξεταστική Επιτροπή\
 n Καθηγητής Θρασύβουλος Σπυρόπουλος 
 (επιβλέπων)\n Καθηγητής Μιχαήλ Γ. Λα
 γουδάκης\n Δρ Ιωάννης Πευκιανάκης, Α
 ρχιτέκτων Ασύρματων Συστημάτων στην 
 Apple \n Περίληψη\n Το ζωντανό περιε
 χόμενο και το περιεχόμενο συνεχούς ρ
 οής αποτελούν έναν από τους κυρίαρχο
 υς φόρτους εργασίας των σύγχρονων υπ
 οδομών επικοινωνιών. Στα συστήματα κ
 οινόχρηστης διανομής, σημαντικό μέρο
 ς του λειτουργικού κόστους δεν συνδέ
 εται με τον όγκο της κίνησης, αλλά μ
 ε το πλήθος των διακριτών ροών που π
 ρέπει να διατηρούνται ενεργές: μία κ
 αι μόνη ροή μπορεί να μοιράζεται μετ
 αξύ πολλών ταυτόχρονων θεατών, ενώ κ
 άθε πρόσθετη ενεργή ροή καταναλώνει 
 σπάνιους πόρους, όπως η χωρητικότητα
  μετακωδικοποίησης (transcoding) και
  η αντιγραφή στους εξυπηρετητές άκρη
 ς (edge replication). Τα συστήματα σ
 υστάσεων, τα οποία παραδοσιακά αντιμ
 ετωπίζονται ως μηχανισμοί εξατομίκευ
 σης προς τον χρήστη, διαμορφώνουν επ
 ίσης τον τρόπο με τον οποίο κατανέμε
 ται η ζήτηση μεταξύ των ροών και λει
 τουργούν συνεπώς ως μοχλός ελέγχου τ
 ου δικτύου: κατευθύνοντας έναν αφικν
 ούμενο χρήστη προς ένα ήδη ενεργό κα
 νάλι, το σύστημα συστάσεων μπορεί να
  συγκεντρώσει τη ζήτηση και να μειώσ
 ει το πλήθος των ενεργών ροών, υπό τ
 ην προϋπόθεση ότι διατηρείται η ποιό
 τητα εμπειρίας του χρήστη. Η παρούσα
  διπλωματική εργασία μελετά το προκύ
 πτον πρόβλημα συστάσεων φιλικών προς
  την πολυεκπομπή (multicast-friendly
 ), το οποίο διατυπώνεται ως ελαχιστο
 ποίηση υπό περιορισμούς του χρονικά 
 μέσου πλήθους ενεργών καναλιών, με κ
 άτω φράγμα στη μέση χρησιμότητα που 
 παρέχεται ανά άφιξη. Το κεντρικό ερώ
 τημα σε όλη την εργασία είναι κατά π
 όσον μια επιγραμμική (online) πολιτι
 κή με επίγνωση της κατάστασης του συ
 στήματος μπορεί να ικανοποιεί αυτό τ
 ο κατώφλι ποιότητας εμπειρίας, διατη
 ρώντας ταυτόχρονα αυστηρά λιγότερα ε
 νεργά κανάλια από μια ισχυρή στατική
  πολιτική αναφοράς.\n Το πρόβλημα δι
 ατυπώνεται ως δεσμευμένη μαρκοβιανή 
 διαδικασία αποφάσεων (Constrained Ma
 rkov Decision Process, CMDP) επάνω σ
 ε ένα μοντέλο δραστηριότητας χρηστών
  ON/OFF συνεχούς χρόνου, και αναπτύσ
 σεται μια ακολουθία δυναμικών πολιτι
 κών αυξανόμενης κλίμακας έναντι δύο 
 στατικών πολιτικών αναφοράς: μιας άπ
 ληστης ευρετικής κάλυψης συνόλου (gr
 eedy set-cover) και μιας αναλυτικά β
 ελτιστοποιημένης πολιτικής κατωφλίου
  α, οι παράμετροι της οποίας προκύπτ
 ουν εκτός γραμμής (offline) μέσω μια
 ς προσέγγισης μέσου πεδίου (mean-fie
 ld). Το πρόβλημα μικρής κλίμακας επι
 λύεται αρχικά με ακρίβεια μέσω επανά
 ληψης τιμών (Value Iteration), απομο
 νώνοντας τον μηχανισμό, επαναχρησιμο
 ποίηση των ενεργών καναλιών και αποφ
 υγή πρόωρων ενεργοποιήσεων, μέσω του
  οποίου η προνοητικότητα μειώνει το 
 κόστος. Για την επίτευξη ρεαλιστικών
  κλιμάκων, η πινακοποιημένη λύση αντ
 ικαθίσταται από ένα βαθύ δίκτυο Q (D
 eep Q-Network, DQN) που εκπαιδεύεται
  απευθείας στη δυναμική της δραστηρι
 ότητας των χρηστών, με τον περιορισμ
 ό ποιότητας εμπειρίας να επιβάλλεται
  εντός του αλγορίθμου μάθησης μέσω λ
 αγκρανζιανής, βελτιστοποιούμενης με 
 δυϊκή ανάβαση (dual ascent). Σημαντι
 κό μέρος της εργασίας είναι διαγνωστ
 ικό: στο ομοιογενές, συμμετρικό καθε
 στώς αποδεικνύεται ότι υπάρχει εφικτ
 ή μαθημένη (learned)  πολιτική που υ
 περτερεί της στατικής πολιτικής αναφ
 οράς και ότι είναι αναπαραστάσιμη απ
 ό το δίκτυο, ωστόσο η εκπαίδευση από
  ψυχρή εκκίνηση (cold start) αδυνατε
 ί να τη φθάσει. Το εμπόδιο αυτό εντο
 πίζεται, δι' αποκλεισμού, στην κλάση
  των ντετερμινιστικών πολιτικών argm
 ax, η οποία δεν μπορεί να διατηρήσει
  τη μεικτή πολιτική που απαιτεί το β
 έλτιστο σημείο μείωσης κόστους επάνω
  σε εναλλάξιμες καταστάσεις. Η άρση 
 αυτής της εναλλαξιμότητας μέσω ετερο
 γένειας στους ρυθμούς δραστηριότητας
 , σε συνδυασμό με μια αρχιτεκτονική 
 ανά κανάλι (channel-wise architectur
 e) αναλλοίωτη σε μεταθέσεις, ένα χαρ
 ακτηριστικό επιμονής (persistence) α
 νά κανάλι και έναν διαβαθμισμένο περ
 ιορισμό, επιτρέπει στη μαθημένη πολι
 τική να βελτιώνει αυστηρά τη στατική
  πολιτική αναφοράς, παραμένοντας εφι
 κτή από ψυχρή εκκίνηση. Μια ανάλυση 
 ανά απόφαση αποδίδει το κέρδος στην 
 εξαρτώμενη από την κατάληψη επαναχρη
 σιμοποίηση μακρόβιων καναλιών, την ο
 ποία ο στατικός κανόνας δεν μπορεί ν
 α αναπαραστήσει, χωρίς καμία θυσία σ
 τη χρησιμότητα του χρήστη. Ένας έλεγ
 χος με μυωπική πολιτική δείχνει ότι 
 το πλεονέκτημα διατηρείται και με μη
 δενικό συντελεστή έκπτωσης, εντοπίζο
 ντάς το στην αναπαράσταση της κατάστ
 ασης και όχι στο βάθος σχεδιασμού. Τ
 ο πλεονέκτημα είναι υπό συνθήκη και 
 όχι καθολικό: φέρεται από την ετερογ
 ένεια των ρυθμών δραστηριότητας, μια
  δομή που η στατική πολιτική αναφορά
 ς δεν μπορεί να αναπαραστήσει αλλά η
  μαθημένη πολιτική μπορεί να εκμεταλ
 λευθεί, ενώ η ασυμμετρία δημοτικότητ
 ας απορροφάται απευθείας στο βέλτιστ
 ο της ίδιας της πολιτικής αναφοράς. 
 Η εργασία, συνεπώς, τεκμηριώνει ότι 
 ένα μαθημένο σύστημα συστάσεων που σ
 έβεται τον περιορισμό μπορεί να υπερ
 τερεί μιας ισχυρής στατικής πολιτική
 ς αναφοράς, και προσδιορίζει την ανα
 παραστατική ασυμμετρία που απαιτεί α
 υτή η βελτίωση.\n Abstract \n Live a
 nd streamed content constitutes one 
 of the dominant workloads of modern 
 communication infrastructure. In sha
 red delivery systems a substantial p
 art of the operating cost is tied no
 t to the volume of traffic but to th
 e number of distinct streams that mu
 st be kept active: a single stream c
 an be shared across many co-viewers 
 while each additional active stream 
 draws on scarce resources such as tr
 anscoding capacity and edge replicat
 ion. Recommendation systems, traditi
 onally treated as user-facing person
 alisation mechanisms, also shape how
  demand is distributed across stream
 s and therefore act as a network-con
 trol lever: by steering an arriving 
 user toward an already-active channe
 l, the recommender can consolidate d
 emand and reduce the number of activ
 e streams, provided the user's quali
 ty of experience is preserved. This 
 thesis studies the resulting multica
 st-friendly recommendation problem, 
 formalised as the constrained minimi
 sation of the time-averaged number o
 f active channels subject to a lower
  bound on the mean utility delivered
  per arrival. The central question t
 hroughout is whether an online, stat
 e-aware policy can meet this\n quali
 ty-of-experience floor while sustain
 ing strictly fewer active channels t
 han a strong static benchmark.\n The
  problem is cast as a constrained Ma
 rkov decision process over a continu
 ous-time ON/OFF user-activity model,
  and a sequence of dynamic policies 
 of increasing scale is developed aga
 inst two static baselines: a greedy 
 set-cover heuristic and an analytica
 lly optimised α-threshold policy who
 se parameters are derived offline th
 rough a mean-field approximation. Th
 e small-scale problem is first solve
 d exactly by value iteration, isolat
 ing the mechanism, reuse of active c
 hannels and avoidance of premature a
 ctivations, by which foresight reduc
 es cost. To reach realistic scales t
 he tabular solution is replaced by a
  deep Q-network trained directly aga
 inst the activity dynamics, with the
  quality-of-experience constraint en
 forced inside the learner through a 
 Lagrangian relaxation optimised by d
 ual ascent. A substantial part of th
 e work is diagnostic: in the homogen
 eous, symmetric regime a feasible le
 arned policy that beats the static b
 enchmark is shown to exist and to be
  representable by the network, but c
 old-start training cannot reach it, 
 and this obstruction is traced by el
 imination to a deterministic-argmax 
 policy class that cannot hold the mi
 xing policy the cost-improving optim
 um requires over exchangeable states
 . Breaking this exchangeability thro
 ugh activity-rate heterogeneity, tog
 ether with a permutation-invariant c
 hannel-wise architecture, a per-chan
 nel persistence feature, and a grade
 d constraint, enables the learned po
 licy to strictly improve on the stat
 ic benchmark while remaining feasibl
 e from a cold start. A per-decision 
 analysis attributes the gain to occu
 pancy-conditioned reuse of long-live
 d channels that the static rule cann
 ot represent, delivered without any 
 sacrifice in user utility. A myopic-
 policy control shows the advantage s
 urvives with the discount removed, l
 ocating it in the state representati
 on rather than planning depth. The a
 dvantage is conditional rather than 
 universal: it is carried by activity
 -rate heterogeneity, a structure the
  static benchmark cannot represent b
 ut the learned policy can exploit, w
 hereas popularity skew is absorbed d
 irectly into the benchmark's own opt
 imum. The thesis therefore establish
 es that a learned, constraint-respec
 ting recommender can outperform a st
 rong static benchmark  and identifie
 s the representational asymmetry tha
 t this improvement requires.\n Meeti
 ng ID: 92187241010\n Password: 45775
 3\n
STATUS:CONFIRMED
ORGANIZER;RSVP=FALSE;CN=TUC;CUTYPE=TUC:mailto:webmaster@tuc.gr
DTSTART:20260710T133000
DTEND:20260710T143000
TRANSP:OPAQUE
CLASS:DEFAULT
END:VEVENT
END:VCALENDAR