Συντάχθηκε 02-09-2026 09:24
Ενημερώθηκε:
15-09-2026 08:36
Τόπος:
Σύνδεσμος τηλεδιάσκεψης
Έναρξη: 18/09/2026 12:00
Λήξη: 18/09/2026 13:00
ΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗΣ
Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών
Πρόγραμμα Προπτυχιακών Σπουδών
ΠΑΡΟΥΣΙΑΣΗ ΔΙΠΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ
Όλγας Λαντζουράκη
με θέμα
Μοντέλο Παραγωγής Νοηματικής Γλώσσας: Προσεγγίσεις Ανάκτησης και Παραγωγικές Μέθοδοι
Text to Sign Language Production Model: Retrieval Based and Generative Approaches
Εξεταστική Επιτροπή
Αναπληρωτής Καθηγητής Ευάγγελος Καλογεράκης (επιβλέπων)
Καθηγήτρια Aικατερίνη Μανιά
Καθηγητής Μιχαήλ Λαγουδάκης
Περίληψη
Η Παραγωγή Νοηματικής Γλώσσας (Sign Language Production, SLP) παράγει κίνηση νοηματικής από γραπτό κείμενο και παραμένει σημαντικά λιγότερο διερευνημένη από την αναγνώριση, παρά τις δυνατότητές της να βελτιώσει την προσβασιμότητα για τις κοινότητες των κωφών. Η εργασία συνεισφέρει έξι ολοκληρωμένα συστήματα SLP που μετατρέπουν ελεύθερο κείμενο σε συνεχή δισδιάστατη κινούμενη απεικόνιση σκελετού, σε τρεις οικογένειες: ανάκτηση πραγματικού βίντεο εκπαίδευσης, υβριδική προσέγγιση που εκλεπτύνει παραγωγικά το ανακτημένο βίντεο, και πλήρη σύνθεση με διαχωρισμένο διανυσματικά κβαντισμένο αυτοκωδικοποιητή και αιτιακό μετασχηματιστή κίνησης. Και τα έξι εκπαιδεύτηκαν στο How2Sign Αμερικανικής Νοηματικής και επανεκπαιδεύτηκαν στο PHOENIX14T, όπου ο επίσημος μηχανισμός αξιολόγησης του διαγωνισμού SLRTP2025 επιτρέπει άμεση σύγκριση με δημοσιευμένες εργασίες. Ολόκληρη η ροή αναπαράγεται σε λιγότερο από δεκαπέντε ώρες σε μία καταναλωτική κάρτα γραφικών.
Στη μετρική Total Distance του διαγωνισμού, που ποσοτικοποιεί πόση κίνηση νοηματικής παράγει ένα σύστημα, τα συστήματα ανάκτησης πλησιάζουν την πραγματική νοηματική περισσότερο από κάθε δημοσιευμένη συμμετοχή, συμπεριλαμβανομένου του νικητή του διαγωνισμού, ενώ στην ίδια μετρική τα παραγωγικά συστήματα βελτιώνονται έναντι της γραμμής βάσης Progressive Transformer. Οι τρεις οικογένειες αποδεικνύονται συμπληρωματικές και όχι ιεραρχικά κατατασσόμενες: η ανάκτηση προσφέρει αυθεντική ανθρώπινη άρθρωση, η υβριδική διατηρεί καλύτερα τον ρυθμό της φυσικής νοηματικής, και η πλήρης σύνθεση γενικεύει πέρα από το σύνολο εκπαίδευσης. Η διόρθωση μιας διαρροής δεδομένων σε επίπεδο πρότασης στον τυπικό διαχωρισμό του How2Sign θεμελιώνει τις συγκρίσεις αυτές σε στέρεη βάση.
Δύο ακόμη διαγνωστικά αποτελέσματα αφορούν την ίδια την αξιολόγηση. Οι μετρικές θέσης, στη μορφή ενιαίας αναφοράς, αποτυπώνουν την αληθοφάνεια της στάσης, την οποία μετρούν αξιόπιστα, και όχι τη σημασιολογική ορθότητα ενώ οι βαθμολογίες αντίστροφης μετάφρασης εξαρτώνται από το αν ο αναγνωριστής έχει συναντήσει τις στάσεις κατά την εκπαίδευση, καθώς το BLEU-4 του σε στάσεις από το δικό του σύνολο εκπαίδευσης είναι 6,2 φορές υψηλότερο από ό,τι σε άγνωστες στάσεις. Τα ευρήματα αυτά καθορίζουν τι οφείλει να ελέγχει μια αξιόπιστη σημασιολογική μετρική και οριοθετούν τι μπορεί να πιστωθεί στα έξι συστήματα. Η κατασκευή μιας τέτοιας μετρικής αποτελεί την κύρια κατεύθυνση για μελλοντική έρευνα.
Abstract
Sign Language Production (SLP) generates signing motion from written text and remains far less explored than recognition, despite its potential to improve accessibility for deaf communities. This thesis develops six complete SLP systems that turn free text into a continuous two-dimensional skeleton animation, within the scope of three families: retrieval of a real training clip, a hybrid that refines a retrieved clip generatively, and full synthesis from a split vector-quantised autoencoder and a causal motion transformer. All six are trained on the How2Sign corpus of American Sign Language and retrained on the German PHOENIX14T corpus, where the official evaluator of the SLRTP2025 challenge allows direct comparison against published work. The complete pipeline reproduces in under fifteen hours on a single consumer GPU.
On Total Distance, the challenge measure of how much signing motion a system produces, the retrieval systems come closer to real signing than every published entry including the challenge winner, and on that same measure the generative systems improve on the Progressive Transformer baseline. The three families represent complimentary approaches rather than a rank order: the retrieval systems provide genuine human articulation, the hybrid approach best preserves the tempo of natural signing, and the fully generative systems extend to sentences absent from the training corpus. Correcting a sentence-level data leak in the standard How2Sign split places these comparisons on sound footing
Two further diagnostic results regard evaluation itself. Positional metrics in their single-reference form are shown to capture pose plausibility, which they measure reliably, rather than semantic correctness. Back-translation scores depend on whether the recognizer has seen the poses in training, since its BLEU-4 on poses from its own training partition is 6.2 times that on unseen poses. Together these establish what a trustworthy semantic metric must control for, and delimit what the six systems can be credited with. Constructing such a metric is the primary direction for future work.