Multivariate Analysis Techniques & Methods for Missing Data
Ο σκοπός αυτής της διπλωματικής εργασίας είναι η παρουσίαση τεχνικών Πολυμεταβλητής Ανάλυσης και ιδιαίτερα αλγορίθμων συσταδοποίησης (clustering). Θα περιγράψουμε μεθόδους για Ελλιπή Δεδομένα και θα εξετάσουμε πως αυτά επηρεάζουν τις στατιστικές διαδικασίες. Στο τέλος της εργασίας αυτής θα αναπτύξου...
Saved in:
| Main Authors: | , |
|---|---|
| Other Authors: | |
| Language: | en_US |
| Published: |
2018
|
| Subjects: | |
| Online Access: | http://hdl.handle.net/11610/18305 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| Summary: | Ο σκοπός αυτής της διπλωματικής εργασίας είναι η παρουσίαση τεχνικών Πολυμεταβλητής Ανάλυσης και ιδιαίτερα αλγορίθμων συσταδοποίησης (clustering). Θα περιγράψουμε μεθόδους για Ελλιπή Δεδομένα και θα εξετάσουμε πως αυτά επηρεάζουν τις στατιστικές διαδικασίες. Στο τέλος της εργασίας αυτής θα αναπτύξουμε δύο νέες μεθόδους υποκατάστασης ελλιπών δεδομένων, οι οποίες ονομάζονται Partition Mean Imputation και Partition Regression Imputation.
Στο Κεφάλαιο 1 θα δώσουμε τη σημειογραφία των πολυμεταβητών δεδομένων, θα περιγράψουμε πολυμεταβλητές κατανομές όπως η πολυμεταβλητή κανονική κατανομή, η Whishart και η t-τετράγωνο του Hotelling.
Στο Κεφάλαιο 2 θα δούμε τρεις τεχνικές πολυμεταβλητής ανάλυσης, την Ανάλυση Κυρίων Συνιστωσών (Principal Component Analysis ) η οποία χρησιμοποιείται για μείωση διάστασης, την Γραμμική Διαχωριστική Ανάλυση ( Linear Discriminant Analysis ) και τη Συσταδοποίηση (Clustering).
Στο Κεφάλαιο 3 θα περιγράψουμε μεθόδους για Ελλιπή Δεδομένα και τους μηχανισμούς που τα δημιουργούν. Το ενδιαφέρον μας θα επικεντρωθεί στις Μεθόδους Υποκατάστασης (Imputation Methods) .
Στο Κεφάλιο 4 θα αναλύσουμε τρεις αλγορίθμους ευφυούς συσταδοποίησης (Intelligent Clustering Algorithms), οι οποίοι βελτιώνουν την ακρίβεια της τελικής διαμέρισης χρησιμοποιώντας εξωτερικές πηγές πληροφορίας. Αυτοί οι αλγόριθμοι αποτελούν τροποποιήσεις του διάσημου K-means αλγόριθμου με τέτοιο τρόπο ώστε να ενσωματώνουν στη ρουτίνα τους περιορισμούς. Τα είδη αυτά των περιορισμών χωρίζονται στις κατηγορίες Hard Constraints και Soft Constraints. Ένας σημαντικός αλγόριθμος που θα περιγράψουμε στο κεφάλαιο αυτό έιναι ο KSC algorithm ο οποίος μπορεί να χρησιμοποιηθεί σε δεδομένα τα οποία περιέχουν Ελλείπουσες Τιμές. Ο κώδικας του αλγόριθμου αυτού δημιουργήθηκε στη γλώσσα προγραμματισμού R για τους σκοπούς της διπλωματικής αυτής.
Στο Κεφάλαιο 5 θα αναπτύξουμε μία νέα μεθοδολογία η οποία βελτιώνει τις ήδη υπάρχουσες Μεθόδους Υποκατάστασης Ελλιπών Δεδομένων. Με τη χρήση της μεθοδολογίας αυτής θα δημιουργήσουμε δύο νέες μεθόδους για τις οποίες επίσης δημιουργήθηκε ο κώδικας στη γλώσσα προγραμματισμού R. |
|---|