Node classification in social networks : πτυχιακή εργασία
Το παρόν έγγραφο ασχολείται με το πρόβλημα της κατηγοριοποίησης κόμβων σε μεγάλους γράφους που προκύπτουν στο πλαίσιο των κοινωνικών δικτύων. Ένας κόμβος μπορεί να αντιπροσωπεύει χρήστες ή web περιεχόμενο (π.χ. δημοσιεύσεις χρηστών) ενώ οι ετικέτες αντιπροσωπεύουν τα χαρακτηριστικά των κόμβων. Σε με...
Αποθηκεύτηκε σε:
| Κύριος συγγραφέας: | |
|---|---|
| Συγγραφή απο Οργανισμό/Αρχή: | |
| Μορφή: | Thesis Βιβλίο |
| Γλώσσα: | English |
| Δημοσίευση: |
2014.
|
| Θέματα: | |
| Διαθέσιμο Online: | http://hdl.handle.net/11610/8825 |
| Ετικέτες: |
Προσθήκη ετικέτας
Δεν υπάρχουν, Καταχωρήστε ετικέτα πρώτοι!
|
| Περίληψη: | Το παρόν έγγραφο ασχολείται με το πρόβλημα της κατηγοριοποίησης κόμβων σε μεγάλους γράφους που προκύπτουν στο πλαίσιο των κοινωνικών δικτύων. Ένας κόμβος μπορεί να αντιπροσωπεύει χρήστες ή web περιεχόμενο (π.χ. δημοσιεύσεις χρηστών) ενώ οι ετικέτες αντιπροσωπεύουν τα χαρακτηριστικά των κόμβων. Σε μεγάλους γράφους παρατηρείται πολύ συχνά η περίπτωση που μόνο ένα υποσύνολο των κόμβων είναι επισυνημμένο με ετικέτες. Το κύριο πρόβλημα είναι πώς μπορούμε να χρησιμοποιήσουμε τις διαθέσιμες πληροφορίες από τη δομή του δικτύου, το περιεχόμενο ή τις ετικέτες των κόμβων, ώστε να επισυνάψουμε ετικέτες για όλους τους κόμβους του δικτύου. Πιο συγκεκριμένα, εστιάζουμε σε δύο σύνολα δεδομένων από το Twitter, το ένα σχετίζεται με μία χημική επίθεση στη Συρία και το άλλο με τον τυφώνα Sandy. Ο βασικός μας στόχος είναι να κατηγοριοποιήσουμε τους κόμβους χρηστών από το πρώτο δίκτυο στις κλάσεις δημοφιλής και επιρροής και να κατηγοριοποιήσουμε τις δημοσιεύσεις των χρηστών από το δεύτερο δίκτυο σε σχέση με το Retweetability δηλαδή να προσδιορίσουμε αν μια δημοσίευση θα γίνει retweeted ή όχι και σε ποιο βαθμό (χαμηλό, μεσαίο, υψηλό). Εν συνέχεια, ορίσαμε τις ετικέτες των κόμβων-χρηστών με βάση τον βαθμό τους στο δίκτυο των απαντήσεων και των retweets, και αντίστοιχα τις ετικέτες των δημοσιεύσεων ανάλογα με τον αριθμό των retweets. Επιπλέον, χρησιμοποιήσαμε ποικίλα χαρακτηριστικά σε μια επιβλεπόμενη κατηγοριοποίηση χρησιμοποιώντας Μηχανές Διανυσμάτων Υποστήριξης και εντοπίσαμε τα πιο σημαντικά χαρακτηριστικά για τα πειράματα. Μια λεπτομερής περιγραφή καθώς και απεικονίσεις των κοινωνικών δικτύων παρέχονται επίσης μαζί με μια ανάλυση συσχέτισης μεταξύ των διαφόρων ειδών σχέσεων μεταξύ των χρηστών. The present document deals with the problem of node classification in large graphs that arise in the context of social networks. A node may rep- resent either users or web content (e.g. user posts) and the labels represent characteristics of the nodes. In large graphs it is very often the case that only a subset of nodes are labeled. The main problem is how to use available information from the network structure, content or labels of the nodes in order to be able to assign labels to all the nodes in the graph. In particular, we focus on two real-world datasets from Twitter, one related to a chemical attack in Syria and one related to Sandy hurricane. Our main goal is to classify user nodes in these networks in terms of Popularity and Influence and to classify user posts in terms of Retweetability i.e. identify posts that are likely to be retweeted or not and to which extend (low, medium, high). To do so, we define user labels based on the the degree measure in the net- work of replies and retweets respectively, and post labels according to their number of retweets. We experiment with a variety of features in a super- vised classification using Support Vector Machines and we identify the most important features for the tasks. A detailed description and visualizations of the social networks at hand are also provided along with a correlation analysis between the different type of relations between users. |
|---|---|
| Περιγραφή τεκμηρίου: | Μέλη της εξεταστικής επιτροπής: Μανώλης Μαραγκουδάκης, Ευστάθιος Σταματάτος, Εργίνα Καβαλλιεράτου. |
| Φυσική περιγραφή: | 58 σ. : σχέδια ; 30 εκ. |
| Βιβλιογραφία: | Βιβλιογραφία: σ. 56-58. |
| Πρόσβαση: | Διάθεση πλήρους κειμένου ; |