Κατηγοριοποίηση άποψης κειμένου για συγκεκριμένες οντότητες : πτυχιακή εργασία

Η παρούσα διπλωματική εργασία πραγματεύεται το πρόβλημα της εκτίμησης του προσανατολισμού της άποψης ενός κειμένου για συγκεκριμένες οντότητες. Οι βασικές μέθοδοι που χρησιμοποιούνται για την αυτόματη κατάταξή του, σε τρείς κατηγορίες (αρνητική, θετική, ουδέτερη) στηρίζονται σε γλωσσικά χαρακτηριστι...

Πλήρης περιγραφή

Αποθηκεύτηκε σε:
Λεπτομέρειες βιβλιογραφικής εγγραφής
Κύριος συγγραφέας: Κουλουμπής, Ευθύμιος
Συγγραφή απο Οργανισμό/Αρχή: Πανεπιστήμιο Αιγαίου. Σχολή Θετικών Επιστημών. Τμήμα Μηχανικών Πληροφοριακών και Επικοινωνιακών Συστημάτων
Μορφή: Thesis Βιβλίο
Γλώσσα:Greek
Δημοσίευση: 2008.
Θέματα:
Διαθέσιμο Online:http://hdl.handle.net/11610/8923
Ετικέτες: Προσθήκη ετικέτας
Δεν υπάρχουν, Καταχωρήστε ετικέτα πρώτοι!
Περιγραφή
Περίληψη:Η παρούσα διπλωματική εργασία πραγματεύεται το πρόβλημα της εκτίμησης του προσανατολισμού της άποψης ενός κειμένου για συγκεκριμένες οντότητες. Οι βασικές μέθοδοι που χρησιμοποιούνται για την αυτόματη κατάταξή του, σε τρείς κατηγορίες (αρνητική, θετική, ουδέτερη) στηρίζονται σε γλωσσικά χαρακτηριστικά του κειμένου και μηχανική μάθηση. Η προσέγγιση του προβλήματος στηρίζεται στη χρήση του αλγόριθμου ταξινόμησης SVM (Support Vector Machines), ο οποίος σύμφωνα με τα συμπεράσματα προηγούμενων εργασιών έχει καλές επιδόσεις στο συγκεκριμένο πρόβλημα. Η εργασία μελετά τρόπους εκμάθησης του ταξινομητή SVM με την εξαγωγή χρήσιμων όρων από το σώμα των κειμένων. Επίσης, για λόγους πληρότητας και ορθότητας υλοποιήθηκαν δύο ταξινομητές ένας για θεματική κατηγοριοποίηση σε επίπεδο κειμένου και ένας για κατηγοριοποίηση άποψης σε επίπεδο πρότασης. Πέραν αυτών των μεθόδων χρησιμοποιούνται και μέθοδοι εξαγωγής πληροφορίας για την δημιουργία θεματικής οντολογίας καθώς και τον εντοπισμό οντοτήτων. Οι μέθοδοι που αναπτύχθηκαν επικεντρώνονται στην ταξινόμηση εκτεταμένων και καλά δομημένων κειμένων, όπως οι κριτικές ταινιών, αλλά δοκιμάστηκαν και σε επίπεδο προτάσεων. Στην περίπτωση των κειμένων η απόδοση των ταξινομητών ήταν ικανοποιητική. Από τα πειράματα φάνηκε ότι οι μέθοδοι που χρησιμοποιήθηκαν για την κατηγοριοποίηση προτάσεων ήταν αποτελεσματικοί και θα μπορούσαν να αποδώσουν καλύτερα με τη χρήση πιο εξειδικευμένων μεθόδων, όπως η συντακτική ανάλυση κειμένου.
In this thesis we consider the issue of automatic sentiment classification of documents for certain entities. The main methods used to classify the documents into three different classes (positive, negative, neutral) rely on linguistic attributes of the documents and machine learning. Our approach is based on the classification algorithm SVM (Support Vector Machine) that has been shown from previous studies to be highly effective at sentiment classification. We focus on the extraction of useful terms from the text, which are used to train the SVM classifier. Furthermore, for reasons of completeness we constructed two additional classifiers: one for topic categorization and the other for sentiment polarity categorization at the sentence level. In addition to these methods, data mining techniques are used for entity discovery in the documents. The methods we employed focus on classification of long, well-structured texts, like movie reviews, yet they were also tested in short abstracts as well as on individual sentences. The accuracy of the topic classifier was very satisfactory. The experimental results showed that the methods we developed for classifying sentences were decent and effective, though they could be improved by using more subtle techniques.
Περιγραφή τεκμηρίου:Μέλη της εξεταστικής επιτροπής: Γεώργιος Βούρος, Κωνσταντίνος Στεργίου, Ευστάθιος Σταματάτος.
Φυσική περιγραφή:viii, 43 σ. : σχ., πιν. ; 30 εκ.
Βιβλιογραφία:Βιβλιογραφία: σ. 40-43.
Πρόσβαση:Διάθεση πλήρους κειμένου ;