Κατηγοριοποίηση άποψης κειμένου για συγκεκριμένες οντότητες : πτυχιακή εργασία

Η παρούσα διπλωματική εργασία πραγματεύεται το πρόβλημα της εκτίμησης του προσανατολισμού της άποψης ενός κειμένου για συγκεκριμένες οντότητες. Οι βασικές μέθοδοι που χρησιμοποιούνται για την αυτόματη κατάταξή του, σε τρείς κατηγορίες (αρνητική, θετική, ουδέτερη) στηρίζονται σε γλωσσικά χαρακτηριστι...

Full description

Saved in:
Bibliographic Details
Main Author: Κουλουμπής, Ευθύμιος
Corporate Author: Πανεπιστήμιο Αιγαίου. Σχολή Θετικών Επιστημών. Τμήμα Μηχανικών Πληροφοριακών και Επικοινωνιακών Συστημάτων
Format: Thesis Book
Language:Greek
Published: 2008.
Subjects:
Online Access:http://hdl.handle.net/11610/8923
Tags: Add Tag
No Tags, Be the first to tag this record!

MARC

LEADER 00000cam a2200000 i 4500
001 1/102659
008 090313s2008 gr | ||| |||| ||gre||
035 |l 10103749 
040 |a GR-MyUA  |b gre  |e AACR2 
041 0 |a gre 
082 0 |a 006.31   |2 (22)  
100 1 |a Κουλουμπής, Ευθύμιος. 
245 1 0 |a Κατηγοριοποίηση άποψης κειμένου για συγκεκριμένες οντότητες :   |b πτυχιακή εργασία /   |c του Ευθύμιου Κουλουμπή ; επιβλέπων καθηγητής, Γεώργιος Βούρος.  
260 |c 2008.  
300 |a viii, 43 σ. :   |b σχ., πιν. ;   |c 30 εκ.  
500 |a Μέλη της εξεταστικής επιτροπής: Γεώργιος Βούρος, Κωνσταντίνος Στεργίου, Ευστάθιος Σταματάτος.  
502 |a Πτυχιακή εργασία – Πανεπιστήμιο Αιγαίου, Σάμος, 2008. 
504 |a Βιβλιογραφία: σ. 40-43.  
506 1 |a Διάθεση πλήρους κειμένου ;   |d Ενδοπανεπιστημιακή δημοσίευση.  
520 |a Η παρούσα διπλωματική εργασία πραγματεύεται το πρόβλημα της εκτίμησης του προσανατολισμού της άποψης ενός κειμένου για συγκεκριμένες οντότητες. Οι βασικές μέθοδοι που χρησιμοποιούνται για την αυτόματη κατάταξή του, σε τρείς κατηγορίες (αρνητική, θετική, ουδέτερη) στηρίζονται σε γλωσσικά χαρακτηριστικά του κειμένου και μηχανική μάθηση. Η προσέγγιση του προβλήματος στηρίζεται στη χρήση του αλγόριθμου ταξινόμησης SVM (Support Vector Machines), ο οποίος σύμφωνα με τα συμπεράσματα προηγούμενων εργασιών έχει καλές επιδόσεις στο συγκεκριμένο πρόβλημα. Η εργασία μελετά τρόπους εκμάθησης του ταξινομητή SVM με την εξαγωγή χρήσιμων όρων από το σώμα των κειμένων. Επίσης, για λόγους πληρότητας και ορθότητας υλοποιήθηκαν δύο ταξινομητές ένας για θεματική κατηγοριοποίηση σε επίπεδο κειμένου και ένας για κατηγοριοποίηση άποψης σε επίπεδο πρότασης. Πέραν αυτών των μεθόδων χρησιμοποιούνται και μέθοδοι εξαγωγής πληροφορίας για την δημιουργία θεματικής οντολογίας καθώς και τον εντοπισμό οντοτήτων. Οι μέθοδοι που αναπτύχθηκαν επικεντρώνονται στην ταξινόμηση εκτεταμένων και καλά δομημένων κειμένων, όπως οι κριτικές ταινιών, αλλά δοκιμάστηκαν και σε επίπεδο προτάσεων. Στην περίπτωση των κειμένων η απόδοση των ταξινομητών ήταν ικανοποιητική. Από τα πειράματα φάνηκε ότι οι μέθοδοι που χρησιμοποιήθηκαν για την κατηγοριοποίηση προτάσεων ήταν αποτελεσματικοί και θα μπορούσαν να αποδώσουν καλύτερα με τη χρήση πιο εξειδικευμένων μεθόδων, όπως η συντακτική ανάλυση κειμένου. 
520 |a In this thesis we consider the issue of automatic sentiment classification of documents for certain entities. The main methods used to classify the documents into three different classes (positive, negative, neutral) rely on linguistic attributes of the documents and machine learning. Our approach is based on the classification algorithm SVM (Support Vector Machine) that has been shown from previous studies to be highly effective at sentiment classification. We focus on the extraction of useful terms from the text, which are used to train the SVM classifier. Furthermore, for reasons of completeness we constructed two additional classifiers: one for topic categorization and the other for sentiment polarity categorization at the sentence level. In addition to these methods, data mining techniques are used for entity discovery in the documents. The methods we employed focus on classification of long, well-structured texts, like movie reviews, yet they were also tested in short abstracts as well as on individual sentences. The accuracy of the topic classifier was very satisfactory. The experimental results showed that the methods we developed for classifying sentences were decent and effective, though they could be improved by using more subtle techniques. 
610 2 0 |a University of the Aegean  |x Dissertations. 
650 0 0 |a Machine learning. 
650 0 0 |a Data mining. 
650 0 0 |a Ontology. 
650 0 0 |a Dissertations, Academic  |z Greece. 
700 1 |a Βούρος, Γεώργιος,  |e dgs 
710 2 |a Πανεπιστήμιο Αιγαίου.   |b Σχολή Θετικών Επιστημών.   |b Τμήμα Μηχανικών Πληροφοριακών και Επικοινωνιακών Συστημάτων. 
852 |a INST  |b SAMOS  |c DIATR  |e 20090313  |h 006.31 ΚΟΥ  |p 005300029132  |q 005300029132  |t DIE  |y 23 
852 |a INST  |b SAMOS  |c DIATR  |e 20090313  |h 006.31 ΚΟΥ  |p 005300029133  |q 005300029133  |t DIE  |y 23 
856 |u http://hdl.handle.net/11610/8923 
901 |a BIBL3-2009-1 
909 |a Σ  |b 155816 
909 |a Σ  |b 155817 
924 |a ΚΟΥΛΟΥΜΠΗΣ  |b ΕΥΘΥΜΙΟΣ  |y Σάμος  |z 2008-12 
970 |a ΚΟΣΙΕΡΗΣ  |b ΧΡΗΣΤΟΣ  |z 2009/03/13