Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων

Η ραγδαία αύξηση του όγκου των δεδομένων που ανεβαίνουν στο διαδίκτυο καθιστά πιο δύσκολη τη διαχείριση των πληροφοριών που φέρνει μαζί του, με νέες τεχνολογίες που εισάγονται στον τομέα των Big Data για τον σκοπό αυτό. Με την πλειονότητα των δεδομένων στο διαδίκτυο να έχουν τη μορφή μη δομημένου κε...

Πλήρης περιγραφή

Αποθηκεύτηκε σε:
Λεπτομέρειες βιβλιογραφικής εγγραφής
Κύριος συγγραφέας: Τριπιντή-Ιγνατίου, Ηρώ
Άλλοι συγγραφείς: Σταματάτος, Ευστάθιος
Γλώσσα:el_GR
Δημοσίευση: 2024
Θέματα:
Διαθέσιμο Online:http://hdl.handle.net/11610/26379
Ετικέτες: Προσθήκη ετικέτας
Δεν υπάρχουν, Καταχωρήστε ετικέτα πρώτοι!
_version_ 1828460853898248192
author Τριπιντή-Ιγνατίου, Ηρώ
author2 Σταματάτος, Ευστάθιος
author_facet Σταματάτος, Ευστάθιος
Τριπιντή-Ιγνατίου, Ηρώ
author_sort Τριπιντή-Ιγνατίου, Ηρώ
collection DSpace
description Η ραγδαία αύξηση του όγκου των δεδομένων που ανεβαίνουν στο διαδίκτυο καθιστά πιο δύσκολη τη διαχείριση των πληροφοριών που φέρνει μαζί του, με νέες τεχνολογίες που εισάγονται στον τομέα των Big Data για τον σκοπό αυτό. Με την πλειονότητα των δεδομένων στο διαδίκτυο να έχουν τη μορφή μη δομημένου κειμένου, ένας νέος κλάδος έχει αναδυθεί από την εξόρυξη δεδομένων. Το Text Mining θεωρείται ως ένα πολύ σημαντικό εξειδικευμένο εργαλείο στον τρόπο ανάλυσης δεδομένων σε μορφή κειμένου. Τα δεδομένα σε κείμενο δεν είναι αυστηρά καθορισμένοι και εύκολα διαχειρίσιμοι πόροι, ενώ οι ασάφειες και η διαρκώς μεταβαλλόμενη φύση του περιεχομένου οδηγούν σε δυσκολία στην κατανόηση και την εξόρυξη δεδομένων. Σημαντικό στάδιο και θεμέλιος λίθος για στην εξόρυξη κειμένου αποτελεί η Ταξινόμηση Κειμένου/Text Classification. Μέσω της μηχανικής μάθησης, η Ταξινόμηση Κειμένων καλείται να δώσει λύση στο ζήτημα της διαχείρισης και κατηγοριοποίησης κειμένων σε ηλεκτρονική μορφή. Η ταξινόμηση κειμένων γίνεται συνήθως μέσω μιας ποικιλίας αλγορίθμων και διαδικασιών που αποτελούν διαφορετικά μοντέλα. Όλα αυτά τα μοντέλα απαιτούν μια διαδικασία «εκπαίδευσης» και «δοκιμής» όπου τους δίνεται ένα σύνολο κειμένων και πρέπει να τα κατηγοριοποιήσουν χωρίς λάθη. Σε αυτό το σημείο, γίνεται η σύγκριση απόδοσης των αλγορίθμων Ταξινόμησης Κειμένων, όπου γνωστά και καθιερωμένα μοντέλα Ταξινόμησης Κειμένων δοκιμάζονται στο ίδιο σύνολο κειμένων και αξιολογείται η απόδοσή τους. Σε αυτή την εργασία γίνεται υλοποίηση του αλγορίθμου (Fei, et al., 2016) και στην συνέχεια γίνονται πειράματα κάνοντας χρήση των datasets που αναφέρονται στο (Pritsos. et al., 2019) με σκοπό να συγκριθούν τα αποτελέσματα.
id oai:hellanicus.lib.aegean.gr:11610-26379
institution Hellanicus
language el_GR
publishDate 2024
record_format dspace
spelling oai:hellanicus.lib.aegean.gr:11610-263792024-06-19T09:05:34Z Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων Τριπιντή-Ιγνατίου, Ηρώ Σταματάτος, Ευστάθιος Πληροφοριακά και Επικοινωνιακά Συστήματα αλγόριθμοι ταξινόμησης κειμένου εξόρυξη πληροφορίας μηχανική μάθηση machine learning text classification algorithms data mining Text data mining Machine learning Text processing (Computer science) Η ραγδαία αύξηση του όγκου των δεδομένων που ανεβαίνουν στο διαδίκτυο καθιστά πιο δύσκολη τη διαχείριση των πληροφοριών που φέρνει μαζί του, με νέες τεχνολογίες που εισάγονται στον τομέα των Big Data για τον σκοπό αυτό. Με την πλειονότητα των δεδομένων στο διαδίκτυο να έχουν τη μορφή μη δομημένου κειμένου, ένας νέος κλάδος έχει αναδυθεί από την εξόρυξη δεδομένων. Το Text Mining θεωρείται ως ένα πολύ σημαντικό εξειδικευμένο εργαλείο στον τρόπο ανάλυσης δεδομένων σε μορφή κειμένου. Τα δεδομένα σε κείμενο δεν είναι αυστηρά καθορισμένοι και εύκολα διαχειρίσιμοι πόροι, ενώ οι ασάφειες και η διαρκώς μεταβαλλόμενη φύση του περιεχομένου οδηγούν σε δυσκολία στην κατανόηση και την εξόρυξη δεδομένων. Σημαντικό στάδιο και θεμέλιος λίθος για στην εξόρυξη κειμένου αποτελεί η Ταξινόμηση Κειμένου/Text Classification. Μέσω της μηχανικής μάθησης, η Ταξινόμηση Κειμένων καλείται να δώσει λύση στο ζήτημα της διαχείρισης και κατηγοριοποίησης κειμένων σε ηλεκτρονική μορφή. Η ταξινόμηση κειμένων γίνεται συνήθως μέσω μιας ποικιλίας αλγορίθμων και διαδικασιών που αποτελούν διαφορετικά μοντέλα. Όλα αυτά τα μοντέλα απαιτούν μια διαδικασία «εκπαίδευσης» και «δοκιμής» όπου τους δίνεται ένα σύνολο κειμένων και πρέπει να τα κατηγοριοποιήσουν χωρίς λάθη. Σε αυτό το σημείο, γίνεται η σύγκριση απόδοσης των αλγορίθμων Ταξινόμησης Κειμένων, όπου γνωστά και καθιερωμένα μοντέλα Ταξινόμησης Κειμένων δοκιμάζονται στο ίδιο σύνολο κειμένων και αξιολογείται η απόδοσή τους. Σε αυτή την εργασία γίνεται υλοποίηση του αλγορίθμου (Fei, et al., 2016) και στην συνέχεια γίνονται πειράματα κάνοντας χρήση των datasets που αναφέρονται στο (Pritsos. et al., 2019) με σκοπό να συγκριθούν τα αποτελέσματα. 2024-05-23T08:42:06Z 2024-05-23T08:42:06Z 2024-02-12 http://hdl.handle.net/11610/26379 el_GR Αναφορά Δημιουργού - Παρόμοια Διανομή 4.0 Διεθνές http://creativecommons.org/licenses/by-sa/4.0/ 63 σ. application/pdf Σάμος
spellingShingle αλγόριθμοι ταξινόμησης κειμένου
εξόρυξη πληροφορίας
μηχανική μάθηση
machine learning
text classification algorithms
data mining
Text data mining
Machine learning
Text processing (Computer science)
Τριπιντή-Ιγνατίου, Ηρώ
Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
title Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
title_full Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
title_fullStr Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
title_full_unstemmed Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
title_short Ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
title_sort ταξινόμηση κειμένων ανοικτού συνόλου με χρήση της ομοιότητας βάσει κέντρων
topic αλγόριθμοι ταξινόμησης κειμένου
εξόρυξη πληροφορίας
μηχανική μάθηση
machine learning
text classification algorithms
data mining
Text data mining
Machine learning
Text processing (Computer science)
url http://hdl.handle.net/11610/26379
work_keys_str_mv AT tripintēignatiouērō taxinomēsēkeimenōnanoiktousynoloumechrēsētēsomoiotētasbaseikentrōn