Distributed intelligent crawlers

Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κα...

Πλήρης περιγραφή

Αποθηκεύτηκε σε:
Λεπτομέρειες βιβλιογραφικής εγγραφής
Κύριος συγγραφέας: Κατσίμπρας, Γεώργιος
Άλλοι συγγραφείς: Βούρος, Γεώργιος
Γλώσσα:English
Δημοσίευση: 2015
Θέματα:
Διαθέσιμο Online:http://catalog.lib.aegean.gr/webopac/FullBB.csp?WebAction=ShowFullBB&EncodedRequest=*9D*1B*DC*8F*0A*5BB*E6*CC*1A*E0*B1*FC4*9F*A2&Profile=Default&OpacLanguage=gre&NumberToRetrieve=50&StartValue=2&WebPageNr=1&SearchTerm1=2010.1.10231&SearchT1=&Index1=Keywordsbib&SearchMethod=Find_1&ItemNr=2
http://hdl.handle.net/11610/8657
Ετικέτες: Προσθήκη ετικέτας
Δεν υπάρχουν, Καταχωρήστε ετικέτα πρώτοι!
_version_ 1828460401623302144
author Κατσίμπρας, Γεώργιος
author2 Βούρος, Γεώργιος
author_facet Βούρος, Γεώργιος
Κατσίμπρας, Γεώργιος
author_sort Κατσίμπρας, Γεώργιος
collection DSpace
description Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κατά την οποία ακολουθούνται οι σύνδεσμοι σε μία ιστοσελίδα, για την εξόρυξη γνώσης από αυτούς. Η διάσχιση ολόκληρου του διαδικτύου φαντάζει αδύνατη, αφού πρόκειται για εκατομμύρια ιστοσελίδες. Πολλαπλοί μηχανισμοί διάσχιση που θα λειτουργούν παράλληλα μπορούν να κατανείμουν τον φόρτο εργασίας πιο ομαλά. Σε αυτή τη πτυχιακή εργασία, μελετούμε διαφορετικές τεχνικές και προσεγγίσεις απλής διάσχισης αλλά και κατανεμημένων συστημάτων διάσχισης του διαδικτύου, περιλαμβανομένων και ζητημάτων σχετικά με την υλοποίηση τέτοιων συστημάτων. Σχεδιάζουμε ένα νέο μοντέλο και μία καινούρια αρχιτεκτονική για ένα κατανεμημένο σύστημα διάσχισης του διαδικτύου που χρησιμοποιεί έναν έξυπνο αλγόριθμο ταξινόμησης ιστοσελίδων (με βάση το βαθμό σημαντικότητας μίας ιστοσελίδας) ο οποίος βασίζεται σε στατιστικές πληροφορίες που συγκεντρώνονται κατά τη διάσχιση. Υλοποιούμε τον σχεδιασμό αυτόν σε Python/Twisted, κάνοντας χρήση XML-RPC για την κατανομή του φόρτου εργασίας και Memcached για την αποθήκευση των δεδομένων. Δοκιμάζουμε την απόδοση του προτεινόμενου συστήματος και παρουσιάζουμε τα αποτελέσματα.
id oai:hellanicus.lib.aegean.gr:11610-8657
institution Hellanicus
language English
publishDate 2015
record_format dspace
spelling oai:hellanicus.lib.aegean.gr:11610-86572022-10-14T00:04:55Z Distributed intelligent crawlers Κατσίμπρας, Γεώργιος Βούρος, Γεώργιος Κατανεμημένα συστήματα Διαδίκτυο Έξυπνη διάσχιση Έξυπνη ταξινόμηση ιστοσελίδων Web crawling Crawlers Distributed crawlers Parallel crawling Data mining Intelligent web page ranking Data mining World Wide Web Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κατά την οποία ακολουθούνται οι σύνδεσμοι σε μία ιστοσελίδα, για την εξόρυξη γνώσης από αυτούς. Η διάσχιση ολόκληρου του διαδικτύου φαντάζει αδύνατη, αφού πρόκειται για εκατομμύρια ιστοσελίδες. Πολλαπλοί μηχανισμοί διάσχιση που θα λειτουργούν παράλληλα μπορούν να κατανείμουν τον φόρτο εργασίας πιο ομαλά. Σε αυτή τη πτυχιακή εργασία, μελετούμε διαφορετικές τεχνικές και προσεγγίσεις απλής διάσχισης αλλά και κατανεμημένων συστημάτων διάσχισης του διαδικτύου, περιλαμβανομένων και ζητημάτων σχετικά με την υλοποίηση τέτοιων συστημάτων. Σχεδιάζουμε ένα νέο μοντέλο και μία καινούρια αρχιτεκτονική για ένα κατανεμημένο σύστημα διάσχισης του διαδικτύου που χρησιμοποιεί έναν έξυπνο αλγόριθμο ταξινόμησης ιστοσελίδων (με βάση το βαθμό σημαντικότητας μίας ιστοσελίδας) ο οποίος βασίζεται σε στατιστικές πληροφορίες που συγκεντρώνονται κατά τη διάσχιση. Υλοποιούμε τον σχεδιασμό αυτόν σε Python/Twisted, κάνοντας χρήση XML-RPC για την κατανομή του φόρτου εργασίας και Memcached για την αποθήκευση των δεδομένων. Δοκιμάζουμε την απόδοση του προτεινόμενου συστήματος και παρουσιάζουμε τα αποτελέσματα. 2015-11-17T10:32:07Z 2015-11-17T10:32:07Z 2010 http://catalog.lib.aegean.gr/webopac/FullBB.csp?WebAction=ShowFullBB&EncodedRequest=*9D*1B*DC*8F*0A*5BB*E6*CC*1A*E0*B1*FC4*9F*A2&Profile=Default&OpacLanguage=gre&NumberToRetrieve=50&StartValue=2&WebPageNr=1&SearchTerm1=2010.1.10231&SearchT1=&Index1=Keywordsbib&SearchMethod=Find_1&ItemNr=2 http://hdl.handle.net/11610/8657 en application/pdf Σάμος
spellingShingle Κατανεμημένα συστήματα
Διαδίκτυο
Έξυπνη διάσχιση
Έξυπνη ταξινόμηση ιστοσελίδων
Web crawling
Crawlers
Distributed crawlers
Parallel crawling
Data mining
Intelligent web page ranking
Data mining
World Wide Web
Κατσίμπρας, Γεώργιος
Distributed intelligent crawlers
title Distributed intelligent crawlers
title_full Distributed intelligent crawlers
title_fullStr Distributed intelligent crawlers
title_full_unstemmed Distributed intelligent crawlers
title_short Distributed intelligent crawlers
title_sort distributed intelligent crawlers
topic Κατανεμημένα συστήματα
Διαδίκτυο
Έξυπνη διάσχιση
Έξυπνη ταξινόμηση ιστοσελίδων
Web crawling
Crawlers
Distributed crawlers
Parallel crawling
Data mining
Intelligent web page ranking
Data mining
World Wide Web
url http://catalog.lib.aegean.gr/webopac/FullBB.csp?WebAction=ShowFullBB&EncodedRequest=*9D*1B*DC*8F*0A*5BB*E6*CC*1A*E0*B1*FC4*9F*A2&Profile=Default&OpacLanguage=gre&NumberToRetrieve=50&StartValue=2&WebPageNr=1&SearchTerm1=2010.1.10231&SearchT1=&Index1=Keywordsbib&SearchMethod=Find_1&ItemNr=2
http://hdl.handle.net/11610/8657
work_keys_str_mv AT katsimprasgeōrgios distributedintelligentcrawlers