Distributed intelligent crawlers

Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κα...

Full description

Saved in:
Bibliographic Details
Main Author: Κατσίμπρας, Γεώργιος
Other Authors: Βούρος, Γεώργιος
Language:English
Published: 2015
Subjects:
Online Access:http://catalog.lib.aegean.gr/webopac/FullBB.csp?WebAction=ShowFullBB&EncodedRequest=*046R*C1C*13*DC*0AdN*8E*A7*1C*AEb*AD&Profile=Default&OpacLanguage=gre&NumberToRetrieve=50&StartValue=2&WebPageNr=1&SearchTerm1=2010.1.10231&SearchT1=&Index1=Keywordsbib&SearchMethod=Find_1&ItemNr=2
http://hdl.handle.net/11610/8855
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1828461500170240000
author Κατσίμπρας, Γεώργιος
author2 Βούρος, Γεώργιος
author_facet Βούρος, Γεώργιος
Κατσίμπρας, Γεώργιος
author_sort Κατσίμπρας, Γεώργιος
collection DSpace
description Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κατά την οποία ακολουθούνται οι σύνδεσμοι σε μία ιστοσελίδα, για την εξόρυξη γνώσης από αυτούς. Η διάσχιση ολόκληρου του διαδικτύου φαντάζει αδύνατη, αφού πρόκειται για εκατομμύρια ιστοσελίδες. Πολλαπλοί μηχανισμοί διάσχιση που θα λειτουργούν παράλληλα μπορούν να κατανείμουν τον φόρτο εργασίας πιο ομαλά. Σε αυτή τη πτυχιακή εργασία, μελετούμε διαφορετικές τεχνικές και προσεγγίσεις απλής διάσχισης αλλά και κατανεμημένων συστημάτων διάσχισης του διαδικτύου, περιλαμβανομένων και ζητημάτων σχετικά με την υλοποίηση τέτοιων συστημάτων. Σχεδιάζουμε ένα νέο μοντέλο και μία καινούρια αρχιτεκτονική για ένα κατανεμημένο σύστημα διάσχισης του διαδικτύου που χρησιμοποιεί έναν έξυπνο αλγόριθμο ταξινόμησης ιστοσελίδων (με βάση το βαθμό σημαντικότητας μίας ιστοσελίδας) ο οποίος βασίζεται σε στατιστικές πληροφορίες που συγκεντρώνονται κατά τη διάσχιση. Υλοποιούμε τον σχεδιασμό αυτόν σε Python/Twisted, κάνοντας χρήση XML-RPC για την κατανομή του φόρτου εργασίας και Memcached για την αποθήκευση των δεδομένων. Δοκιμάζουμε την απόδοση του προτεινόμενου συστήματος και παρουσιάζουμε τα αποτελέσματα.
id oai:hellanicus.lib.aegean.gr:11610-8855
institution Hellanicus
language English
publishDate 2015
record_format dspace
spelling oai:hellanicus.lib.aegean.gr:11610-88552022-10-14T10:04:25Z Distributed intelligent crawlers Κατανεμημένη ευφυής διάσχιση του παγκόσμιου ιστού Κατσίμπρας, Γεώργιος Βούρος, Γεώργιος Διάσχιση Κατανεμημένη διάσχιση Διαδίκτυο Κατανεμημένο σύστημα Crawling Web crawler Distributed crawlers Parallel crawling -- mlrpc Memcached Distributed system Python Data mining World Wide Web Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κατά την οποία ακολουθούνται οι σύνδεσμοι σε μία ιστοσελίδα, για την εξόρυξη γνώσης από αυτούς. Η διάσχιση ολόκληρου του διαδικτύου φαντάζει αδύνατη, αφού πρόκειται για εκατομμύρια ιστοσελίδες. Πολλαπλοί μηχανισμοί διάσχιση που θα λειτουργούν παράλληλα μπορούν να κατανείμουν τον φόρτο εργασίας πιο ομαλά. Σε αυτή τη πτυχιακή εργασία, μελετούμε διαφορετικές τεχνικές και προσεγγίσεις απλής διάσχισης αλλά και κατανεμημένων συστημάτων διάσχισης του διαδικτύου, περιλαμβανομένων και ζητημάτων σχετικά με την υλοποίηση τέτοιων συστημάτων. Σχεδιάζουμε ένα νέο μοντέλο και μία καινούρια αρχιτεκτονική για ένα κατανεμημένο σύστημα διάσχισης του διαδικτύου που χρησιμοποιεί έναν έξυπνο αλγόριθμο ταξινόμησης ιστοσελίδων (με βάση το βαθμό σημαντικότητας μίας ιστοσελίδας) ο οποίος βασίζεται σε στατιστικές πληροφορίες που συγκεντρώνονται κατά τη διάσχιση. Υλοποιούμε τον σχεδιασμό αυτόν σε Python/Twisted, κάνοντας χρήση XML-RPC για την κατανομή του φόρτου εργασίας και Memcached για την αποθήκευση των δεδομένων. Δοκιμάζουμε την απόδοση του προτεινόμενου συστήματος και παρουσιάζουμε τα αποτελέσματα. 2015-11-17T10:32:36Z 2015-11-17T10:32:36Z 2010 http://catalog.lib.aegean.gr/webopac/FullBB.csp?WebAction=ShowFullBB&EncodedRequest=*046R*C1C*13*DC*0AdN*8E*A7*1C*AEb*AD&Profile=Default&OpacLanguage=gre&NumberToRetrieve=50&StartValue=2&WebPageNr=1&SearchTerm1=2010.1.10231&SearchT1=&Index1=Keywordsbib&SearchMethod=Find_1&ItemNr=2 http://hdl.handle.net/11610/8855 en application/pdf Σάμος
spellingShingle Διάσχιση
Κατανεμημένη διάσχιση
Διαδίκτυο
Κατανεμημένο σύστημα
Crawling
Web crawler
Distributed crawlers
Parallel crawling
-- mlrpc
Memcached
Distributed system
Python
Data mining
World Wide Web
Κατσίμπρας, Γεώργιος
Distributed intelligent crawlers
title Distributed intelligent crawlers
title_full Distributed intelligent crawlers
title_fullStr Distributed intelligent crawlers
title_full_unstemmed Distributed intelligent crawlers
title_short Distributed intelligent crawlers
title_sort distributed intelligent crawlers
topic Διάσχιση
Κατανεμημένη διάσχιση
Διαδίκτυο
Κατανεμημένο σύστημα
Crawling
Web crawler
Distributed crawlers
Parallel crawling
-- mlrpc
Memcached
Distributed system
Python
Data mining
World Wide Web
url http://catalog.lib.aegean.gr/webopac/FullBB.csp?WebAction=ShowFullBB&EncodedRequest=*046R*C1C*13*DC*0AdN*8E*A7*1C*AEb*AD&Profile=Default&OpacLanguage=gre&NumberToRetrieve=50&StartValue=2&WebPageNr=1&SearchTerm1=2010.1.10231&SearchT1=&Index1=Keywordsbib&SearchMethod=Find_1&ItemNr=2
http://hdl.handle.net/11610/8855
work_keys_str_mv AT katsimprasgeōrgios distributedintelligentcrawlers
AT katsimprasgeōrgios katanemēmenēeuphyēsdiaschisētoupankosmiouistou