Distributed intelligent crawlers : πτυχιακή εργασία

Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κα...

Full description

Saved in:
Bibliographic Details
Main Author: Κατσίμπρας, Γεώργιος
Corporate Author: Πανεπιστήμιο Αιγαίου. Σχολή Θετικών Επιστημών. Τμήμα Μηχανικών Πληροφοριακών και Επικοινωνιακών Συστημάτων
Format: Thesis Book
Language:English
Published: 2010.
Subjects:
Online Access:http://hdl.handle.net/11610/8855
Tags: Add Tag
No Tags, Be the first to tag this record!

MARC

LEADER 00000cam a2200000 i 4500
001 1/10231
008 100916s2010 gr | ||| |||| ||eng||
035 |l 10108937 
040 |a GR-MyUA  |b gre  |e AACR2 
041 0 |a eng 
082 0 |a 006.3   |2 (22) 
100 1 |a Κατσίμπρας, Γεώργιος. 
245 1 0 |a Distributed intelligent crawlers :   |b πτυχιακή εργασία /   |c by Katsimpras Georgios ; επιβλέπων καθηγητής Γεώργιος Βούρος.  
260 |c 2010.  
300 |a viii, 67 σ. :   |b εικ., πιν. ;   |c 30 εκ.  
502 |a Πτυχιακή εργασία – Πανεπιστήμιο Αιγαίου, Σάμος, 2010. 
504 |a Βιβλιογραφία: σ. 66-67.  
506 0 |a Διάθεση πλήρους κειμένου - Ελεύθερη πρόσβαση.  
520 |a Το μεγάλο μέγεθος και η δυναμική φύση του διαδικτύου, καθιστούν αναγκαία τη συνεχή ενημέρωση των web-based συστημάτων εξόρυξης γνώσης. Το διαδίκτυο είναι ένας χώρος που παραδοσιακά οι μηχανισμοί εξόρυξης γνώσης είναι υπό ανάπτυξη. Οι μηχανισμοί διάσχισης (Crawlers), αντιπροσωπεύουν την διαδικασία κατά την οποία ακολουθούνται οι σύνδεσμοι σε μία ιστοσελίδα, για την εξόρυξη γνώσης από αυτούς. Η διάσχιση ολόκληρου του διαδικτύου φαντάζει αδύνατη, αφού πρόκειται για εκατομμύρια ιστοσελίδες. Πολλαπλοί μηχανισμοί διάσχιση που θα λειτουργούν παράλληλα μπορούν να κατανείμουν τον φόρτο εργασίας πιο ομαλά. Σε αυτή τη πτυχιακή εργασία, μελετούμε διαφορετικές τεχνικές και προσεγγίσεις απλής διάσχισης αλλά και κατανεμημένων συστημάτων διάσχισης του διαδικτύου, περιλαμβανομένων και ζητημάτων σχετικά με την υλοποίηση τέτοιων συστημάτων. Σχεδιάζουμε ένα νέο μοντέλο και μία καινούρια αρχιτεκτονική για ένα κατανεμημένο σύστημα διάσχισης του διαδικτύου που χρησιμοποιεί έναν έξυπνο αλγόριθμο ταξινόμησης ιστοσελίδων (με βάση το βαθμό σημαντικότητας μίας ιστοσελίδας) ο οποίος βασίζεται σε στατιστικές πληροφορίες που συγκεντρώνονται κατά τη διάσχιση. Υλοποιούμε τον σχεδιασμό αυτόν σε Python/Twisted, κάνοντας χρήση XML-RPC για την κατανομή του φόρτου εργασίας και Memcached για την αποθήκευση των δεδομένων. Δοκιμάζουμε την απόδοση του προτεινόμενου συστήματος και παρουσιάζουμε τα αποτελέσματα. 
610 2 0 |a University of the Aegean  |x Dissertations. 
650 0 0 |a Data mining. 
650 0 0 |a World Wide Web. 
650 0 0 |a Dissertations, Academic  |z Greece. 
700 1 |a Βούρος, Γεώργιος,  |e dgs 
710 2 |a Πανεπιστήμιο Αιγαίου.   |b Σχολή Θετικών Επιστημών.   |b Τμήμα Μηχανικών Πληροφοριακών και Επικοινωνιακών Συστημάτων. 
852 |a INST  |b SAMOS  |c DIATR  |e 20100916  |h 006.3 ΚΑΤ  |p 005300031299  |q 005300031299  |t DIE  |y 23 
852 |a INST  |b SAMOS  |c DIATR  |e 20100916  |h 006.3 ΚΑΤ  |p 005300031300  |q 005300031300  |t DIE  |y 23 
856 |u http://hdl.handle.net/11610/8855 
901 |a BIBL3-2010-3 
909 |a Σ  |b 166046 
909 |a Σ  |b 166047 
924 |a ΚΑΤΣΙΜΠΡΑΣ  |b ΓΕΩΡΓΙΟΣ  |y Σάμος  |z 2010-06 
970 |a ΚΟΣΙΕΡΗΣ  |b ΧΡΗΣΤΟΣ  |z 2010/09/16