Cross-domain authorship attribution using pre-trained language models

Η δια-τομεακή αναγνώριση συγγραφέα είναι μια κατηγορία ρεαλιστικών προβλημάτων αναγνώρισης συγγραφέων με όρους εφαρμογών κυρίως στην εγκληματολογία. Στα δια-τομεακά σενάρια τα κείμενα με γνωστό συγγραφέα (σετ εκπαίδευσης) είναι σε διαφορετικό τομέα (δια-τομεακή) από τα κείμενα αγνώστου συγγραφέα (σε...

Πλήρης περιγραφή

Αποθηκεύτηκε σε:
Λεπτομέρειες βιβλιογραφικής εγγραφής
Κύριος συγγραφέας: Μπάρλας, Γεώργιος
Άλλοι συγγραφείς: Σταματάτος, Ευστάθιος
Γλώσσα:en_US
Δημοσίευση: 2021
Θέματα:
Διαθέσιμο Online:http://hdl.handle.net/11610/21473
Ετικέτες: Προσθήκη ετικέτας
Δεν υπάρχουν, Καταχωρήστε ετικέτα πρώτοι!
_version_ 1828460718085636096
author Μπάρλας, Γεώργιος
author2 Σταματάτος, Ευστάθιος
author_facet Σταματάτος, Ευστάθιος
Μπάρλας, Γεώργιος
author_sort Μπάρλας, Γεώργιος
collection DSpace
description Η δια-τομεακή αναγνώριση συγγραφέα είναι μια κατηγορία ρεαλιστικών προβλημάτων αναγνώρισης συγγραφέων με όρους εφαρμογών κυρίως στην εγκληματολογία. Στα δια-τομεακά σενάρια τα κείμενα με γνωστό συγγραφέα (σετ εκπαίδευσης) είναι σε διαφορετικό τομέα (δια-τομεακή) από τα κείμενα αγνώστου συγγραφέα (σετ δοκιμών). Η χρήση προ-εκπαιδευμένων γλωσσικών μοντέλων σε διάφορα καθήκοντα επεξεργασίας φυσικής γλώσσας μας ενέπνευσε να διερευνήσουμε τις δυνατότητές τους στο πρόβλημα της αναγνώρισης του συγγραφέα. Σε αυτή την εργασία, πειραματιζόμαστε με τέσσερα διαφορετικής αρχιτεκτονικής προ-εκπαιδευμένα γλωσσικά μοντέλα (BERT, ELMo, GPT-2 και ULMFiT). Η προτεινόμενη μέθοδος είναι μια τροποποίηση μιας επιτυχούς προσέγγισης επαλήθευσης συγγραφέα, που βασίζεται σε ένα μοντέλο γλώσσας νευρωνικών δικτύων πολλαπλών κεφαλών για να συνδυαστεί με τα προ-εκπαιδευμένα γλωσσικά μοντέλα. Αξιολογήσαμε την προτεινόμενη μέθοδο σε δύο συλλογές κειμένων (CMCC, PAN18) σε τρία δια-τομεακά σενάρια. Τα επιτευχθέντα αποτελέσματα είναι πολύ ελπιδοφόρα και καταδεικνύουν την κρίσιμη επίδραση του σετ κανονικοποίησης στην δια-τομεακή αναγνώριση συγγραφέα.
id oai:hellanicus.lib.aegean.gr:11610-21473
institution Hellanicus
language en_US
publishDate 2021
record_format dspace
spelling oai:hellanicus.lib.aegean.gr:11610-214732025-03-07T08:37:03Z Cross-domain authorship attribution using pre-trained language models Δια-τομεακή αναγνώριση συγγραφέα με χρήση προ-εκπαιδευμένων γλωσσικών μοντέλων Μπάρλας, Γεώργιος Σταματάτος, Ευστάθιος Πληροφοριακά και Επικοινωνιακά Συστήματα αναγνώριση συγγραφέα προ-εκπαιδευμένα γλωσσικά μοντέλα νευρωνικά δίκτυα authorship attribution pre-trained language models neural networks Authorship, Disputed Neural networks (Computer science) Natural language processing (Computer science) Η δια-τομεακή αναγνώριση συγγραφέα είναι μια κατηγορία ρεαλιστικών προβλημάτων αναγνώρισης συγγραφέων με όρους εφαρμογών κυρίως στην εγκληματολογία. Στα δια-τομεακά σενάρια τα κείμενα με γνωστό συγγραφέα (σετ εκπαίδευσης) είναι σε διαφορετικό τομέα (δια-τομεακή) από τα κείμενα αγνώστου συγγραφέα (σετ δοκιμών). Η χρήση προ-εκπαιδευμένων γλωσσικών μοντέλων σε διάφορα καθήκοντα επεξεργασίας φυσικής γλώσσας μας ενέπνευσε να διερευνήσουμε τις δυνατότητές τους στο πρόβλημα της αναγνώρισης του συγγραφέα. Σε αυτή την εργασία, πειραματιζόμαστε με τέσσερα διαφορετικής αρχιτεκτονικής προ-εκπαιδευμένα γλωσσικά μοντέλα (BERT, ELMo, GPT-2 και ULMFiT). Η προτεινόμενη μέθοδος είναι μια τροποποίηση μιας επιτυχούς προσέγγισης επαλήθευσης συγγραφέα, που βασίζεται σε ένα μοντέλο γλώσσας νευρωνικών δικτύων πολλαπλών κεφαλών για να συνδυαστεί με τα προ-εκπαιδευμένα γλωσσικά μοντέλα. Αξιολογήσαμε την προτεινόμενη μέθοδο σε δύο συλλογές κειμένων (CMCC, PAN18) σε τρία δια-τομεακά σενάρια. Τα επιτευχθέντα αποτελέσματα είναι πολύ ελπιδοφόρα και καταδεικνύουν την κρίσιμη επίδραση του σετ κανονικοποίησης στην δια-τομεακή αναγνώριση συγγραφέα. 2021-02-10T13:25:47Z 2021-02-10T13:25:47Z 2020-06 http://hdl.handle.net/11610/21473 en_US CC0 1.0 Παγκόσμια http://creativecommons.org/publicdomain/zero/1.0/ 35 σ. application/pdf Σάμος
spellingShingle αναγνώριση συγγραφέα
προ-εκπαιδευμένα γλωσσικά μοντέλα
νευρωνικά δίκτυα
authorship attribution
pre-trained language models
neural networks
Authorship, Disputed
Neural networks (Computer science)
Natural language processing (Computer science)
Μπάρλας, Γεώργιος
Cross-domain authorship attribution using pre-trained language models
title Cross-domain authorship attribution using pre-trained language models
title_full Cross-domain authorship attribution using pre-trained language models
title_fullStr Cross-domain authorship attribution using pre-trained language models
title_full_unstemmed Cross-domain authorship attribution using pre-trained language models
title_short Cross-domain authorship attribution using pre-trained language models
title_sort cross domain authorship attribution using pre trained language models
topic αναγνώριση συγγραφέα
προ-εκπαιδευμένα γλωσσικά μοντέλα
νευρωνικά δίκτυα
authorship attribution
pre-trained language models
neural networks
Authorship, Disputed
Neural networks (Computer science)
Natural language processing (Computer science)
url http://hdl.handle.net/11610/21473
work_keys_str_mv AT mparlasgeōrgios crossdomainauthorshipattributionusingpretrainedlanguagemodels
AT mparlasgeōrgios diatomeakēanagnōrisēsyngrapheamechrēsēproekpaideumenōnglōssikōnmontelōn