Dissertation/ Thesis

Analysing social biases toward migrant groups encoded in language models

Bibliographic Details
Title: Analysing social biases toward migrant groups encoded in language models
Authors: Sorato, Danielly
Contributors: University/Department: Universitat Pompeu Fabra. Departament de Traducció i Ciències del llenguatge
Thesis Advisors: Colominas, Carme, Zavala-Rojas, Diana
Source: TDX (Tesis Doctorals en Xarxa)
Publisher Information: Universitat Pompeu Fabra, 2024.
Publication Year: 2024
Physical Description: 204 p.
Subject Terms: Social bias, Stereotypes, Immigration, Word embeddings, Sesgo social, Estereotipos, Inmigración, Biaix social, Estereotips, Immigració
Description: Embedding models are powerful machine-learning-based representations of human language used in a myriad of Natural Language Processing tasks. Due to their ability to learn underlying word association patterns present in large volumes of data, it is possible to observe various sociolinguistic phenomena encoded in the distributional vector spaces, among them, social stereotypes. Even if such models must be carefully tested for social biases and not blindly employed in downstream applications due to ethically concerning outcomes, they can be useful for discourse analysis of large volumes of textual data, for instance. In this thesis, we explore the use of language models to analyze and quantify biases towards migrant groups. We start by conducting a monolingual diachronic study of articles published in the Spanish newspaper 20 Minutos between 2007 and 2018. Then, we analyze the Danish, Dutch, English, and Spanish portions of four different multilingual corpora of political discourse, covering the 1997-2018 period. For both the aforementioned studies, we examined the effect of sociopolitical variables such as unemployment and criminality numbers on our bias measurements using statistical models. Finally, we contribute to the creation of linguistic resources for investigating biases against migrants by releasing a multilingual dataset for the Catalan, Portuguese, and Spanish languages inspired by social surveys that measure perceptions and attitudes towards immigration in European countries.
Description (Translated): Los modelos de embeddings son potentes representaciones del lenguaje humano basadas en el aprendizaje automático que se utilizan en una gran variedad de tareas de Procesamiento del Lenguaje Natural. Debido a su capacidad para aprender patrones subyacentes de asociación de palabras presentes en grandes volúmenes de datos, es posible observar diversos fenómenos sociolingüísticos codificados en los espacios vectoriales distributivos, entre ellos, los estereotipos sociales. Si bien es necesario examinar cuidadosamente tales modelos para detectar sesgos sociales y no emplearlos ciegamente en aplicaciones debido a resultados éticamente preocupantes, pueden ser útiles para el análisis del discurso de grandes volúmenes de datos textuales, por ejemplo. En esta tesis exploramos el uso de modelos del lenguaje para analizar y cuantificar los sesgos hacia los inmigrantes. Comenzamos realizando un estudio diacrónico monolingüe de artículos publicados en el periódico español 20 Minutos entre 2007 y 2018. En segundo lugar, analizamos las partes danesa, holandesa, inglesa y española de cuatro corpus multilingües de discurso político diferentes que cubren el período 1997-2018. En ambos estudios, examinamos el efecto de variables sociopolíticas como las cifras de desempleo y criminalidad en nuestras mediciones de sesgo utilizando modelos estadísticos. Finalmente, contribuimos a la creación de recursos lingüísticos para investigar los sesgos contra los inmigrantes mediante la publicación de un conjunto de datos multilingüe (catalán, portugués, y castellano) inspirados en encuestas sociales que miden las percepciones y actitudes hacia la inmigración en los países europeos.
Els models d’embeddings són representacions potents del llenguatge humà basades en l’aprenentatge automàtic que s’utilitzen en una gran varietat de tasques de Processament del Llenguatge Natural. A causa de la seva capacitat per aprendre patrons subjacents d’associació de paraules presents en grans volums de dades, és possible observar diversos fenòmens sociolingüístics codificats als espais vectorials distributius, entre ells, els estereotips socials. Si cal bé examinar acuradament aquests models per detectar biaixos socials i no fer-los servir cegament en aplicacions a causa de resultats èticament preocupants, poden ser útils per a l’anàlisi del discurs de grans volums de dades textuals, per exemple. En aquesta tesi explorem l’ús de models del llenguatge per analitzar i quantificar els biaixos cap als immigrants. Comencem fent un estudi diacrònic monolingüe d’articles publicats al diari español 20 Minutos entre 2007 i 2018. En segon lloc, analitzem les parts danesa, holandesa, anglesa i espanyola de quatre corpus multilingües de discurs polític diferents, que cobreixen el període 1997-2018. En tots dos estudis, examinem l’efecte de variables sociopolítiques com les xifres de desocupació i criminalitat en els nostres mesuraments de biaix utilitzant models estadístics. Finalment, contribuïm a la creació de recursos lingüístics per investigar els biaixos contra els immigrants mitjançant la publicació d’un conjunt de dades multilingüe (catalan, portuguès i castellà) inspirats en enquestes socials que mesuren les percepcions i actituds cap a la immigració als països europeus .
Programa de Doctorat en Traducció i Ciències del Llenguatge
Document Type: Dissertation/Thesis
File Description: application/pdf
Language: English
Access URL: http://hdl.handle.net/10803/692277
Rights: L'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by-nc-sa/4.0/
Accession Number: edstdx.10803.692277
Database: TDX
FullText Text:
  Availability: 0
CustomLinks:
  – Url: http://hdl.handle.net/10803/692277#
    Name: EDS - TDX (ns324271)
    Category: fullText
    Text: View record in TDX
Header DbId: edstdx
DbLabel: TDX
An: edstdx.10803.692277
RelevancyScore: 1393
AccessLevel: 3
PubType: Dissertation/ Thesis
PubTypeId: dissertation
PreciseRelevancyScore: 1392.81286621094
IllustrationInfo
Items – Name: Title
  Label: Title
  Group: Ti
  Data: Analysing social biases toward migrant groups encoded in language models
– Name: Author
  Label: Authors
  Group: Au
  Data: <searchLink fieldCode="AR" term="%22Sorato%2C+Danielly%22">Sorato, Danielly</searchLink>
– Name: Author
  Label: Contributors
  Group: Au
  Data: University/Department: Universitat Pompeu Fabra. Departament de Traducció i Ciències del llenguatge
– Name: Author
  Label: Thesis Advisors
  Group: Au
  Data: Colominas, Carme<br />Zavala-Rojas, Diana
– Name: TitleSource
  Label: Source
  Group: Src
  Data: TDX (Tesis Doctorals en Xarxa)
– Name: Publisher
  Label: Publisher Information
  Group: PubInfo
  Data: Universitat Pompeu Fabra, 2024.
– Name: DatePubCY
  Label: Publication Year
  Group: Date
  Data: 2024
– Name: PhysDesc
  Label: Physical Description
  Group: PhysDesc
  Data: 204 p.
– Name: Subject
  Label: Subject Terms
  Group: Su
  Data: <searchLink fieldCode="DE" term="%22Social+bias%22">Social bias</searchLink><br /><searchLink fieldCode="DE" term="%22Stereotypes%22">Stereotypes</searchLink><br /><searchLink fieldCode="DE" term="%22Immigration%22">Immigration</searchLink><br /><searchLink fieldCode="DE" term="%22Word+embeddings%22">Word embeddings</searchLink><br /><searchLink fieldCode="DE" term="%22Sesgo+social%22">Sesgo social</searchLink><br /><searchLink fieldCode="DE" term="%22Estereotipos%22">Estereotipos</searchLink><br /><searchLink fieldCode="DE" term="%22Inmigración%22">Inmigración</searchLink><br /><searchLink fieldCode="DE" term="%22Biaix+social%22">Biaix social</searchLink><br /><searchLink fieldCode="DE" term="%22Estereotips%22">Estereotips</searchLink><br /><searchLink fieldCode="DE" term="%22Immigració%22">Immigració</searchLink>
– Name: Abstract
  Label: Description
  Group: Ab
  Data: Embedding models are powerful machine-learning-based representations of human language used in a myriad of Natural Language Processing tasks. Due to their ability to learn underlying word association patterns present in large volumes of data, it is possible to observe various sociolinguistic phenomena encoded in the distributional vector spaces, among them, social stereotypes. Even if such models must be carefully tested for social biases and not blindly employed in downstream applications due to ethically concerning outcomes, they can be useful for discourse analysis of large volumes of textual data, for instance. In this thesis, we explore the use of language models to analyze and quantify biases towards migrant groups. We start by conducting a monolingual diachronic study of articles published in the Spanish newspaper 20 Minutos between 2007 and 2018. Then, we analyze the Danish, Dutch, English, and Spanish portions of four different multilingual corpora of political discourse, covering the 1997-2018 period. For both the aforementioned studies, we examined the effect of sociopolitical variables such as unemployment and criminality numbers on our bias measurements using statistical models. Finally, we contribute to the creation of linguistic resources for investigating biases against migrants by releasing a multilingual dataset for the Catalan, Portuguese, and Spanish languages inspired by social surveys that measure perceptions and attitudes towards immigration in European countries.
– Name: Abstract
  Label: Description (Translated)
  Group: Ab
  Data: Los modelos de embeddings son potentes representaciones del lenguaje humano basadas en el aprendizaje automático que se utilizan en una gran variedad de tareas de Procesamiento del Lenguaje Natural. Debido a su capacidad para aprender patrones subyacentes de asociación de palabras presentes en grandes volúmenes de datos, es posible observar diversos fenómenos sociolingüísticos codificados en los espacios vectoriales distributivos, entre ellos, los estereotipos sociales. Si bien es necesario examinar cuidadosamente tales modelos para detectar sesgos sociales y no emplearlos ciegamente en aplicaciones debido a resultados éticamente preocupantes, pueden ser útiles para el análisis del discurso de grandes volúmenes de datos textuales, por ejemplo. En esta tesis exploramos el uso de modelos del lenguaje para analizar y cuantificar los sesgos hacia los inmigrantes. Comenzamos realizando un estudio diacrónico monolingüe de artículos publicados en el periódico español 20 Minutos entre 2007 y 2018. En segundo lugar, analizamos las partes danesa, holandesa, inglesa y española de cuatro corpus multilingües de discurso político diferentes que cubren el período 1997-2018. En ambos estudios, examinamos el efecto de variables sociopolíticas como las cifras de desempleo y criminalidad en nuestras mediciones de sesgo utilizando modelos estadísticos. Finalmente, contribuimos a la creación de recursos lingüísticos para investigar los sesgos contra los inmigrantes mediante la publicación de un conjunto de datos multilingüe (catalán, portugués, y castellano) inspirados en encuestas sociales que miden las percepciones y actitudes hacia la inmigración en los países europeos.<br />Els models d’embeddings són representacions potents del llenguatge humà basades en l’aprenentatge automàtic que s’utilitzen en una gran varietat de tasques de Processament del Llenguatge Natural. A causa de la seva capacitat per aprendre patrons subjacents d’associació de paraules presents en grans volums de dades, és possible observar diversos fenòmens sociolingüístics codificats als espais vectorials distributius, entre ells, els estereotips socials. Si cal bé examinar acuradament aquests models per detectar biaixos socials i no fer-los servir cegament en aplicacions a causa de resultats èticament preocupants, poden ser útils per a l’anàlisi del discurs de grans volums de dades textuals, per exemple. En aquesta tesi explorem l’ús de models del llenguatge per analitzar i quantificar els biaixos cap als immigrants. Comencem fent un estudi diacrònic monolingüe d’articles publicats al diari español 20 Minutos entre 2007 i 2018. En segon lloc, analitzem les parts danesa, holandesa, anglesa i espanyola de quatre corpus multilingües de discurs polític diferents, que cobreixen el període 1997-2018. En tots dos estudis, examinem l’efecte de variables sociopolítiques com les xifres de desocupació i criminalitat en els nostres mesuraments de biaix utilitzant models estadístics. Finalment, contribuïm a la creació de recursos lingüístics per investigar els biaixos contra els immigrants mitjançant la publicació d’un conjunt de dades multilingüe (catalan, portuguès i castellà) inspirats en enquestes socials que mesuren les percepcions i actituds cap a la immigració als països europeus .<br />Programa de Doctorat en Traducció i Ciències del Llenguatge
– Name: TypeDocument
  Label: Document Type
  Group: TypDoc
  Data: Dissertation/Thesis
– Name: Format
  Label: File Description
  Group: SrcInfo
  Data: application/pdf
– Name: Language
  Label: Language
  Group: Lang
  Data: English
– Name: URL
  Label: Access URL
  Group: URL
  Data: <link linkTarget="URL" linkTerm="http://hdl.handle.net/10803/692277" linkWindow="_blank">http://hdl.handle.net/10803/692277</link>
– Name: Copyright
  Label: Rights
  Group: Cpyrght
  Data: L'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by-nc-sa/4.0/
– Name: AN
  Label: Accession Number
  Group: ID
  Data: edstdx.10803.692277
PLink https://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edstdx&AN=edstdx.10803.692277
RecordInfo BibRecord:
  BibEntity:
    Languages:
      – Text: English
    PhysicalDescription:
      Pagination:
        PageCount: 204
    Subjects:
      – SubjectFull: Social bias
        Type: general
      – SubjectFull: Stereotypes
        Type: general
      – SubjectFull: Immigration
        Type: general
      – SubjectFull: Word embeddings
        Type: general
      – SubjectFull: Sesgo social
        Type: general
      – SubjectFull: Estereotipos
        Type: general
      – SubjectFull: Inmigración
        Type: general
      – SubjectFull: Biaix social
        Type: general
      – SubjectFull: Estereotips
        Type: general
      – SubjectFull: Immigració
        Type: general
    Titles:
      – TitleFull: Analysing social biases toward migrant groups encoded in language models
        Type: main
  BibRelationships:
    HasContributorRelationships:
      – PersonEntity:
          Name:
            NameFull: Sorato, Danielly
    IsPartOfRelationships:
      – BibEntity:
          Dates:
            – D: 16
              M: 09
              Type: published
              Y: 2024
ResultId 1