Dissertation/ Thesis
Reaching a modular, generic and containerised development in Biomedical Natural Language Processing systems
| Τίτλος: | Reaching a modular, generic and containerised development in Biomedical Natural Language Processing systems |
|---|---|
| Συγγραφείς: | Corvi, Javier |
| Συνεισφορές: | University/Department: Universitat de Barcelona. Facultat de Biologia |
| Thesis Advisors: | Capella Gutiérrez, Salvador Jesús, 1985-, Gelpi Buchaca, Josep Lluís |
| Πηγή: | TDX (Tesis Doctorals en Xarxa) |
| Στοιχεία εκδότη: | Universitat de Barcelona, 2025. |
| Έτος έκδοσης: | 2025 |
| Φυσική περιγραφή: | 97 p. |
| Θεματικοί όροι: | Tractament del llenguatge natural (Informàtica), Proceso en lenguaje natural (Informática), Natural language processing (Computer science), Bioinformàtica, Bioinformática, Bioinformatics, Toxicologia, Toxicología, Toxicology, Materials biomèdics, Materiales biomédicos, Biomedical materials, Ciències de la Salut |
| Περιγραφή: | Programa de Doctorat en Biomedicina / Tesi realitzada al Centre de Supercomputació de Barcelona - Barcelona Supercomputing Center (BSC) |
| Description (Translated): | [eng] The last century saw an exponential increase in scientific publications in the biomedical domain, generating a vast corpus of knowledge on different subfields. Despite the potential value of this knowledge, most of this data is only available as unstructured textual literature with variable degrees of digitisation, which have limited their systematic access, use and exploitation. This limitation can be avoided, or at least mitigated, by relying on text mining techniques to automatically extract relevant data and structure it from textual documents. Among the different alternatives for the automated processing of available texts, Natural Language Processing (NLP) workflows occupy a fundamental role. Biomedical Natural Language Processing (BioNLP) has been widely used to enhance the extraction, analysis, and interpretation of biomedical data from unstructured text, helping to streamline research, improve patient care, and support decision-making in healthcare. Applications range from mining vast corpora of scientific literature for drug discovery and gene-disease associations to processing clinical records for automating medical coding and extracting patient data for personalised medicine. Nowadays, there are still uncovered biomedical areas that require comprehensive analysis and research in order to develop appropriate text mining resources and systems. In the clinical domain, efforts have been made to generate annotated corpora and text mining tools focused on extracting diseases and drug-related adverse effects in humans for pharmacovigilance activities. However, in the preclinical phase of the drug development process, there are no text mining resources developed for analysing the growing number of existing toxicological studies. eTRANSAFE was a research project funded within the Innovative Medicines Initiative (IMI), which aimed at developing integrated databases and computational tools that support the translational safety assessment of new drugs. One of the milestones of eTRANSAFE was the development of a text mining framework designed to automatically extract treatment-related findings from preclinical toxicology reports. A treatment-related finding refers to any observable effect, outcome, or manifestation that occurs in a test subject as a direct or indirect result of a treatment or compound administration. Another field that currently lacks in terms of resources and tools for unstructured text analysis is the biomaterials domain. Biomaterials are natural or synthetic materials used for constructing artificial organs, fabricating prostheses, or replacing tissues. The effective use of biomaterials is critical for advancements in medical and dental applications, tissue engineering, and regenerative medicine. Developing advanced text mining and NLP tools tailored for the biomaterials domain could enhance data accessibility and usability. Such tools would enable researchers to systematically analyse existing literature, identify trends, and uncover relationships between different biomaterials and their applications. By bridging this gap, we can accelerate innovation and improve outcomes in biomaterials research and its applications in healthcare. A significant challenge for scientific software applications, including NLP systems, is the ability to share, distribute, and run these systems in a simple and efficient manner. Software containers provide a robust technological foundation to address this challenge. Containers encapsulate the application’s dependencies and auxiliary tools, ensuring isolation from the host environment, which enhances portability and reproducibility. Additionally, workflow managers can be employed to automate the orchestration and execution of text mining pipelines, streamlining the entire process and ensuring efficient, scalable execution. This thesis focuses on developing modular, flexible software components that utilise NLP techniques, allowing for their reuse and adaptation across various domains. In particular, this thesis addressed two BioNLP use cases; the main one is the development of PretoxTM, a text mining system for extracting treatment-related findings from preclinical toxicology reports, developed in the context of the eTRANSAFE project. A second use case is the development of DEBBIE (Database of Biomaterials and their Biological Effect), which aims to integrate metadata extracted from biomaterials publications by storing in its database indexed articles with relevant concepts. The introduction reviews the state of the art in NLP, offering historical context to illustrate the evolution of modern techniques that are currently transforming the field. It also addresses the challenge of modularising the developed components in isolation, utilising virtualisation and automating their execution through workflow managers. Additionally, it examines the current landscape of BioNLP, its diverse applications, and the motivations driving the use cases presented in this thesis. This thesis comprises three published articles: The first article describes the development of the Biomaterials Annotator: a system for ontology-based concept annotation of biomaterials text. This work represents a preliminary phase of the DEBBIE project. The second article encompasses the work undertaken within DEBBIE: The Open Access Database of Experimental Scaffolds and Biomaterials Built Using an Automated Text Mining Pipeline. It describes a novel text mining pipeline that optimises the acquisition, filtering, concept recognition, and storage of annotated biomaterials publications. Additionally, the article highlights the development of a user-friendly web application that allows users to access DEBBIE through keyword searches, displaying results in an intuitive format. The third article provides a comprehensive overview of the principal use case addressed in the thesis, the development of PretoxTM: a text mining system for extracting treatment-related findings from preclinical toxicology reports. It details the creation of the three core components, the PretoxTM Corpus, a gold-standard dataset of preclinical findings annotated by toxicology experts; the PretoxTM Pipeline, which automates the extraction of these findings from preclinical study reports; and the PretoxTM Web App, which facilitates expert review, visualisation, and validation of the extracted information. Finally, the General Discussion section highlights the overall achievements of this thesis, addresses the limitations of the developed systems, and proposes directions for future work to enhance the systems and adapt them to evolving requirements. Additionally, it examines the challenges faced, particularly those arising from the rapid advances in the field of NLP. [cat] El segle passat es va observar un increment exponencial en les publicacions científiques en l’àmbit biomèdic, generant un àmpli corpus de coneixement en diferents subcamps. Malgrat el potencial d’aquest coneixement, la major part d’aquestes dades només ha estat disponible com a literatura textual no estructurada amb nivells variables de digitalització, fet que n’ha limitat l’accés, l’ús i l’explotació de manera sistemàtica. Aquesta limitació es pot evitar, o almenys mitigar, confiant en tècniques de mineria de textos per extreure automàticament dades rellevants i estructurar-les a partir de documents textuals. Entre les diferents alternatives per al processament automatitzat dels textos disponibles, els fluxos de treball de “Natural Language Processing” (NLP) ocupen un paper fonamental. “Biomedical Natural Language Processing” (BioNLP) s’ha utilitzat àmpliament per millorar l’extracció, l’anàlisi i la interpretació de dades biomèdiques a partir de textos no estructurats, ajudant a agilitzar la investigació, millorar l’atenció als pacients i donar suport a la presa de decisions en l’àmbit sanitari. Les aplicacions van des de la mineria d’àmplis corpus de literatura científica per al descobriment de fàrmacs i les associacions gen-malaltia fins al processament de registres clínics per automatitzar la codificació mèdica i extreure dades de pacients per a la medicina personalitzada. Avui en dia, encara hi ha àrees biomèdiques no cobertes que requereixen anàlisis i investigacions exhaustives per desenvolupar recursos i sistemes de mineria de textos adequats. En l’àmbit clínic, s’han fet esforços per generar corpus anotats i eines de mineria de textos centrades en extreure malalties i efectes adversos relacionats amb fàrmacs en humans per a activitats de farmacovigilància. No obstant, en la fase preclínica del procés de desenvolupament de fàrmacs, no hi ha recursos de mineria de textos desenvolupats per analitzar el creixent nombre d’estudis toxicològics existents. eTRANSAFE va ser un projecte de recerca finançat dins la Iniciativa de Medicaments Innovadors (IMI), que tenia com a objectiu desenvolupar bases de dades integrades i eines computacionals que donessin suport a l’avaluació translacional de la seguretat de nous fàrmacs. Una de les fites d’eTRANSAFE va ser el desenvolupament d’un marc de mineria de textos dissenyat per extreure automàticament efectes adversos relacionats amb tractaments a partir d’informes de toxicologia preclínica. Un efecte advers relacionat amb un tractament fa referència a qualsevol efecte, resultat o manifestació observable que es produeixi en un subjecte d’estudi com a resultat directe o indirecte d’un tractament o administració de compostos. Un altre camp que actualment li manquen recursos i eines per a l’anàlisi de textos no estructurats és el domini dels biomaterials. Els biomaterials són materials naturals o sintètics utilitzats per crear òrgans artificials, fabricar pròtesis o substituir teixits. L’ús efectiu dels biomaterials és crític per als avenços en aplicacions mèdiques i dentals, enginyeria de teixits i medicina regenerativa. El desenvolupament d’eines avançades de mineria de textos i NLP adaptades al domini dels biomaterials podria millorar l’accessibilitat i usabilitat d’aquestes dades. Aquestes eines permetrien als investigadors analitzar de manera sistemàtica la literatura ja existent, identificar tendències i descobrir relacions entre diferents biomaterials i les seves aplicacions. Amb aquest enfocament, es podria accelerar la innovació i millorar els resultats en la recerca de biomaterials i les seves aplicacions en l’àmbit sanitari. Un repte significatiu per les aplicacions de programari científic, inclosos els sistemes de NLP, és la capacitat de compartir, distribuir i executar aquests sistemes de manera senzilla i eficient. Els contenidors de programari proporcionen una base tecnològica robusta per abordar aquest repte. Els contenidors encapsulen les dependències i eines auxiliars de l’aplicació, garantint l’aïllament de l’entorn hoste, fet que millora la portabilitat i la reproductibilitat. A més, es poden utilitzar gestors de fluxos de treball per automatitzar l’orquestració i l’execució de les canalitzacions de mineria de textos, optimitzant tot el procés i garantint una execució eficient i escalable. Aquesta tesi es centra en el desenvolupament de components de programari modulars i flexibles que utilitzen tècniques de NLP, permetent la seva reutilització i adaptació en diversos dominis. En particular, aquesta tesi aborda dos casos d’ús de BioPLN; el principal és el desenvolupament de PretoxTM, un sistema de mineria de textos per extreure efectes secundaris relacionats amb tractaments a partir d’informes de toxicologia preclínica, desenvolupat en el context del projecte eTRANSAFE. El segon és el desenvolupament de DEBBIE (Database of Biomaterials and their Biological Effect), que té com a objectiu integrar metadades extretes de publicacions de biomaterials en un sistema d’articles indexats amb els conceptes rellevants. La introducció revisa l’evolució del NLP, oferint un context històric que descriu l’evolució de les tècniques modernes que actualment estan transformant el camp. També aborda el repte de modularitzar els components desenvolupats de manera aïllada, utilitzant virtualització i automatitzant-ne l’execució a través de gestors de fluxos de treball. A més, examina el panorama actual del BioNLP i les seves múltiples aplicacions. També explora les motivacions que impulsen les utilitats de BioNLP presentats en aquesta tesi, particularment en les àrees de toxicologia preclínica i biomaterials. Aquesta tesi consta de tres articles publicats: El primer article descriu el desenvolupament del “Biomaterials Annotator: a system for ontology-based concept annotation of biomaterials text”. Aquest treball representa una fase preliminar del projecte DEBBIE. El segon article engloba el treball realitzat dins de “DEBBIE: The Open Access Database of Experimental Scaffolds and Biomaterials Built Using an Automated Text Mining Pipeline”. S’hi descriu un nou fluxe de treball de mineria de textos que optimitza l’adquisició, filtratge, reconeixement de conceptes i emmagatzematge de publicacions de biomaterials anotades. A més, l’article destaca el desenvolupament d’una aplicació web fàcil d’utilitzar que permet als usuaris accedir a DEBBIE mitjançant cerques per paraules clau, mostrant els resultats en un format intuïtiu. El tercer article proporciona una visió general del principal exemple abordat en la tesi, el desenvolupament de “PretoxTM: a text mining system for extracting treatment-related findings from preclinical toxicology reports”. S’hi detalla la creació dels tres components principals: PretoxTM Corpus, un conjunt de dades de referència preclínics anotats per experts en toxicologia; PretoxTM Pipeline, que automatitza l’extracció dels efectes secundaris a partir dels informes d’estudis preclínics; i PretoxTM Web App, que facilita la revisió, visualització i validació experta de la informació extreta. Finalment, a la secció de Discussió General, s’hi destaquen els reptes assolits d’aquesta tesi, abordant les limitacions dels sistemes desenvolupats i proposant diverses línies de recerca per a treballs futurs, amb la finalitat de millorar els sistemes i adaptar-los per a diverses necessitats. A més, analitza els reptes trobats, especialment aquells derivats dels avenços ràpids en el camp del NLP. |
| Τύπος εγγράφου: | Dissertation/Thesis |
| Περιγραφή αρχείου: | application/pdf |
| Γλώσσα: | English |
| Σύνδεσμος πρόσβασης: | https://hdl.handle.net/10803/697550 |
| Rights: | L'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by/4.0/ |
| Αριθμός Καταχώρησης: | edstdx.10803.697550 |
| Βάση Δεδομένων: | TDX |
| Η περιγραφή δεν είναι διαθέσιμη |