Dissertation/ Thesis

Extensions and applications of Bayesian symbolic regression

Λεπτομέρειες βιβλιογραφικής εγγραφής
Τίτλος: Extensions and applications of Bayesian symbolic regression
Συγγραφείς: Cabanas Tirapu, Oriol
Thesis Advisors: Guimerà Manrique, Roger, Sales Pardo, Marta
Πηγή: TDX (Tesis Doctorals en Xarxa)
Στοιχεία εκδότη: "Universitat Rovira i Virgili", 2026.
Έτος έκδοσης: 2026
Φυσική περιγραφή: 136 p.
Θεματικοί όροι: Aprenentatge automàtic / Aprendizage automatico / Machine learning, Sistemes dinàmics / Sistemas Dinamicos / Dynamical Systems, Física Computacional / Física Computacional / Computational Physics, Ciències
Περιγραφή: (Català) Descobrir el model subjacent que genera un conjunt de dades experimentals obser vades és un repte científic fonamental. D’una banda, el model ha de reproduir les dades amb precisió; de l’altra, ha d’incloure només els termes necessaris que representen els mecanismes subjacents. Aquesta tasca es pot formular com la cerca del model més parsimoniós que expliqui el conjunt de dades. En aquesta tesi adoptem una perspectiva probabilística i utilitzem el Bayesian Machine Scientist (BMS) per estudiar conjunts de dades grans i complexos. A la primera part de la tesi presentem dues extensions metodològiques del BMS. Per modelar equacions diferencials a partir de mesures amb soroll, introduïm una formu lació integral del BMS. L’aplicació a dades sintètiques dels models Logístic i Lotka Volterra demostra una millorada respecte a alternatives existents, especialment sota nivells elevats de soroll. Tot seguit, presentem una formulació probabilística del BMS dissenyada per recuperar expressions matemàtiques per a distribucions de probabilitat. Amb aquest enfocament, obtenim models que ajusten dades generades a partir de dis tribucions de probabilitat conegudes i, de manera notable, recuperem Hamiltonians a partir de conjunts de dades formats per configuracions d’espins. A la segona part de la tesi apliquem el BMS a dades reals. El primer estudi analitza patrons de mobilitat humana de llarg abast. En aquest context, el BMS identifica models simples i parsimoniosos formats només per tres variables, que superen el model De ep Gravity, una model d’aprenentatge profund que necessita 39 variables. Els models descoberts són similars la formulació clàssica de la llei de la gravetat, però incorporen termes addicionals que milloren les prediccions. El segon estudi, se centra a modelar dades de creixement de bacteris utilitzant la formulació integral del BMS. En aques ta aplicació, obtenim una expressió entrenada amb trajectòries de diferents espècies bacterianes i substrats, capaç d’adaptar-se a diverses formes de corba de creixement, inclosos casos amb creixement residual en la fase estacionària. Aquest model millora les prediccions en comparació amb els models de referència estàndard. En conjunt, aquesta tesi demostra el potencial del Bayesian Machine Scientist com a eina per al descobriment automatitzat de models, capaç d’identificar models parsi moniosos amb capacitats intrínseques de selecció de variables. En restringir les for mes funcionals als termes estrictament necessaris, el BMS permet descobrir models interpretables que descriuen amb precisió diversos tipus de dades, incloent dades de regressió, trajectòries dinàmiques i conjunts de dades probabilístics, i que aporten una millor predicció i comprensió dels sistemes
Description (Translated): (Anglès) Uncovering the underlying model that generates an observed experimental dataset is a fundamental scientific challenge. On one hand, the model must accurately reproduce the data; on the other hand, it should include only the necessary terms that effectively represent the underlying mechanisms. This task can be framed as the search for the most parsimonious model that explains the dataset. In this thesis, we adopt a probabilistic perspective and use the Bayesian Machine Scientist (BMS) to study large and complex datasets. In the first part of the thesis, we present two methodological extensions of the BMS. To address the challenge of modeling governing equations from noisy measurements, we introduce an integral formulation of the BMS. Its application to synthetic datasets generated from the Logistic and Lotka-Volterra models demonstrates improved robust ness compared to existing alternatives, particularly under high noise levels. Next, we introduce a formulation of the BMS designed to recover closed-form mathematical ex pressions for probability distributions. With this approach, we successfully obtain mod els that fit data generated from known distributions and, remarkably, recover Hamilto nians from datasets consisting of spin configurations sampled from established models. In the second part of the thesis, we apply the BMS to real-world datasets. The first case study analyzes long-range human mobility patterns. Here, the BMS identifies sim ple, parsimonious models composed of only three variables, which outperform the Deep Gravity model, a complex deep learning model that involves 39 features. The discovered models are reminiscent of the classical gravity formulation but incorpo rate refined terms that improve predictive accuracy. The second case study focuses on modeling bacterial growth data using the integral formulation of the BMS. In this ap plication, we obtain a single expression trained on trajectories from different bacterial species and substrates, capable of adapting to diverse growth-curve shapes, including cases with residual growth at the stationary phase. This model improves accuracy com pared to standard reference models. Overall, this thesis demonstrates the power of the Bayesian Machine Scientist as an automated model discovery tool that identifies parsimonious models with intrinsic variable-selection capabilities. By restricting functional forms to only the necessary terms, the BMS enables the discovery of interpretable models that accurately describe diverse types of data, including regression data, dynamical trajectories, and probabilis tic datasets, thereby providing both predictive performance and explanatory insight.
(Castellà) a tesis aborda el desafío fundamental de identificar el modelo subyacente que genera un conjunto de datos experimentales, equilibrando precisión y parquedad. Desde una perspectiva probabilística, se utiliza el Bayesian Machine Scientist (BMS) para analizar conjuntos de datos grandes y complejos, con el objetivo de descubrir modelos interpretables que capturen los mecanismos esenciales que gobiernan los sistemas observados. La primera parte del trabajo presenta dos extensiones metodológicas del BMS. Primero, se introduce una formulación integral diseñada para inferir ecuaciones diferenciales a partir de mediciones ruidosas, mostrando una mayor robustez que métodos existentes cuando se aplica a datos sintéticos de los modelos Logístico y Lotka-Volterra. En segundo lugar, se desarrolla una versión del BMS orientada a recuperar expresiones matemáticas de distribuciones de probabilidad, siendo capaz incluso de reconstruir hamiltonianos a partir de configuraciones de espines. En la segunda parte de la tesis, aplicamos el BMS a conjuntos de datos reales. El primer caso de estudio analiza patrones de movilidad humana de largo alcance. En este caso, el BMS identifica modelos simples y parsimoniosos, compuestos por solo tres variables, que superan al modelo Deep Gravity, un modelo complejo de aprendizaje profundo que incluye 39 características. Los modelos descubiertos recuerdan a la formulación clásica de la gravedad, pero incorporan términos refinados que mejoran la precisión predictiva. El segundo caso de estudio se centra en el modelado de datos de crecimiento bacteriano mediante la formulación integral del BMS. En esta aplicación, obtenemos una única expresión entrenada con trayectorias de diferentes especies bacterianas y sustratos, capaz de adaptarse a diversas formas de curvas de crecimiento, incluyendo casos con crecimiento residual en la fase estacionaria. Este modelo mejora la precisión en comparación con los modelos de referencia estándar. En resumen, esta tesis demuestra el poder del Científico de Máquinas Bayesiano como una herramienta automatizada para el descubrimiento de modelos que identifica modelos parsimoniosos con capacidades intrínsecas de selección de variables. Al restringir las formas funcionales a los términos necesarios, el BMS permite el descubrimiento de modelos interpretables que describen con precisión diversos tipos de datos, incluyendo datos de regresión, trayectorias dinámicas y conjuntos de datos probabilísticos, proporcionando así tanto rendimiento predictivo como información explicativa.
Universitat Rovira i Virgili. Programa de doctorat en Nanociència, Materials i Enginyeria Química
Τύπος εγγράφου: Dissertation/Thesis
Περιγραφή αρχείου: application/pdf
Γλώσσα: English
Σύνδεσμος πρόσβασης: https://hdl.handle.net/10803/697764
Rights: ADVERTIMENT. Tots els drets reservats. L'accés als continguts d'aquesta tesi doctoral i la seva utilització ha de respectar els drets de la persona autora. Pot ser utilitzada per a consulta o estudi personal, així com en activitats o materials d'investigació i docència en els termes establerts a l'art. 32 del Text Refós de la Llei de Propietat Intel·lectual (RDL 1/1996). Per altres utilitzacions es requereix l'autorització prèvia i expressa de la persona autora. En qualsevol cas, en la utilització dels seus continguts caldrà indicar de forma clara el nom i cognoms de la persona autora i el títol de la tesi doctoral. No s'autoritza la seva reproducció o altres formes d'explotació efectuades amb finalitats de lucre ni la seva comunicació pública des d'un lloc aliè al servei TDX. Tampoc s'autoritza la presentació del seu contingut en una finestra o marc aliè a TDX (framing). Aquesta reserva de drets afecta tant als continguts de la tesi com als seus resums i índexs.
Αριθμός Καταχώρησης: edstdx.10803.697764
Βάση Δεδομένων: TDX
Περιγραφή
Η περιγραφή δεν είναι διαθέσιμη