Dissertation/ Thesis

Towards effective and interpretable many-objective feature selection in machine learning

Λεπτομέρειες βιβλιογραφικής εγγραφής
Τίτλος: Towards effective and interpretable many-objective feature selection in machine learning
Συγγραφείς: Njoku, Uchechukwu Fortune
Συνεισφορές: University/Department: Universitat Politècnica de Catalunya. Departament de Ciències de la Computació
Thesis Advisors: Abelló Gamazo, Alberto, Bilalli, Besim, Bontempi, Gianluca
Πηγή: TDX (Tesis Doctorals en Xarxa)
Στοιχεία εκδότη: Universitat Politècnica de Catalunya, 2026.
Έτος έκδοσης: 2026
Φυσική περιγραφή: 174 p.
Θεματικοί όροι: Data Preprocessing, Dimensionality Reduction, Feature Selection, Optimization, Many-objectives, Fairness, Machine Learning, Interpretability, Àrees temàtiques de la UPC::Informàtica, 004 - Informàtica
Περιγραφή: Tesi en modalitat de cotutela: Universitat Politècnica de Catalunya i Université libre de Bruxelles
Description (Translated): Tesi amb menció de Doctorat Internacional
(English) Effective Machine Learning (ML) requires more than just accurate models; it also demands consideration of factors such as model complexity, fairness, and other task-specific requirements. Fulfilling these requirements begins at the data level by selecting features that con- tribute to addressing these concerns. This can benefit from a many-objective optimization approach to Feature Selection (FS). This thesis, therefore, studies Many-Objective Feature Selection (MOFS) and contributes to the development of efficient and responsible ML solutions. However, due to the large number of MOFS solutions, it comes with an interpretability challenge. Therefore, we also aim to propose a methodology for tackling this limitation of MOFS. Although FS has been long researched, previous work (on both filter and wrapper methods) has failed to address this gap by focusing only on one or at most two objectives. Also for the interpretability of FS results, no methodological approach has been proposed and rather a basic tabular representation has been used. We propose a framework that uses non-dominated sorting genetic algorithms to balance important and often conflicting objectives for FS. In particular, more than four to fifteen objectives could be considered with this method. For interpretability, our proposed methodology consists of six steps that consider three viewpoints: objectives, solutions, and variables (i.e., features). To achieve the research goal, we follow a structured approach: first, an extensive literature review that establishes the state-of-the-art and identifies open challenges. Next, empirical analyses of single-objective filter and wrapper methods, as well as multi-objective wrapper methods, are conducted to assess their strengths and limitations. Our MOFS framework is then proposed and evaluated through multiple experiments, including its application to fairness in ML. Finally, the interpretability methodology is instantiated as an interactive dashboard, which is validated through an experimental study involving 50 participants, with statistical analysis to assess its effectiveness. The findings highlight that no single FS method is universally optimal; instead, the best approach depends on dataset characteristics, task requirements, and objectives. While filter methods are computationally efficient and wrapper methods enhance model performance in single-objective settings, the proposed MOFS framework successfully balances multiple conflicting indicators related to performance, complexity, and fairness. Moreover, the interpretability methodology proved essential in helping data scientists to better understand MOFS results, enabling informed decision-making in FS.
(Català) L’aprenentatge automàtic (ML) eficaç requereix més que models precisos; també requereix la consideració de factors com ara la complexitat del model, l’equitat i altres requisits específics de la tasca. El compliment d’aquests requisits s’ha de tenir en compte de bon principi, a nivell de dades, seleccionant les característiques que contribueixen a resoldre el nostre problema de forma adequada (FS). Això es pot beneficiar d’utilitzar un enfocament d’optimització multi-objectiu per a dur a terme aquesta selecció. Així, aquesta tesi estudia la selecció multi-objectiu de característiques (MOFS) i contribueix al desenvolupament de solucions de ML eficients i responsables. Tanmateix, comporta un nou repte d’interpretabilitat a causa del gran nombre de solucions que obtenim en aplicar MOFS i, per tant, també pretenem proposar una metodologia per fer front a aquesta complexitat de MOFS. Tot i que FS s’ha investigat durant molt de temps, els treballs anterior (tant sobre mètodes tipus filtre com d’embolcall) no han abordat aquest problema i s’han centrat només en un o com a màxim dos objectius. També per a la interpretabilitat dels resultats de FS, no s’ha proposat cap enfocament metodològic i més aviat s’ha utilitzat una representació tabular bàsica. Conseqüentment, proposem un marc de treball que utilitza algorismes genètics d’ordenació no dominada per balancejar objectius rellevants i sovint conflictius per a FS. En particular, amb aquest mètode es podrien considerar més de quatre i fins a quinze objectius. Per a facilitar la interpretabilitat dels resultats, la nostra metodologia consta de sis passos que consideren tres punts de vista: objectius, solucions i variables (és a dir, característiques). Per assolir l’objectiu de la recerca, seguim un enfocament estructurat: primer, una extensa revisió de la literatura per tal d’establir l’estat de l’art i identificar els reptes oberts. A continuació, es realitzen anàlisis empíriques de mètodes de tipus filtre i embolcall d’un sol objectiu, així com de mètodes d’embolcall multi-objectiu, per avaluar-ne els seus punts forts i febles. A continuació, es proposa i s’avalua el nostre marc de MOFS mitjançant múltiples experiments, inclosa la seva aplicació al problema de l’equitat en ML. Finalment, la metodologia d’interpretabilitat s’instancia com un quadre de comandament interactiu, que es valida mitjançant un estudi experimental amb 50 participants, i la conseqüent anàlisi estadística per avaluar-ne la seva eficàcia. Les troballes posen de manifest que cap mètode de FS aïllat és universalment òptim; en canvi, el millor enfocament depèn de les característiques del conjunt de dades, els requisits de la tasca i els objectius del problema. Tot i que els mètodes de filtre són computacionalment eficients i els mètodes d’embolcall milloren el rendiment del model en configuracions d’un sol objectiu, el marc de treball MOFS proposat equilibra amb èxit múltiples indicadors conflictius relacionats amb el rendiment, la complexitat i l’equitat. A més, la metodologia d’interpretabilitat va resultar essencial per ajudar els científics de dades a entendre millor els resultats MOFS, permetent la presa de decisions informades en FS.
(Español) Un aprendizaje automático eficaz requiere más que modelos precisos; también exige la consideración de factores como la complejidad del modelo, la equidad y otros requisitos específicos de la tarea. El cumplimiento de estos requisitos debe considerarse desde un principio, a nivel de datos, mediante la selección de características (FS) que contribuyan a solucionar el problema de la forma más adecuada. Esto puede beneficiarse de un enfoque de optimización de múltiples objetivos para la selección de características. Por lo tanto, esta tesis estudia la selección multi-objetivo de características (MOFS) y contribuye al desarrollo de soluciones de aprendizaje automático eficientes y responsables. Sin embargo, conlleva un desafío de interpretabilidad debido a la gran cantidad de soluciones que genera MOFS y, por lo tanto, también proponemos una metodología para abordar esta complejidad añadida de MOFS. Aunque FS se ha investigado durante mucho tiempo, los trabajos previos (tanto en métodos de tipo filtro como de envoltorio) no han abordado este problema al centrarse únicamente en uno o como máximo dos objetivos. Además, para la interpretabilidad de los resultados de FS, no se ha propuesto ningún enfoque metodológico y se ha utilizado simplemente una representación tabular básica. Consecuentemente, proponemos un marco de trabajo que utiliza para llevar a cabo FS algoritmos genéticos de ordenación no dominada para equilibrar objetivos relevantes pero a menudo conflictivos. En particular, con este método se podrían considerar más de cuatro y hasta quince objetivos. Para facilitar la interpretabilidad, nuestra metodología consta de seis pasos que consideran tres puntos de vista: objetivos, soluciones y variables (es decir, características). Para lograr el objetivo de la investigación, seguimos un enfoque estructurado: primero, una revisión extensa de la literatura que establece el estado del arte e identifica los desafíos abiertos. A continuación, se realizan análisis empíricos de los métodos de tipo filtro y envoltorio de un solo objetivo, así como de los métodos de envoltorio multi-objetivo, para evaluar sus fortalezas y limitaciones. Luego, nuestro marco de MOFS se evalúa a través de múltiples experimentos, incluida su aplicación a la mejora de la equidad del modelo obtenido. Finalmente, la metodología de interpretabilidad de los resultados se instancia como un cuadro de mandos interactivo, que se valida a través de un estudio experimental que involucra a 50 participantes, con el consiguiente análisis estadístico para evaluar su efectividad. Los hallazgos concluyen que ningún método de FS es universalmente óptimo, y que el mejor enfoque depende de las características del conjunto de datos, los requisitos de la tarea y los objetivos del problema. Si bien los métodos de tipo filtro son computacionalmente eficientes y los métodos de envoltorio mejoran el rendimiento del modelo en entornos de un solo objetivo, el marco de trabajo MOFS propuesto equilibra con éxito múltiples indicadores conflictivos relacionados con el rendimiento, la complejidad y la equidad. Además, la metodología de interpretabilidad resultó esencial para ayudar a los científicos de datos a comprender mejor los resultados de MOFS, lo que permite una toma de decisiones informada en FS.
DOCTORAT EN COMPUTACIÓ (Pla 2012)
Τύπος εγγράφου: Dissertation/Thesis
Περιγραφή αρχείου: application/pdf
Γλώσσα: English
DOI: 10.5821/dissertation-2117-456618
Σύνδεσμος πρόσβασης: https://hdl.handle.net/10803/696869
https://dx.doi.org/10.5821/dissertation-2117-456618
Rights: L'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by-nc/4.0/
Αριθμός Καταχώρησης: edstdx.10803.696869
Βάση Δεδομένων: TDX
Περιγραφή
DOI:10.5821/dissertation-2117-456618