Dissertation/ Thesis
High-performance sequence alignment: co-designing algorithms and hardware architectures for efficient and scalable acceleration
| Τίτλος: | High-performance sequence alignment: co-designing algorithms and hardware architectures for efficient and scalable acceleration |
|---|---|
| Συγγραφείς: | Doblas Font, Max |
| Συνεισφορές: | University/Department: Universitat Politècnica de Catalunya. Departament d'Arquitectura de Computadors |
| Thesis Advisors: | Moretó Planas, Miquel, Marco Sola, Santiago |
| Πηγή: | TDX (Tesis Doctorals en Xarxa) |
| Στοιχεία εκδότη: | Universitat Politècnica de Catalunya, 2026. |
| Έτος έκδοσης: | 2026 |
| Φυσική περιγραφή: | 144 p. |
| Θεματικοί όροι: | Sequence Alignment, Hardware-Software Co-design, Domain-Specific Architectures, High-Performance Computing, Computational Biology, Instruction Set Architecture Extensions, Àrees temàtiques de la UPC::Informàtica, Àrees temàtiques de la UPC::Ciències de la salut, 004 - Informàtica, 575 - Genètica general. Citogenètica general. Immunogenètica. Evolució. Filogènia |
| Περιγραφή: | Tesi amb menció de Doctorat Internacional |
| Description (Translated): | (English) Over the past decade, the exponential growth of genomic data has driven significant advancements in genomics and healthcare, enabling breakthroughs in large-scale genomic studies, personalized medicine, and epidemiological surveillance. However, this rapid data expansion has also posed substantial computational challenges, particularly in sequence alignment, a cornerstone of genomic analysis. Sequence alignment is critical for applications such as disease diagnostics, population-wide genetic research, and outbreak tracking, yet it demands scalable and efficient solutions to handle the increasing data volumes and diverse use cases. This thesis addresses the efficiency-flexibility gap in sequence alignment through three key contributions. First, it introduces QuickEd, a novel sequence alignment algorithm that reduces computational complexity by combining heuristic bounding with optimal alignment. QuickEd achieves O(nŝ) complexity, where n is the sequence length and ŝ is an estimated upper bound of the alignment score, significantly improving upon the O(n²) complexity of traditional dynamic programming algorithms. By efficiently bounding the maximum alignment score, QuickEd reduces the computational burden while maintaining accuracy, making it well-suited for long-read sequencing and other demanding applications. Second, this thesis proposes GMX, a set of instruction set architecture (ISA) extensions designed to enhance the efficiency of dynamic programming-based alignment algorithms. GMX provides fundamental building-block operations for fast, tile-wise computations of the DP matrix, reducing memory footprint and computational overhead. These extensions enable seamless integration into widely used algorithms and tools, offering a cost-effective alternative to domain-specific accelerators (DSAs) while achieving comparable performance improvements. Third, the thesis presents SMX, a heterogeneous architecture that balances flexibility and performance to address the diverse requirements of real-world sequence alignment tasks. SMX integrates an ISA extension (SMX-1D) for irregular and sequential tasks and a specialized coprocessor (SMX-2D) for regular and parallel tasks, all orchestrated by a general-purpose core. This architecture supports various configurations for different sequence types (DNA, protein, and ASCII text) and alignment models, including weighted gaps and substitution matrices. By combining high performance with adaptability, SMX enables efficient acceleration of a wide range of sequence alignment applications. Together, these contributions advance the state of the art in sequence alignment, providing scalable, flexible, and efficient solutions to meet the demands of modern genomic analysis. The innovations presented in this thesis pave the way for faster and more reliable genomic analyses, facilitating critical applications such as personalized medicine, population-scale sequencing, and epidemiological surveillance in the era of long-read sequencing technologies. (Català) Durant la darrera dècada, el creixement exponencial de les dades genòmiques ha impulsat avenços significatius en genòmica i salut, permetent descobriments en estudis genòmics a gran escala, medicina personalitzada i vigilància epidemiològica. No obstant això, aquesta ràpida expansió de dades també ha plantejat reptes computacionals substancials, especialment en l'alineament de seqüències, una pedra angular de l'anàlisi genòmica. L'alineament de seqüències és crític per a aplicacions com el diagnòstic de malalties, la investigació genètica a nivell poblacional i el seguiment de brots, però requereix solucions escalables i eficients per gestionar els volums creixents de dades i els diversos casos d'ús. Aquesta tesi aborda el desequilibri entre eficiència i flexibilitat en l'alineament de seqüències mitjançant tres contribucions clau. En primer lloc, introdueix QuickEd, un nou algorisme d'alineament de seqüències que redueix la complexitat computacional combinant l'acotació heurística amb l'alineament òptim. QuickEd aconsegueix una complexitat de O(nŝ), on n és la longitud de la seqüència i ŝ és un límit superior estimat de la puntuació d'alineament, millorant significativament la complexitat de O(n²) dels algorismes tradicionals de programació dinàmica. Mitjançant l'acotació eficient de la puntuació màxima d'alineament, QuickEd redueix la càrrega computacional mantenint l'exactitud, cosa que el fa adequat per a seqüenciació de lectura larga i altres aplicacions exigents. En segon lloc, aquesta tesi proposa GMX, un conjunt d'extensions de l'arquitectura del conjunt d'instruccions (ISA) dissenyades per millorar l'eficiència dels algorismes d'alineament basats en programació dinàmica. GMX proporciona operacions fonamentals per a càlculs ràpids i en blocs de la matriu de programació dinàmica, reduint la petjada de memòria i la sobrecàrrega computacional. Aquestes extensions permeten una integració fluida en algorismes i eines àmpliament utilitzats, oferint una alternativa eficient als acceleradors específics de domini (DSAs) alhora que aconsegueix millores de rendiment comparables. En tercer lloc, la tesi presenta SMX, una arquitectura heterogènia que equilibra flexibilitat i rendiment per abordar els requisits diversos de les tasques d'alineament de seqüències del món real. SMX integra una extensió ISA (SMX-1D) per a tasques irregulars i seqüencials i un coprocessador especialitzat (SMX-2D) per a tasques regulars i paral·leles, tot orquestrat per un nucli de propòsit general. Aquesta arquitectura admet diverses configuracions per a diferents tipus de seqüències (ADN, proteïnes i text ASCII) i models d'alineament, incloent-hi insercions ponderates i matrius de substitució. Combinant un alt rendiment amb adaptabilitat, SMX permet una acceleració eficient d'una àmplia gamma d'aplicacions d'alineament de seqüències. En conjunt, aquestes contribucions avancen l'estat de l'art en l'alineament de seqüències, proporcionant solucions escalables, flexibles i eficients per satisfer les demandes de l'anàlisi genòmica moderna. Les innovacions presentades en aquesta tesi obren el camí per a anàlisis genòmiques més ràpides i fiables, facilitant aplicacions crítiques com la medicina personalitzada, la seqüenciació a escala poblacional i la vigilància epidemiològica en l'era de les tecnologies de seqüenciació de lectura larga. (Español) Durante la última década, el crecimiento exponencial de los datos genómicos ha impulsado avances significativos en genómica y salud, permitiendo descubrimientos en estudios genómicos a gran escala, medicina personalizada y vigilancia epidemiológica. Sin embargo, esta rápida expansión de datos también ha planteado importantes retos computacionales, especialmente en la alineación de secuencias, una piedra angular del análisis genómico. La alineación de secuencias es crítica para aplicaciones como el diagnóstico de enfermedades, la investigación genética a nivel poblacional y el seguimiento de brotes, pero requiere soluciones escalables y eficientes para manejar los crecientes volúmenes de datos y los diversos casos de uso. Esta tesis aborda la brecha entre eficiencia y flexibilidad en la alineación de secuencias mediante tres contribuciones clave. En primer lugar, introduce QuickEd, un nuevo algoritmo de alineación de secuencias que reduce la complejidad computacional combinando la delimitación heurística con la alineación óptima. QuickEd logra una complejidad de O(nŝ), donde n es la longitud de la secuencia y ŝ es un límite superior estimado de la puntuación de alineación, mejorando significativamente la complejidad de O(n²) de los algoritmos tradicionales de programación dinámica. Al delimitar eficientemente la puntuación máxima de alineación, QuickEd reduce la carga computacional manteniendo la precisión, lo que lo hace adecuado para la secuenciación de lectura larga y otras aplicaciones exigentes. En segundo lugar, esta tesis propone GMX, un conjunto de extensiones de la arquitectura del conjunto de instrucciones (ISA) diseñadas para mejorar la eficiencia de los algoritmos de alineación basados en programación dinámica. GMX proporciona operaciones fundamentales para cálculos rápidos y en bloques de la matriz de programación dinámica, reduciendo el uso de memoria y la sobrecarga computacional. Estas extensiones permiten una integración fluida en algoritmos y herramientas ampliamente utilizados, ofreciendo una alternativa eficiente a los aceleradores específicos de dominio (DSAs) al tiempo que logran mejoras de rendimiento comparables. En tercer lugar, la tesis presenta SMX, una arquitectura heterogénea que equilibra flexibilidad y rendimiento para abordar los diversos requisitos de las tareas de alineación de secuencias del mundo real. SMX integra una extensión ISA (SMX-1D) para tareas irregulares y secuenciales y un coprocesador especializado (SMX-2D) para tareas regulares y paralelas, todo orquestado por un núcleo de propósito general. Esta arquitectura admite diversas configuraciones para diferentes tipos de secuencias (ADN, proteínas y texto ASCII) y modelos de alineación, incluyendo inserciones ponderadas y matrices de sustitución. Al combinar un alto rendimiento con adaptabilidad, SMX permite una aceleración eficiente de una amplia gama de aplicaciones de alineación de secuencias. En conjunto, estas contribuciones avanzan el estado del arte en la alineación de secuencias, proporcionando soluciones escalables, flexibles y eficientes para satisfacer las demandas del análisis genómico moderno. Las innovaciones presentadas en esta tesis abren el camino para análisis genómicos más rápidos y fiables, facilitando aplicaciones críticas como la medicina personalizada, la secuenciación a escala poblacional y la vigilancia epidemiológica en la era de las tecnologías de secuenciación de lectura larga. DOCTORAT EN ARQUITECTURA DE COMPUTADORS (Pla 2012) |
| Τύπος εγγράφου: | Dissertation/Thesis |
| Περιγραφή αρχείου: | application/pdf |
| Γλώσσα: | English |
| DOI: | 10.5821/dissertation-2117-460398 |
| Σύνδεσμος πρόσβασης: | https://hdl.handle.net/10803/697221 https://dx.doi.org/10.5821/dissertation-2117-460398 |
| Rights: | L'accés als continguts d'aquesta tesi queda condicionat a l'acceptació de les condicions d'ús establertes per la següent llicència Creative Commons: http://creativecommons.org/licenses/by/4.0/ |
| Αριθμός Καταχώρησης: | edstdx.10803.697221 |
| Βάση Δεδομένων: | TDX |
| DOI: | 10.5821/dissertation-2117-460398 |
|---|