Knowledge discovery in big data : Application to Arabic handwriting characters recognition and geno
| dc.contributor.author | NASRI , Khaled | |
| dc.contributor.author | MOUSSAOUI , Abdelouahab Encadrant | |
| dc.date.accessioned | 2026-06-17T13:23:32Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | The exponential growth of Big Data necessitates scalable knowledge discovery methodologies capable of handling massive, heterogeneous datasets. This dissertation explores distributed and parallel deep learning architectures across two critical application domains: genomics and Arabic handwriting recognition. In genomics, a novel distributed pipeline for variant calling integrates multimodal sequencing data through a hybrid Transformer-CNN architecture with attention-based fusion. The system simultaneously processes DNA sequence context via transformer encoders and read alignment evidence through three-dimensional convolutional networks, enabling accurate genomic variant classification while achieving computational efficiency through Distributed Data Parallel (DDP) training across multiple GPUs. Multi-task learning addresses variant type classification, genotype prediction, quality score estimation, and artifact detection, while class-weighted loss functions handle severe data imbalance inherent in genomic datasets. In Arabic handwriting recognition, a hybrid architecture embedding Capsule Networks within Residual Networks (Caps-ResNet) captures hierarchical features and spatial relationships essential for cursive script analysis. This specialized architecture overcomes unique challenges including ligature complexity, diacritical mark sensitivity, and significant stylistic variability across writing styles. This multidisciplinary research demonstrates how hybrid architectures, multimodal fusion mechanisms, and distributed computing strategies enable robust, accurate, and computationally efficient knowledge extraction systems applicable to diverse scientific domains. The results contribute to the development of scalable deep learning solutions that bridge theoretical innovations with real-world applications in genomics and natural language processing. | |
| dc.description.sponsorship | La croissance exponentielle du Big Data nécessite des méthodologies d'extraction de connaissances évolutives capables de traiter des ensembles de données massifs et hétérogènes. Cette thèse explore les architectures d'apprentissage profond distribuées et parallèles à travers deux domaines d'application critiques : la génomique et la reconnaissance de l'écriture arabe manuscrite. En génomique, un pipeline distribué novateur pour l'identification de variants intègre des données de séquençage multimodales à travers une architecture hybride Transformer-CNN avec fusion basée sur l'attention. Le système traite simultanément le contexte de séquence ADN via des encodeurs Transformers et les données d'alignement de lectures par des réseaux de convolution tridimensionnels, permettant une classification précise des variants génomiques tout en atteignant une efficacité computationnelle grâce à l'entraînement distribué en parallèle de données (DDP) sur plusieurs GPU. L'apprentissage multitâches adresse la classification des types de variants, la prédiction des génotypes, l'estimation des scores de qualité et la détection d'artefacts, tandis que les fonctions de perte pondérées par classe gèrent le déséquilibre sévère inhérent aux données génomiques. En reconnaissance de l'écriture arabe manuscrite, une architecture hybride intégrant des réseaux capsule au sein de réseaux résiduels (Caps-ResNet) capture les caractéristiques hiérarchiques et les relations spatiales essentielles pour l'analyse des scripts cursifs. Cette architecture spécialisée surmonte les défis uniques incluant la complexité des ligatures, la sensibilité aux signes diacritiques et la variabilité stylistique importante entre différents styles d'écriture. Cette recherche multidisciplinaire démontre comment les architectures hybrides, les mécanismes de fusion multimodale et les stratégies de calcul distribué permettent des systèmes d'extraction de connaissances robustes, précis et computationnellement efficaces, applicables à divers domaines scientifiques. Les résultats contribuent au développement de solutions d'apprentissage profond évolutives qui établissent un pont entre innovations théoriques et applications pratiques en génomique et traitement du langage naturel . | |
| dc.identifier.uri | https://repository.univ-setif.dz/handle/123456789/1042 | |
| dc.language.iso | en | |
| dc.publisher | Setif 1 University - Ferhat ABBAS , Faculty of Sciences | |
| dc.subject | Big Data | |
| dc.subject | Knowledge Discovery | |
| dc.subject | Distributed Deep Learning | |
| dc.subject | Genomic Variant Calling | |
| dc.subject | Multimodal Learning | |
| dc.subject | Transformer-CNN Architectures | |
| dc.subject | Data Parallelism | |
| dc.subject | Arabic Handwriting Recognition | |
| dc.subject | Hybrid Neural Networks | |
| dc.title | Knowledge discovery in big data : Application to Arabic handwriting characters recognition and geno | |
| dc.type | Thesis |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- E-TH 2560 Knowledge Discovery in Big Data_Nasri_Khaled.pdf
- Size:
- 12.5 MB
- Format:
- Adobe Portable Document Format
