Projet de fin d'étude : HTGT-Med : Hierarchical Temporal Graph Transformer for Clinical Prediction and Biomedical NLP

Etudiant : EL MAHDAOUI AHMED

Filière : Master Web Intelligence et Sciences des Données (WISD)

Encadrant : Pr. EL FAZAZY KHALID

Annèe : 2026

Résumé : L'exploitation automatique des textes cliniques se heurte à quatre obstacles majeux: la longueur des documents, qui dépasse la limite de 512 tokens des Transformers standards; l'ancrage des mentions médicales dans une ontologie de référence, rendu délicat par la polysémie du vocabulaire clinique; la dimension temporelle du parcours de soin, ignorée par les modèles de langue classiques; et l'hétérogénéité des tâches à résoudre simultanément (reconnaissance d'entités, extraction de relations, liaison d'entités, prédiction d'issues cliniques). Ce mémoire présente HTGT-MED (Hierar- chical Temporal Graph Transformer for Medical NLP), une architecture multi-tâche conçue pour répondre conjointement à ces quatre contraintes. Le modèle combine un encodeur hiérarchique à quatre niveaux (mot, phrase, section, document) construit sur CLINICALBERT, un module de liaison d'entités vers l'UMLS avec détection explicite des concepts hors-ontologie (NIL), un graphe médical temporel enrichi d'un encodage sinusoïdal et d'une attention pondérée par la distance temporelle, ainsi qu'un module original de fusion adaptative texte-graphe - le T-HGCA (Temporal Hierarchical Gated Cross-Attention). L'entraînement des quatre tâches est équilibré par une pondération automatique fondée sur l'incertitude homoschédastique. Évalué sur les corpus MIMIC- III, BC5CDR, NCBI Disease et MedMentions, HTGT-MED atteint un score F1 de 0.7765 en reconnaissance d'entités, un F1 micro de 0.9894 en extraction de relations. une précision Top-1 de 0,5825 en liaison d'entités (Recall@10 = 0,9828), et une AUC- ROC de 0,623 pour la prédiction de réadmission à 30 jours. Une étude d'ablation sur cinq variantes confirme la contribution cumulative de chaque composant architectural. Les limites de l'approche couverture ontologique partielle, déséquilibre des classes en prédiction clinique, validation sur un nombre restreint de corpus - ainsi que les perspectives d'extension sont discutées en fin de mémoire. Mots-clés : NLP biomédical, Transformers, réseaux de neurones sur graphes, liaison d'entités, apprentissage multi-tâche, prédiction clinique, MIMIC-III, UMLS.