Projet de fin d'étude : Reconnaissance des Micro-Expressions Faciales dans des Séquences Vidéo par Architectures Transformers Hiérarchiques Spatio-Temporelles

Etudiant : LAMHAMDI DOUNIA

Filière : Master Machine Learning Avancé et Intelligence Multimédia (MLAIM)

Encadrant : Pr. MOHAMED ADNANE MAHRAZ

Annèe : 2026

Résumé : La reconnaissance automatique des micro-expressions faciales constitue un enjeu majeur à l’intersection de la vision par ordinateur et des sciences cognitives, avec des applications en sécurité, en santé mentale et en interaction homme-machine. L’architecture HTNet, fondée sur un mécanisme d’auto-attention locale hiérarchique, représente l’état de l’art récent du domaine (UF1 = 0,860), mais présente une limitation structurelle majeure : elle ne traite qu’une unique frame statique (l’apex) et ne modélise donc aucune dynamique temporelle, alors que la progression du mouvement musculaire entre l’onset et l’apex constitue une information discriminante essentielle des micro-expressions. Ce travail propose deux architectures originales étendant HTNet à la dimension temporelle. HTSRN (Hierarchical Transformer with Sequential Reasoning Network) adopte une stratégie séquentielle : un encodeur spatial identique à HTNet traite indépendamment T = 8 frames, puis deux modules originaux TemporalTokenizationBridge et GatedMultiScaleTemporalReasoning) raisonnent sur la dimension temporelle via une auto-attention inter-frames et une fusion adaptative multi-échelle. HTSRNv2+ propose une stratégie alternative de traitement spatio-temporel conjoint : un encodeur allégé sans agrégation finale préserve une carte spatiale enrichie par un contexte temporel (porte spatiale), puis traitée par des convolutions 3D (EfficientNet3DNano, TemporalHead3D). Les deux architectures, comptant environ 3,2 et 3,4 millions de paramètres respectivement, ont été évaluées selon le protocole standard Leave-One-Subject-Out (LOSO) sur le corpus composite CASME II + SMIC + SAMM. Une optimisation automatique des hyperparamètres par l’algorithme ASHA (Asynchronous Successive Halving Algorithm) a permis d’améliorer les performances des deux architectures par rapport à leur configuration manuelle initiale, portant les scores finaux à UF1 = 0,8525 pour HTSRN et UF1 = 0,8317 pour HTSRN v2+, plaçant nos deux contributions au-dessus de l’ensemble des méthodes antérieures à HTNet recensées dans la littérature, tout en restant légèrement en-deçà du score de référence de HTNet (UF1 = 0,860) HTSRN dépassant néanmoins ce dernier sur la métrique UAR (0,850 contre 0,848). L’analyse détaillée des résultats par sujet a permis de mettre en évidence un phénomène de surapprentissage localisé sur certains plis du protocole LOSO, documenté de manière transparente à l’aide de courbes d’apprentissage représentatives, et discuté à la lumière de la rareté structurelle des données de micro-expressions plutôt que d’un défaut de conception architecturale. Mots-clés : micro-expressions faciales, reconnaissance d’expressions, apprentissage profond, Transformeurs, auto-attention hiérarchique, dynamique temporelle, flot optique, HTNet, LOSO, optimisation d’hyperparamètres, ASHA.