Projet de fin d'étude : Analyse comparative des stratégies de décodage dans les modèles génératifs texte et image
Etudiant : EL AMMARY IBTISSAME
Filière : Master Big Data et Systèmes intelligents (BDSI)
Encadrant : Pr. EN-NAHNAHI NOUREDDINE
Annèe : 2026
Résumé : Ce mémoire propose une analyse comparative et un cadre d’évaluation unifié des algorithmes de décodage dans deux familles de modèles génératifs : les modèles texte autoregressifs (Qwen2.5-1.5B-Instruct, SmolLM2-1.7B-Instruct) et les modèles image par diffusion (Stable Diffusion v1.5). L’objectif est d’isoler la phase d’inférence pour en cartographier systématiquement les propriétés sur quatre axes : qualité, diversité, robustesse et efficacité. Nous formalisons d’abord une taxonomie fonctionnelle transmodale qui classe les mécanismes de décodage (température, Top-k, Top-p, CFG, scheduler) selon leur fonction systémique, en refusant l’amalgame simpliste entre modalités. Un protocole expérimental reproductible est ensuite mis en place, incluant des hypothèses expérimentales claires (H1- H4) et une méthodologie statistique maîtrisée (Kruskal-Wallis, Spearman, tailles d’effet, bootstrap). Les expérimentations portent sur N = 4 550 observations texte et N = 6 300 observations image. Les résultats révèlent que l’influence des hyperparamètres de décodage est plus limitée que suggéré par la littérature sur les modèles compacts : seules la température (ρ ≈ −0, 119 sur ROUGE-L) et la taille du faisceau offrent un levier significatif en texte, tandis que le CFG constitue le levier dominant en image (ρ = +0, 51 sur CLIPScore). L’identité numérique totale observée entre Greedy, Top-k(20) et Top-p(0,8) sur Qwen, ainsi qu’entre CFG = 0,0 et CFG = 1,0 sur Stable Diffusion, confirme que l’efficacité d’un hyperparamètre dépend moins de sa définition algorithmique que de la forme de la distribution qu’il filtre. Une architecture de compromis commune est mise en évidence, avec une inversion du sens entre modalités (T↑ → qualité↓ en texte vs CFG↑ → qualité↑ en image) et une asymétrie d’amplitude (×4). Le mémoire conclut par des recommandations pratiques différenciées par scénario d’usage et par modalité.