Projet de fin d'étude : SHAP-to-Narrative An LLM-Based Approach for Converting SHAP Explanations into Natural Language Narratives for Road Accident Severity Prediction

Etudiant : KHARBOUCH CHAIMAA

Filière : Master Big Data et Systèmes intelligents (BDSI)

Encadrant : Pr. BOUHOUTE AFAF

Annèe : 2026

Résumé : L’interprétabilité des modèles d’apprentissage automatique est devenue un enjeu majeur dans les domaines critiques tels que la sécurité routière. Bien que des méthodes comme SHAP permettent d’expliquer les prédictions, leurs sorties numériques restent souvent difficiles à comprendre pour les décideurs non-experts. Ce mémoire propose une approche innovante basée sur les Grands Modèles de Langage (LLMs) open-source pour transformer ces explications techniques en narratifs naturels, fidèles et actionnables. Face aux défis de l’hallucination et du manque de reproductibilité des API propriétaires, ce travail met en oeuvre un pipeline hybride intégrant une couche d’enrichissement sémantique déterministe et un algorithme de vérification automatisé à deux niveaux (R1/R2). Nous avons comparé deux modèles légers de 7 milliards de paramètres : Mistral-7B-Instruct-v0.3 et Qwen-2.5 -7B-Instruct, sur un jeu de données d’accidents routiers britanniques. Les résultats expérimentaux montrent que : — Mistral-7B atteint un taux de succès direct de 100% en Round 1, démontrant une conformité structurelle exceptionnelle grâce à son mécanisme d’attention par fenêtre glissante. — Qwen-2.5-7B obtient 83% en R1 mais produit des narratifs qualitativement supérieurs, avec une meilleure fluidité syntaxique et une reformulation naturelle des catégories. Les 17% restants sont récupérés avec succès via le mécanisme de secours R2. — L’analyse diagnostique révèle que les échecs de Qwen sont exclusivement catégoriels et sémantiques (paraphrases valides), confirmant que le modèle comprend parfaitement les données mais nécessite une vérification adaptée. En conclusion, ce projet démontre que des LLMs open-source légers peuvent générer des explications narratives fiables sans recourir à des API propriétaires. Notre framework hybride R1/R2 offre un compromis optimal entre rigueur mathématique et accessibilité humaine, ouvrant la voie à des systèmes d’IA explicative déployables localement dans des contextes critiques.