Projet de fin d'étude : Approches avancées pour la sécurisation des grands modèles de langage
Etudiant : TAIBA OTMAN
Filière : Master Machine Learning Avancé et Intelligence Multimédia (MLAIM)
Encadrant : Pr. RIFFI JAMAL
Annèe : 2026
Résumé : Ce mémoire présente un système Red Team / Blue Team pour la sécurisation des Grands Modèles de Langage, où un agent offensif génère des prompts adversariaux et un agent défensif apprend à produire des réponses robustes. L'architecture repose sur quatre agents : Red Team (15 stratégies CoT), modèle cible, Blue Team (5 stratégies CoT) et un juge LLM-as-a-Judge pour l'évaluation automatique. L'interaction attaque-défense est formalisée comme un processus de décision markovien optimisé par l'algorithme PPO, avec une comparaison approfondie avec DPO et GRPO. L'implémentation utilise des Small Language Models (Qwen2-0.5B et 1.5B) avec QLoRA et quantification NF4, permettant un entraînement efficace sur GPU Tesla T4. Les résultats sur 300 épisodes montrent un score Defense moyen de 8,53/10, une réduction de 40% du score Harm, et un taux de victoires Blue Team de 71,3%. L'intégration des stratégies CoT apporte un gain significatif de +8,3 points de victoires par rapport à PPO seul. Les attaques les plus efficaces exploitent la crédibilité perçue (roleplay journalist, Harm=6,31) tandis que la Blue Team privilégie les approches fermes (counter_roleplay à 38%). La convergence est atteinte après 150 épisodes avec une réduction de 75% de la perte PPO de la Red Team. Ce travail valide l'approche Purple Team basée sur l'apprentissage par renforcement comme solution efficace pour l'évaluation et l'amélioration continue de la sécurité des LLM. Les perspectives incluent l'expérimentation de GRPO, l'extension à des modèles plus grands et le déploiement en production avec monitoring continu.