Projet de fin d'étude : Apprentissage par renforcement multi-agent pour la cyberdéfense autonome

Etudiant : ER-ROUGBANI MOUAAD

Filière : Web Intelligence et Sciences des Données (WISD)

Encadrant : Pr. YAHYAOUYI ALI

Annèe : 2026

Résumé : La cyberdéfense autonome dans des infrastructures distribuées nécessite des agents capables de prendre des décisions coopératives à partir d’informations locales et partielles. Dans ce contexte, ce mémoire étudie l’apport de l’apprentissage par renforcement multi-agent associé aux réseaux neuronaux sur graphes pour la protection d’un environnement cybernétique dynamique. L’étude est menée dans le scénario CAGE~4 de la plateforme CybORG, dans lequel cinq agents défenseurs, appelés agents Blue, doivent protéger différentes zones d’une infrastructure contre des comportements adverses prédéfinis, tout en préservant le fonctionnement des activités légitimes. Les observations locales des agents sont représentées sous forme de graphes dynamiques afin de conserver les relations entre les systèmes, les services et les autres entités observées. Deux algorithmes d’apprentissage par renforcement multi-agent sont comparés : Independent Proximal Policy Optimization (IPPO), fondé sur des critiques locaux, et Multi-Agent Proximal Policy Optimization (MAPPO), qui utilise un critique centralisé pendant l’entraînement conformément au paradigme Centralized Training, Decentralized Execution. Deux encodeurs graphiques sont également étudiés : le Graph Convolutional Network (GCN) et le Graph Attention Network (GAT). Quatre configurations sont ainsi évaluées : IPPO--GCN, MAPPO--GCN, IPPO--GAT et MAPPO--GAT. Les résultats montrent que MAPPO--GCN obtient les meilleures performances globales dans les conditions expérimentales retenues. Le recours à un critique centralisé est associé à de meilleures récompenses que l’utilisation de critiques locaux pour les deux encodeurs étudiés. Les configurations fondées sur GCN dépassent également celles utilisant GAT, tout en présentant un coût computationnel plus faible. IPPO--GCN constitue néanmoins un compromis intéressant entre performance, simplicité architecturale et temps d’entraînement. Ces résultats restent limités par l’utilisation d’une seule exécution par configuration, l’absence de métriques comportementales détaillées et l’évaluation sur un seul scénario. Ils montrent toutefois l’intérêt de combiner apprentissage multi-agent, entraînement centralisé et représentations graphiques pour la cyberdéfense autonome.