Projet de fin d'étude : Apprentissage par renforcement pour la prise de décision en conduite autonome routière

Etudiant : FRI GHITA

Filière : Master Big Data et Systèmes intelligents (BDSI)

Encadrant : Pr. BOUMHIDI JAOUAD

Annèe : 2026

Résumé : L'e mergence des ve hicules autonomes constitue l'un des de fis majeurs de l'intelligence artificielle moderne, en raison de la complexite des environnements routiers et de la ne cessite de garantir simultane ment se curite , efficacite et robustesse des de cisions. Dans ce contexte, l'apprentissage par renforcement profond (Deep Reinforcement Learning) s'impose comme une approche prometteuse pour permettre a des agents autonomes d'apprendre des strate gies de conduite a partir de leurs interactions avec l'environnement. Ce me moire s'inscrit dans le cadre du Master Big Data et Syste mes Intelligents et e tudie l'application de l'apprentissage par renforcement profond a la prise de de cision pour les ve hicules autonomes dans le simulateur CÀRLÀ. Une premie re phase des travaux a e te consacre e a l'e tude de reproductibilite d'une approche hybride de changement de voie propose e dans la litte rature re cente. Les analyses mene es ont mis en e vidence plusieurs ambiguï te s me thodologiques et limitations architecturales empe chant la reproduction fide le des performances annonce es, conduisant ainsi a une re orientation scientifique du projet. Dans un second temps, une architecture expe rimentale reposant sur les algorithmes Proximal Policy Optimization (PPO) et Levy Flight Proximal Policy Optimization (LFPPO) a e te de veloppe e. L'objectif principal e tait d'e valuer l'apport d'un me canisme d'exploration inspire des vols de Le vy dans l'ame lioration des performances d'un agent autonome e voluant dans des environnements urbains dynamiques. Une imple mentation comple te des deux approches a e te re alise e au sein du simulateur CÀRLÀ, accompagne e d'un protocole expe rimental permettant de comparer leurs performances selon plusieurs indicateurs relatifs a la re ussite des missions, a la progression dans l'environnement, a la se curite et au confort de conduite. Les re sultats obtenus montrent que l'inte gration des vols de Le vy permet une ame lioration mode re e mais syste matique des performances de l'agent en termes de taux de succe s et de progression. Toutefois, les expe rimentations soulignent e galement la persistance de de fis importants lie s au respect des contraintes de circulation et a la conception de fonctions de re compense capables de concilier efficacite et se curite . Àu-dela des re sultats obtenus, ce travail met en e vidence l'importance des e tudes de reproductibilite dans la recherche en intelligence artificielle et souligne la ne cessite de de velopper des environnements expe rimentaux plus repre sentatifs des conditions de circulation re elles. Les perspectives ouvertes par ce me moire concernent notamment l'ame lioration des me canismes d'exploration, l'inte gration de donne es comportementales locales et l'e valuation des agents dans des sce narios de conduite plus complexes.