Projet de fin d'étude : Reinforcement Learning-Based Agentic Judge Systems For Autonomous Assessment and Improvement of Large Language Model Reasoning
Etudiant : BOUDRAH AICHA
Filière : Master Big Data et Systèmes intelligents (BDSI)
Encadrant : Pr. RIFFI JAMAL
Annèe : 2026
Résumé : Ce mémoire examine dans quelle mesure les paradigmes d'apprentissage par renforcement (RL) peuvent améliorer les capacités de raisonnement des grands modèles de langage (LLMs) et soutenir leur évaluation systématique. Face à leur déploiement croissant sur des tâches inférentielles complexes et multi-étapes, les métriques statiques conventionnelles et les évaluations manuelles ont montré des limites significatives en termes de fiabilité et de passage à l'échelle. Pour répondre à ces limites, ce travail propose un cadre d'évaluation agentique automatisé fondé sur le RL et conduit une analyse comparative structurée de plusieurs stratégies de raisonnement, appliquées à deux domaines distincts : l'optimisation mathématique et l'analyse d'incidents de cybersécurité. L'évaluation repose sur un protocole LLM-as-a-Judge mobilisant des modèles évaluateurs indépendants. Les résultats montrent que l'affinage natif par RL produit les meilleures performances sur les tâches structurées, tandis que les approches de raisonnement itératif affichent un comportement plus stable entre les domaines. Ces résultats confortent l'idée que l'post-entraînement par RL réduit la dépendance aux guides de prompting artisanaux et génère un raisonnement plus robuste selon les types de tâches.