Projet de fin d'étude : Conception d'outils automatiques pour l'OCR de Documents Juridiques Arabes
Etudiant : AZARHOUN EL HOUCINE
Filière : Master Web Intelligence et Sciences des Données (WISD)
Encadrant : Pr. MOHAMED ADNANE MAHRAZ
Annèe : 2026
Résumé : Ce projet visait à concevoir, optimiser et déployer un système automatique de reconnaissance optique de caractères adapté aux spécificités typographiques et linguistiques des documents juridiques arabes marocains. Au terme de ce travail, nous pouvons affirmer que les objectifs fixés ont été largement atteints, et que les contributions apportées ouvrent des perspectives prometteuses pour l’intelligence documentaire en contexte multilingue et contraint. Sur le plan scientifique et technique, nous avons démontré l’efficacité d’une approche hybride combinant modèles de vision-langage (VLM) et grands modèles de langage (LLM) pour le traitement de textes arabes non latins. Le fine-tuning du modèle Chandra OCR 2 sur un corpus de dix polices juridiques représentatives, via la méthode QLoRA, a permis une réduction spectaculaire du taux d’erreur caractère (CER), passant de 8,3 % à 2,44 % sur les polices standardisées, et de 24,7 % à 9,37 % sur les polices calligraphiques complexes. Ces résultats confirment que l’adaptation du modèle au domaine cible est non seulement possible avec des ressources limitées (24 Go de VRAM), mais également indispensable pour atteindre une qualité opérationnelle.