QIMMA قِمّة ⛰ : Un classement LLM en arabe axé sur la qualité

HuggingFace - 21/04
Un article de blog du Technology Innovation Institute sur Hugging Face
Retour aux articles

QIMMA قِمّة ⛰ : Un classement LLM en arabe axé sur la qualité

Article communautaire publié le 21 avril 2026

QIMMA valide les références avant d'évaluer les modèles, garantissant que les scores rapportés reflètent une véritable capacité de langue arabe dans les LLM.

🏆 Classement · 🔧 GitHub · 📄 Papier

Si vous avez suivi l'évaluation des LLM en arabe, vous avez probablement remarqué une tension croissante : le nombre de références et de classements augmente rapidement, mais mesurons-nous réellement ce que nous pensons mesurer ?

Nous avons construit QIMMA قمّة (arabe pour « sommet »), pour répondre systématiquement à cette question. Au lieu de regrouper les références arabes existantes telles quelles et d'exécuter des modèles sur celles-ci, nous avons appliqué un pipeline rigoureux de validation de la qualité avant toute évaluation. Ce que nous avons découvert donne à réfléchir : même les critères de référence arabes largement utilisés et appréciés contiennent des problèmes de qualité systématiques qui peuvent discrètement corrompre les résultats d’évaluation.

Cet article explique ce qu'est QIMMA, comment nous l'avons construit, les problèmes que nous avons trouvés et à quoi ressemble le classement des modèles une fois que vous avez nettoyé les choses.

🔍 Le problème : l'évaluation de la PNL arabe est fragmentée et non validée

L'arabe est parlé par plus de 400 millions de personnes dans divers dialectes et contextes culturels, mais le paysage de l'évaluation de la PNL arabe reste fragmenté. Quelques points clés ont motivé ce travail :

Problèmes de traduction. De nombreux repères arabes sont des traductions de l’anglais. Cela introduit des changements de répartition. Les questions qui semblent naturelles en anglais deviennent gênantes ou mal adaptées à la culture en arabe, ce qui rend les données de référence moins représentatives de la façon dont l'arabe est naturellement utilisé.

Absence de validation de qualité. Même les benchmarks natifs en arabe sont souvent publiés sans contrôles de qualité rigoureux. Les incohérences d'annotation, les réponses incorrectes, les erreurs d'encodage et les préjugés culturels dans les étiquettes de vérité terrain ont tous été documentés dans des ressources établies.

Lacunes de reproductibilité. Les scripts d'évaluation et les résultats par échantillon sont rarement rendus publics, ce qui rend difficile l'audit des résultats ou la mise à profit de travaux antérieurs.

Fragmentation de la couverture. Les classements existants couvrent des tâches isolées et des domaines restreints, ce qui rend difficile l'évaluation globale du modèle.

Pour illustrer où se situe QIMMA par rapport aux plates-formes existantes :

ClassementSource ouverteArabe natifValidation de la qualitéÉvaluation du codeRésultats publics
OALL v1Mixte
OALL v2Surtout
BAUMEPartiel50%
AraGen100%
SILMA ABL100%
ILMAAMPartiel100%
HELM arabeMixte
⛰QIMMA99%

QIMMA est la seule plate-forme combinant les cinq propriétés : open source, contenu majoritairement natif en arabe, validation systématique de la qualité, évaluation du code et sorties d'inférence publiques par échantillon.

⛰ Qu'y a-t-il dans QIMMA ?

QIMMA consolide 109 sous-ensembles de 14 références sources dans une suite d'évaluation unifiée de plus de 52...
[Courte citation de 8% de l'article original]

Loading...