QIMMA valide les références avant d'évaluer les modèles, garantissant que les scores rapportés reflètent une véritable capacité de langue arabe dans les LLM.
🏆 Classement · 🔧 GitHub · 📄 Papier
Si vous avez suivi l'évaluation des LLM en arabe, vous avez probablement remarqué une tension croissante : le nombre de références et de classements augmente rapidement, mais mesurons-nous réellement ce que nous pensons mesurer ?
Nous avons construit QIMMA قمّة (arabe pour « sommet »), pour répondre systématiquement à cette question. Au lieu de regrouper les références arabes existantes telles quelles et d'exécuter des modèles sur celles-ci, nous avons appliqué un pipeline rigoureux de validation de la qualité avant toute évaluation. Ce que nous avons découvert donne à réfléchir : même les critères de référence arabes largement utilisés et appréciés contiennent des problèmes de qualité systématiques qui peuvent discrètement corrompre les résultats d’évaluation.
Cet article explique ce qu'est QIMMA, comment nous l'avons construit, les problèmes que nous avons trouvés et à quoi ressemble le classement des modèles une fois que vous avez nettoyé les choses.
L'arabe est parlé par plus de 400 millions de personnes dans divers dialectes et contextes culturels, mais le paysage de l'évaluation de la PNL arabe reste fragmenté. Quelques points clés ont motivé ce travail :
Problèmes de traduction. De nombreux repères arabes sont des traductions de l’anglais. Cela introduit des changements de répartition. Les questions qui semblent naturelles en anglais deviennent gênantes ou mal adaptées à la culture en arabe, ce qui rend les données de référence moins représentatives de la façon dont l'arabe est naturellement utilisé.
Absence de validation de qualité. Même les benchmarks natifs en arabe sont souvent publiés sans contrôles de qualité rigoureux. Les incohérences d'annotation, les réponses incorrectes, les erreurs d'encodage et les préjugés culturels dans les étiquettes de vérité terrain ont tous été documentés dans des ressources établies.
Lacunes de reproductibilité. Les scripts d'évaluation et les résultats par échantillon sont rarement rendus publics, ce qui rend difficile l'audit des résultats ou la mise à profit de travaux antérieurs.
Fragmentation de la couverture. Les classements existants couvrent des tâches isolées et des domaines restreints, ce qui rend difficile l'évaluation globale du modèle.
Pour illustrer où se situe QIMMA par rapport aux plates-formes existantes :
| Classement | Source ouverte | Arabe natif | Validation de la qualité | Évaluation du code | Résultats publics |
|---|---|---|---|---|---|
| OALL v1 | ✅ | Mixte | ❌ | ❌ | ✅ |
| OALL v2 | ✅ | Surtout | ❌ | ❌ | ✅ |
| BAUME | Partiel | 50% | ❌ | ❌ | ❌ |
| AraGen | ✅ | 100% | ❌ | ❌ | ❌ |
| SILMA ABL | ✅ | 100% | ✅ | ❌ | ✅ |
| ILMAAM | Partiel | 100% | ✅ | ❌ | ❌ |
| HELM arabe | ✅ | Mixte | ❌ | ❌ | ✅ |
| ⛰QIMMA | ✅ | 99% | ✅ | ✅ | ✅ |
QIMMA est la seule plate-forme combinant les cinq propriétés : open source, contenu majoritairement natif en arabe, validation systématique de la qualité, évaluation du code et sorties d'inférence publiques par échantillon.
QIMMA consolide 109 sous-ensembles de 14 références sources dans une suite d'évaluation unifiée de plus de 52...
[Courte citation de 8% de l'article original]