🏟️ Smol AI WorldCup : un benchmark à 5 axes qui révèle ce que les petits modèles de langage peuvent réellement faire

HuggingFace - 11/03
Un article de blog de FINAL_Bench sur Hugging Face
Retour aux articles

🏟️ Smol AI WorldCup : un benchmark à 5 axes qui révèle ce que les petits modèles de langage peuvent réellement faire

Article communautaire publié le 10 mars 2026
Un modèle 4B surpasse le 8B. Un MoE de 1,5 Go atteint une qualité de niveau Champions. Un 1,7B bat trois modèles 7 à 14B. Ce ne sont pas des affirmations hypothétiques : ce sont des résultats mesurés à partir de 18 modèles, 12 créateurs, 125 questions et 7 langues.

Nous présentons Smol AI WorldCup, le premier benchmark conçu spécifiquement pour les réalités de déploiement de petits modèles de langage. Au lieu de nous demander uniquement « à quel point est-il intelligent ? », nous posons cinq questions simultanément : à quel point est-il intelligent ? À quel point est-il honnête ? À quelle vitesse ? Quelle taille ? Quelle efficacité ?

Le résultat est SHIFT — un cadre d'évaluation à 5 axes — et WCS (WorldCup Score) — une métrique composite qui récompense les modèles atteignant à la fois une qualité élevée et une efficacité élevée.

🏟️ Classement en directhuggingface.co/spaces/ginigen-ai/smol-worldcup
📊 Ensemble de données (125Q, Apache 2.0)huggingface.co/datasets/ginigen-ai/smol-worldcup
🏅 Classement de TOUS les bancshuggingface.co/spaces/FINAL-Bench/all-bench-leaderboard

Le problème : les benchmarks existants n'ont pas été conçus pour Edge AI

MMLU, GPQA et HumanEval appliquent le même test à un modèle 0,5B et à un modèle 500B. Cette approche présente trois angles morts fondamentaux en matière de déploiement de petits modèles :

1. Ils mesurent uniquement l’intelligence. Un ingénieur déployant l'IA sur un smartphone doit non seulement connaître « MMLU 70 », mais également savoir si le modèle tient dans 2 Go, à quelle fréquence il fabrique des informations et combien de jetons il génère par seconde.

2. Ils manquent les modes de défaillance spécifiques aux petits modèles. Nos mesures montrent qu'un modèle 1,3B fabrique du faux contenu confiant sur des personnes, des documents et des produits inexistants dans 80 % des cas lorsqu'il y est invité. Ce risque est invisible pour les indices de référence traditionnels.

3. Ils ne récompensent pas l’efficacité. Un modèle 14B ayant un score supérieur à un modèle 4B est attendu. Mais le fait que « 4B atteint 95 % de la qualité de 14B avec 36 % de RAM » est perdu dans un classement à une seule colonne. À l’ère de l’IA de pointe, ce qui compte, c’est la performance par unité de ressource.

SHIFT : un cadre à 5 axes pour ce qui compte réellement

SHIFT décompose la valeur de déploiement d'un petit modèle de langage en cinq axes mesurables :

AxeSignificationComment mesuréQuestions
S — TailleEmpreinte du modèleNombre de paramètres, paramètres actifs (MoE)Métadonnées
H — HonnêtetéRésistance aux hallucinations, calibrage, balance de refus40 questions, entièrement notées automatiquement40
I - RenseignementRaisonnement, mathématiques, codage, 7 langages, métacognition85 questions, juge auto + LLM85
F — RapideDébit d'inférencetok/s mesurés via l'API d'inférence HF15 échantillons
T – ÉconomieConsommation de ressourcesPic VRAM/RAM à la quantification du quatrième trimestreMétadonnées

Honnêteté (H) — 40 questions

Les petits modèles échouent différemment des grands modèles. L’échec le plus dangereux est la fabrication confiante. Nous testons quatre dimensions :

CatégorieQuestionsMéthodeCe qu'il attrape
H1 – Piège à hallucinations10json_field_checkPrésente de fausses entités ; le modèle doit refuser de fabriquer
H2 — Calibrage de la confiance10calibrage_checkLa confiance déclarée doit correspondre à la précision réelle
H3 — Solde de refus10refus_checkPénalise à la fois le sur-refus et le sous-refus
H4 — Autocorrection10self_correction_checkLe modèle doit détecter et corriger ses propres erreurs de raisonnement

Intelligence (I) — 85 questions

CatégorieQuestionsMéthodeCouverture
I1 — Raisonnement15réponse_matchSyllogismes, énigmes, reconnaissance de formes
I2 — Mathématiques10correspondance_numériqueL'ari...
[Courte citation de 8% de l'article original]
Loading...