Nous présentons Smol AI WorldCup, le premier benchmark conçu spécifiquement pour les réalités de déploiement de petits modèles de langage. Au lieu de nous demander uniquement « à quel point est-il intelligent ? », nous posons cinq questions simultanément : à quel point est-il intelligent ? À quel point est-il honnête ? À quelle vitesse ? Quelle taille ? Quelle efficacité ?
Le résultat est SHIFT — un cadre d'évaluation à 5 axes — et WCS (WorldCup Score) — une métrique composite qui récompense les modèles atteignant à la fois une qualité élevée et une efficacité élevée.
| 🏟️ Classement en direct | huggingface.co/spaces/ginigen-ai/smol-worldcup |
| 📊 Ensemble de données (125Q, Apache 2.0) | huggingface.co/datasets/ginigen-ai/smol-worldcup |
| 🏅 Classement de TOUS les bancs | huggingface.co/spaces/FINAL-Bench/all-bench-leaderboard |
MMLU, GPQA et HumanEval appliquent le même test à un modèle 0,5B et à un modèle 500B. Cette approche présente trois angles morts fondamentaux en matière de déploiement de petits modèles :
1. Ils mesurent uniquement l’intelligence. Un ingénieur déployant l'IA sur un smartphone doit non seulement connaître « MMLU 70 », mais également savoir si le modèle tient dans 2 Go, à quelle fréquence il fabrique des informations et combien de jetons il génère par seconde.
2. Ils manquent les modes de défaillance spécifiques aux petits modèles. Nos mesures montrent qu'un modèle 1,3B fabrique du faux contenu confiant sur des personnes, des documents et des produits inexistants dans 80 % des cas lorsqu'il y est invité. Ce risque est invisible pour les indices de référence traditionnels.
3. Ils ne récompensent pas l’efficacité. Un modèle 14B ayant un score supérieur à un modèle 4B est attendu. Mais le fait que « 4B atteint 95 % de la qualité de 14B avec 36 % de RAM » est perdu dans un classement à une seule colonne. À l’ère de l’IA de pointe, ce qui compte, c’est la performance par unité de ressource.
SHIFT décompose la valeur de déploiement d'un petit modèle de langage en cinq axes mesurables :
| Axe | Signification | Comment mesuré | Questions |
|---|---|---|---|
| S — Taille | Empreinte du modèle | Nombre de paramètres, paramètres actifs (MoE) | Métadonnées |
| H — Honnêteté | Résistance aux hallucinations, calibrage, balance de refus | 40 questions, entièrement notées automatiquement | 40 |
| I - Renseignement | Raisonnement, mathématiques, codage, 7 langages, métacognition | 85 questions, juge auto + LLM | 85 |
| F — Rapide | Débit d'inférence | tok/s mesurés via l'API d'inférence HF | 15 échantillons |
| T – Économie | Consommation de ressources | Pic VRAM/RAM à la quantification du quatrième trimestre | Métadonnées |
Les petits modèles échouent différemment des grands modèles. L’échec le plus dangereux est la fabrication confiante. Nous testons quatre dimensions :
| Catégorie | Questions | Méthode | Ce qu'il attrape |
|---|---|---|---|
| H1 – Piège à hallucinations | 10 | json_field_check | Présente de fausses entités ; le modèle doit refuser de fabriquer |
| H2 — Calibrage de la confiance | 10 | calibrage_check | La confiance déclarée doit correspondre à la précision réelle |
| H3 — Solde de refus | 10 | refus_check | Pénalise à la fois le sur-refus et le sous-refus |
| H4 — Autocorrection | 10 | self_correction_check | Le modèle doit détecter et corriger ses propres erreurs de raisonnement |
| Catégorie | Questions | Méthode | Couverture |
|---|---|---|---|
| I1 — Raisonnement | 15 | réponse_match | Syllogismes, énigmes, reconnaissance de formes |
| I2 — Mathématiques | 10 | correspondance_numérique | L'ari... [Courte citation de 8% de l'article original] |