DukaanBench : L'IA peut-elle gérer une épicerie indienne pendant 30 jours ?

HuggingFace - 29/06
Un article de blog d'Ekansh Srivastva sur Hugging Face
Retour aux articles

DukaanBench : L'IA peut-elle gérer une épicerie indienne pendant 30 jours ?

Article communautaire
Publié le 27 juin 2026

Partie 1 : Tests de simulation, de harnais et de Frontier LLM

La plupart des tests d'IA demandent à un modèle de répondre. DukaanBench demande à un modèle d'opérer.

Dans DukaanBench, un modèle linguistique gère un petit magasin indien de kirana pendant 30 jours simulés. Chaque matin, il reçoit l'état du magasin, les ventes récentes et les échecs, l'inventaire, la trésorerie, la confiance, la météo, les signaux des clients, l'exposition au khata, le marketing actif et un profil de quartier fixe. Il doit renvoyer une action JSON exécutable avant l'ouverture de la boutique. Le backend simule ensuite les clients, les ruptures de stock, les paiements, le khata, le gaspillage, les effets marketing, le mouvement de confiance et les récompenses.

Au cours des 30 jours, l'IA subit la pression ordinaire du magasinage : elle commence avec des liquidités et des étagères limitées, décide quoi commander à nouveau, protège les produits essentiels à rotation rapide, gère les stocks périssables, choisit de vendre des produits à prix réduit ou de les commercialiser, rappelle les clients khata, puis regarde les clients simulés se faire servir ou repartir déçus. Chaque jour laisse une trace. L'argent liquide, les stocks, la confiance, la mémoire des clients et les demandes manquées se retrouvent le lendemain matin.

La question est volontairement pratique :

Une IA peut-elle réaliser des bénéfices sans perdre la confiance des clients ?

Il s'agit de la première partie du projet. La première partie publie l'environnement, l'arène, le classement en direct et les premières leçons du comportement du modèle. La deuxième partie utilisera les traces au niveau journalier pour former un modèle de commerçant plus petit et tester si un SLM ciblé peut mieux apprendre cet environnement qu'un modèle général avec une longue invite.

Projet en direct :

  • Page Web : search.becapable.in/dukaanbench
  • Rediffusion de l'arène : search.becapable.in/dukaanbench/arena-2

Aperçu de la méthodologie

La première partie est un aperçu de la recherche sur le benchmark, et non un ensemble de données de formation publié pour l'instant.

  • Même monde de départ : chaque modèle obtient le même magasin fictif fixe, la même caisse d'ouverture, le même ensemble de SKU, la même mémoire client et le même profil de quartier.
  • Même horizon : chaque run correspond à 30 jours d'atelier simulés.
  • Même contrat d’action : une action JSON exécutable par jour.
  • Même moteur : le validateur, le simulateur client, les mises à jour d'état et la logique de notation sont partagés entre les modèles.
  • Même surface en direct : le classement et le replay Arena sont servis depuis l'application DukaanBench déployée.
  • Classement capturé : le tableau ci-dessous reflète l'API Arena en direct le 27 juin 2026.

Les traces sont déjà utiles pour l'analyse, la relecture et la planification de la partie 2. L'ensemble de données de formation public et la publication du petit modèle sont intentionnellement laissés pour la partie 2, une fois le format de trace nettoyé et documenté.

Pourquoi une Kirana ?

Une boutique Kirana est un petit système d'exploitation pour le commerce de quartier.

Le commerçant ne se contente pas d’acheter et de vendre des marchandises. Ils lisent les horaires scolaires, les cycles salariaux, les jours de pluie, les festivals, les contraintes des fournisseurs, le risque d'expiration, les habitudes des clients, les relations de crédit et la concurrence locale. Manquer un paquet de lait n’est pas seulement une vente manquée. Si cela arrive deux fois à un client régulier, cela devient un problème de confiance.

Cela fait d'un kirana une référence utile pour les agents IA car il combine :

  • liquidités limitées
  • demande incertaine
  • inventaire périssable
  • visites fréquentes des clients
  • crédit informel via khata
  • commercialisation locale
  • mémoire relationnelle
  • conséquences différées

DukaanBench utilise un magasin fictif mais fixe, Shree Shyam Bhandar, sur Nehru Colony School Road. Chaque modèle fait face au même quartier : des appartements à proximité, une école, un arrêt de bus, une petite rue de marché et des clients réguliers avec un comportement de confiance et de khata différent.

La boucle de référence

Un épisode correspond à un jeu complet de 30 jours. Une étape correspond à une journée de magasinage.

La boucle quotidienne est :

  1. Observez : le modèle reçoit du JSON décrivant les signaux de la boutique, de l'inventaire, de la mémoire client, du khata, du marketing, de l'historique récent et de l'environnement.
  2. Act : le modèle renvoie une action JSON pour demain.
  3. Valider : le backend vérifie que l'action est analysable, abordable, exécutable et cohérente avec la justification du modèle.
  4. Simulez : les clients visitent, demandent des articles, paient en espèces ou en khata, font face aux commandes ou aux ruptures de stock et mettent à jour la confiance.
  5. Score : le backend calcule la récompense journalière et conserve la trace complète.

Le modèle ne contrôle pas directement les clients. Il contrôle le projet du commerçant.

L'action JSON peut inclure :

{ "commandes": {"milk": 20, "bread": 10}, "removals": {}, "discounts": {"bananes": 10}, "khataReminders": ["mrs_sharma"], "marketingActions": [ {"specId": "whatsapp_status", "targetProducts": ["milk...
[Courte citation de 8% de l'article original]
Loading...