SWE-Bench Pro : benchmark jugé défaillant, OpenAI retire sa recommandation

Ny Ando A. - LeBigData - 09/07
SWE-Bench Pro : benchmark jugé défaillant, OpenAI retire sa recommandation - Les scores des IA dans les benchmarks font souvent les gros titres. Mais sont-ils vraiment fiables ? Difficile à dire.  Le 8 juillet 2026, OpenAI aUn audit du benchmark de codage "SWE-Bench Pro" fait par OpenAI avait mis en évidence un dysfonctionnement

Les scores des IA dans les benchmarks font souvent les gros titres. Mais sont-ils vraiment fiables ? Difficile à dire. 

Le 8 juillet 2026, OpenAI a par exemple révélé qu’un audit de SWE-Bench Pro avait mis en évidence un dysfonctionnement. Selon l’entreprise, environ 30 % des tâches contiennent des défauts qui peuvent fausser les résultats des modèles. 

Un modèle pouvait donc échouer alors qu’il avait produit une bonne solution… De même, il est possible qu’il réussisse sans avoir réellement résolu le prob...
[Courte citation de 8% de l'article original]

Loading...