Des nouvelles ont été ajoutées en tête de listes.
Remontez pour les voir.
Inscription à la newsletter
SWE-Bench Pro : benchmark jugé défaillant, OpenAI retire sa recommandation
Ny Ando A. - LeBigData -
09/07
SWE-Bench Pro : benchmark jugé défaillant, OpenAI retire sa recommandation - Les scores des IA dans les benchmarks font souvent les gros titres. Mais sont-ils vraiment fiables ? Difficile à dire. Le 8 juillet 2026, OpenAI aUn audit du benchmark de codage "SWE-Bench Pro" fait par OpenAI avait mis en évidence un dysfonctionnement
Les scores des IA dans les benchmarks font souvent les gros titres. Mais sont-ils vraiment fiables ? Difficile à dire.
Le 8 juillet 2026, OpenAI a par exemple révélé qu’un audit de SWE-Bench Pro avait mis en évidence un dysfonctionnement. Selon l’entreprise, environ 30 % des tâches contiennent des défauts qui peuvent fausser les résultats des modèles.
Un modèle pouvait donc échouer alors qu’il avait produit une bonne solution… De même, il est possible qu’il réussisse sans avoir réellement résolu le prob... [Courte citation de 8% de l'article original]
Loading...
🍪
Le modèle économique de notre site repose sur l'affichage de publicités personnalisées basées sur l'utilisation de cookies publicitaires. En continuant votre visite sur notre site, vous consentez à l'utilisation de ces cookies.
Politique de confidentialité