Notre agent AI + 3,7 Sonnet s'est classé n ° 1 sur le banc polyglot d'Aider - un score de 76,4%

DEV - 18/03
Nous avons construit un agent d'IA open source pour la programmation dans IDE, et il s'est classé n ° 1 sur le polyglot d'Aider ...

Nous avons construit un agent d'IA open source pour la programmation dans IDE, et il s'est classé n ° 1 sur la référence Polyglot d'Aider avec un score de 76,4%. La référence teste une résolution de problèmes autonomes sur 225 des exercices de codage les plus durs à travers C ++, GO, Java, JavaScript, Python et Rust.

Avec ce score, nous avons surpassé les 60,4% d'Aider avec le même modèle, Claude 3.7 Sonnet, ainsi que Deepseek Chat V3, GPT-4.5 Aperçu et ChatGPT-4O.

Comment? Notre agent AI utilise une approche itérative de résolution de problèmes: il écrit du code, le valide, corrige les erreurs et se répète jusqu'à ce que la tâche soit résolu correctement. Pas de raccourcis - juste des résultats fiables et prêts pour la production.

Bien que SWE Bench attire beaucoup d'attenti...
[Courte citation de 8% de l'article original]

Loading...