La comparaison des harnesses publiée par DeepSWE m'a intrigué, alors j'ai testé mini-swe-agent sur le même lot de tâches de débogage avec GPT-5.6 SOL High.
Les résultats actuels m'ont surpris :
- Codex CLI High : 151,91 M tokens, 60 % de réussite
- mini-swe-agent sans modification : 70,33 M tokens, 67 %
- le même mini harness avec seulement l'exécution de macros, sans changer le prompt : 60,59 M tokens, 78 %
Sur ces tâches, mini-swe-agent utilise donc environ 54 % de tokens en moins que Codex, avec 7 points de réussite en plus. Dans l'ablation où seule l'exécution change, les tokens baissent encore d'environ 14 % et le score gagne 11 points.
Cela ne prouve pas qu'il soit meilleur sur tous les dépôts. DeepSWE précise aussi que l'adaptation du system prompt peut expliquer une partie de l'écart. Mais pour le débogage, une architecture aussi simple que « bash + historique linéaire » semble étonnamment solide.
Est-ce que quelqu'un l'utilise vraiment au quotidien pour corriger des bugs ou développer des fonctionnalités ? Hors benchmark, qu'est-ce qui coince en premier : l'environnement, les tests longs, les permissions ou la qualité des patchs ?
- Mes résultats : https://turaai.net/benchmark
- mini-swe-agent : https://github.com/swe-agent/mini-swe-agent
- Explication de DeepSWE : https://deepswe.datacurve.ai/blog/deepswe
Transparence : je maintiens Tura et j'ai exécuté ce benchmark.
Envoyer un commentaire
Suivre le flux des commentaires
Note : les commentaires appartiennent à celles et ceux qui les ont postés. Nous n’en sommes pas responsables.