URL:     https://linuxfr.org/forums/programmationautre/posts/quelqu-un-utilise-vraiment-mini-swe-agent-pour-deboguer-ou-developper
Title:   Quelqu’un utilise vraiment mini-swe-agent pour déboguer ou développer ?
Authors: yohjisakamoto
Date:    2026-08-09T04:58:39+02:00
License: CC By-SA
Tags:    
Score:   -1


La comparaison des harnesses publiée par DeepSWE m'a intrigué, alors j'ai testé `mini-swe-agent` sur le même lot de tâches de débogage avec GPT-5.6 SOL High.

Les résultats actuels m'ont surpris :

- Codex CLI High : 151,91 M tokens, 60 % de réussite
- mini-swe-agent sans modification : 70,33 M tokens, 67 %
- le même mini harness avec seulement l'exécution de macros, sans changer le prompt : 60,59 M tokens, 78 %

Sur ces tâches, mini-swe-agent utilise donc environ 54 % de tokens en moins que Codex, avec 7 points de réussite en plus. Dans l'ablation où seule l'exécution change, les tokens baissent encore d'environ 14 % et le score gagne 11 points.

Cela ne prouve pas qu'il soit meilleur sur tous les dépôts. DeepSWE précise aussi que l'adaptation du system prompt peut expliquer une partie de l'écart. Mais pour le débogage, une architecture aussi simple que « bash + historique linéaire » semble étonnamment solide.

Est-ce que quelqu'un l'utilise vraiment au quotidien pour corriger des bugs ou développer des fonctionnalités ? Hors benchmark, qu'est-ce qui coince en premier : l'environnement, les tests longs, les permissions ou la qualité des patchs ?

- Mes résultats : https://turaai.net/benchmark
- mini-swe-agent : https://github.com/swe-agent/mini-swe-agent
- Explication de DeepSWE : https://deepswe.datacurve.ai/blog/deepswe

Transparence : je maintiens Tura et j'ai exécuté ce benchmark.
