La comparaison des harnesses publiée par DeepSWE m'a intrigué, alors j'ai testé mini-swe-agent sur le même lot de tâches de débogage avec GPT-5.6 SOL High.
Les résultats actuels m'ont surpris :
- Codex CLI High : 151,91 M tokens, 60 % de réussite
- mini-swe-agent sans modification : 70,33 M tokens, 67 %
- le même mini harness avec seulement l'exécution de macros, sans changer le prompt : 60,59 M tokens, 78 %
Sur ces tâches, mini-swe-agent utilise donc environ 54 % de (…)