Skip to content
Retour à l'index
35Agent de développementNote provisoire

SWE-agent

SWE-agent

Projet de recherche de Princeton qui résout des tickets GitHub de façon autonome, avec le modèle de langage que tu fournis.

Mis à jour le

SWE-agent preview

Notre lecture

SWE-agent est un outil de recherche open source de Princeton et Stanford qui donne à un modèle de langage une interface structurée pour naviguer dans des dépôts, lire des fichiers, modifier du code et exécuter des tests afin de résoudre des tickets GitHub de façon autonome. Il obtient plus de 74 % sur SWE-bench Verified et a donné naissance à mini-swe-agent, un successeur de 100 lignes aux résultats de benchmark comparables. La configuration se fait via un seul fichier YAML, ce qui le rend flexible pour des tâches personnalisées, y compris la recherche de vulnérabilités de sécurité. Le développement actif du dépôt original est en mode maintenance pendant que l'équipe se concentre sur mini-swe-agent ; les équipes souhaitant une expérience entièrement industrialisée doivent regarder ailleurs.

Là où il brille

  • Open source avec un solide pedigree sur le benchmark SWE-bench
  • Une seule config YAML couvre les tickets GitHub, les tâches de sécurité et les workflows personnalisés
  • Fonctionne avec n'importe quel LLM, dont Claude, GPT et les modèles open source

À savoir avant

  • Le dépôt original est en mode maintenance uniquement, remplacé par mini-swe-agent
  • Aucun service hébergé ni interface graphique ; nécessite une installation locale et des clés API

Note de l'index

74.4

Provisoire. Cette note est établie à partir des capacités publiques du produit, et non de la reconstruction en une consigne qu'ont subie les entrées entièrement évaluées. À lire comme un positionnement, pas comme un verdict.

Craft70
Speed62
Control78
Value92
Rang
35 sur 54
Construit pour
Outils
Catégorie
Agent de développement
Résultat
Corrections automatisées de tickets GitHub
Tarif
Offre gratuite
Idéal pour
Les chercheurs et ingénieurs qui évaluent l'autonomie au niveau des benchmarks

Les notes sont notre propre jugement éditorial, pondéré ainsi : soin 30, vitesse 25, contrôle 25 et rapport qualité-prix 20.