Skip to content
Voltar ao índice
35Agente de códigoPontuação provisória

SWE-agent

SWE-agent

Projeto de pesquisa de Princeton que resolve issues do GitHub de forma autônoma com o modelo de linguagem que você fornecer.

Atualizado em

SWE-agent preview

A análise

O SWE-agent é uma ferramenta de pesquisa de código aberto de Princeton e Stanford que fornece a um modelo de linguagem uma interface estruturada para navegar em repositórios, ler arquivos, editar código e executar testes a fim de resolver issues do GitHub de forma autônoma. Ele supera 74% no SWE-bench Verified e deu origem ao mini-swe-agent, um sucessor de 100 linhas com resultados de benchmark comparáveis. A configuração é feita por um único arquivo YAML, mantendo-o flexível para tarefas personalizadas incluindo pesquisa de vulnerabilidades de segurança. O desenvolvimento ativo está em modo de manutenção para o repositório original enquanto o time foca no mini-swe-agent, então times que querem uma experiência totalmente produtizada devem buscar outra opção.

Onde se destaca

  • Código aberto com histórico sólido de benchmarks no SWE-bench
  • Um único arquivo YAML de configuração cobre issues do GitHub, tarefas de segurança e fluxos personalizados
  • Funciona com qualquer LLM, incluindo Claude, GPT e modelos abertos

Vale saber antes

  • Repositório original em modo apenas de manutenção, substituído pelo mini-swe-agent
  • Sem serviço hospedado ou interface gráfica; exige configuração local e chaves de API

Pontuação do índice

74.4

Provisório. Esta pontuação é lida a partir das capacidades públicas do produto, não a partir da recriação com um único prompt pela qual os registros totalmente avaliados passaram — trate-a como uma indicação, não como um veredicto.

Craft70
Speed62
Control78
Value92
Posição
35 de 54
Constrói
Ferramentas
Categoria
Agente de código
Resultado
Correções automatizadas de issues do GitHub
Preço
Plano gratuito
Ideal para
Pesquisadores e engenheiros que avaliam autonomia em nível de benchmark

As pontuações são nosso julgamento editorial, ponderadas em qualidade 30, velocidade 25, controle 25 e custo-benefício 20.