Skip to content
Volver al índice
35Agente de códigoPuntuación provisional

SWE-agent

SWE-agent

Proyecto de investigación de Princeton que resuelve issues de GitHub de forma autónoma con el modelo de lenguaje que le des.

Actualizado el

SWE-agent preview

La reseña

SWE-agent es una herramienta de investigación de código abierto de Princeton y Stanford que proporciona a un modelo de lenguaje una interfaz estructurada para navegar por repositorios, leer archivos, editar código y ejecutar pruebas con el objetivo de resolver issues de GitHub de forma autónoma. Supera el 74 por ciento en SWE-bench Verified y ha dado lugar a mini-swe-agent, un sucesor de 100 líneas con resultados de benchmark comparables. La configuración se realiza mediante un único archivo YAML, lo que lo hace flexible para tareas personalizadas que incluyen investigación de vulnerabilidades de seguridad. El desarrollo activo del repositorio original está en modo de mantenimiento mientras el equipo se centra en mini-swe-agent, por lo que los equipos que buscan una experiencia completamente productiva deberían mirar en otro lugar.

Dónde destaca

  • Código abierto con sólido pedigree en el benchmark SWE-bench
  • Una sola configuración YAML cubre issues de GitHub, tareas de seguridad y flujos de trabajo personalizados
  • Funciona con cualquier LLM, incluidos Claude, GPT y modelos abiertos

Conviene saber antes

  • El repositorio original está en modo solo mantenimiento, sucedido por mini-swe-agent
  • Sin servicio alojado ni interfaz; requiere configuración local y claves de API

Puntuación del índice

74.4

Provisional. Esta puntuación se basa en las capacidades públicas del producto, no en la reconstrucción con un único prompt que pasaron las entradas completamente revisadas. Trátala como una estimación, no como un veredicto.

Craft70
Speed62
Control78
Value92
Clasificación
35 de 54
Crea para
Herramientas
Categoría
Agente de código
Resultado
Correcciones automáticas de issues de GitHub
Precio
Plan gratuito
Ideal para
Investigadores e ingenieros que evalúan autonomía a nivel de benchmark

Las puntuaciones son nuestro propio criterio editorial, ponderadas calidad 30, velocidad 25, control 25 y valor 20.