Skip to content
インデックスに戻る
35コーディングエージェント暫定スコア

SWE-agent

SWE-agent

渡した言語モデルでGitHubのissueを自律的に解決する、プリンストン大の研究プロジェクト。

更新

SWE-agent preview

評価

SWE-agentはプリンストン大学とスタンフォード大学によるオープンソースの研究ツールで、言語モデルにリポジトリを閲覧し、ファイルを読み、コードを編集し、テストを実行する構造化インターフェースを与え、GitHubのissueを自律的に修正する。SWE-bench Verifiedで74%超のスコアを記録し、比較可能なベンチマーク結果を持つ100行のmini-swe-agentも生んだ。設定は単一のYAMLファイルで行い、セキュリティ脆弱性研究などカスタムタスクにも柔軟に対応できる。元のリポジトリは開発がメンテナンスモードに移行しており、チームはmini-swe-agentに注力しているため、完全に製品化された体験を求めるチームは他を当たるべきだ。

特に優れている点

  • SWE-benchの実績があるオープンソース
  • 単一のYAML設定でGitHubのissue、セキュリティタスク、カスタムワークフローをカバー
  • Claude、GPT、オープンモデルを含む任意のLLMで動作

先に知っておくべきこと

  • 元のリポジトリはメンテナンス専用モードに移行しており、mini-swe-agentに引き継がれている
  • ホスト型サービスもUIもなく、ローカルセットアップとAPIキーが必要

インデックススコア

74.4

暫定。このスコアは製品の公開情報に基づくものであり、完全レビュー済みエントリーが経た1プロンプト再現ビルドによるものではありません。判定としてではなく、位置づけとしてご参照ください。

Craft70
Speed62
Control78
Value92
順位
54件中35位
対応インデックス
ツール
カテゴリ
コーディングエージェント
出力
GitHubのissueの自動修正
料金
無料プランあり
こんな人に最適
ベンチマーク水準の自律性を評価する研究者や技術者

スコアは当編集部独自の判断であり、クラフト30、スピード25、コントロール25、コストパフォーマンス20の重み付けで算出しています。