インデックスに戻る
35コーディングエージェント暫定スコア
SWE-agent
SWE-agent
渡した言語モデルでGitHubのissueを自律的に解決する、プリンストン大の研究プロジェクト。
更新

評価
SWE-agentはプリンストン大学とスタンフォード大学によるオープンソースの研究ツールで、言語モデルにリポジトリを閲覧し、ファイルを読み、コードを編集し、テストを実行する構造化インターフェースを与え、GitHubのissueを自律的に修正する。SWE-bench Verifiedで74%超のスコアを記録し、比較可能なベンチマーク結果を持つ100行のmini-swe-agentも生んだ。設定は単一のYAMLファイルで行い、セキュリティ脆弱性研究などカスタムタスクにも柔軟に対応できる。元のリポジトリは開発がメンテナンスモードに移行しており、チームはmini-swe-agentに注力しているため、完全に製品化された体験を求めるチームは他を当たるべきだ。
特に優れている点
- SWE-benchの実績があるオープンソース
- 単一のYAML設定でGitHubのissue、セキュリティタスク、カスタムワークフローをカバー
- Claude、GPT、オープンモデルを含む任意のLLMで動作
先に知っておくべきこと
- 元のリポジトリはメンテナンス専用モードに移行しており、mini-swe-agentに引き継がれている
- ホスト型サービスもUIもなく、ローカルセットアップとAPIキーが必要
インデックススコア
74.4
暫定。このスコアは製品の公開情報に基づくものであり、完全レビュー済みエントリーが経た1プロンプト再現ビルドによるものではありません。判定としてではなく、位置づけとしてご参照ください。
Craft70
Speed62
Control78
Value92
- 順位
- 54件中35位
- 対応インデックス
- ツール
- カテゴリ
- コーディングエージェント
- 出力
- GitHubのissueの自動修正
- 料金
- 無料プランあり
- こんな人に最適
- ベンチマーク水準の自律性を評価する研究者や技術者
スコアは当編集部独自の判断であり、クラフト30、スピード25、コントロール25、コストパフォーマンス20の重み付けで算出しています。



