varies

Princeton NLP / SWE-bench Team

AIコーディングエージェントの実力を測る、ソフトウェアエンジニアリング特化ベンチマーク

料金 オープンソース(MITライセンス・無料)/SaaS版・有料プランの提供はなし
みんなの評価 口コミを書く まだ口コミがありません
API提供 なし
Code

varies の詳細

SWE-bench は、AI・大規模言語モデル (LLM) のソフトウェアエンジニアリング能力を評価するためのベンチマークフレームワークです。GitHub 上の実際のオープンソースリポジトリから収集された本物のバグ修正・Issue 解決タスクを使い、AIエージェントがどれほど現実的なコーディング問題を解けるかを定量的に計測します。

研究者・AIエンジニア・LLM開発者など、コーディングエージェントの性能を客観的に評価・比較したい方に適しています。特に新しいモデルやエージェントシステムを開発する際の標準的な評価指標として活用できます。

既存の LLM やコーディングエージェント (GPT-4、Claude、Gemini など) のコード生成・デバッグ能力を横断比較したい時、あるいは自社開発のAIシステムの実力をオープンな基準で示したい時に特に有用です。学術研究からプロダクト開発まで幅広い場面でリファレンスとして利用されています。

主な機能

実際の GitHub Issue を使ったリアルタスク評価 / 複数LLM・エージェントのスコア横断比較 / Python 製オープンソースリポジトリに基づくテストスイート / Pass@k 形式の定量的スコアリング / SWE-bench Lite・SWE-bench Verified など難易度別バリアント提供 / リーダーボードによる最新モデルのランキング公開 / 再現可能な評価環境のセットアップ支援

varies の主な用途

  • LLMのコーディング能力を標準ベンチマークで評価したい時
  • 自社開発AIエージェントの性能を他モデルと客観比較したい時
  • AI研究論文でコード生成モデルの評価指標を示したい時
  • GitHub Issue の自動解決能力を測定したい時
  • 新しいコーディングエージェントのリーダーボード順位を確認したい時

向いているユーザー

  • AIリサーチャー
  • LLM開発エンジニア
  • コーディングエージェント開発者
  • データサイエンティスト
  • ソフトウェアエンジニア

基本情報

開発元
Princeton NLP / SWE-bench Team
対応プラットフォーム
web

口コミ・評価

このツールの最初の口コミを書きませんか?

星をタップして評価

匿名で投稿できます・30秒ほどで完了します