varies

Princeton NLP / SWE-bench Team

AIコーディングエージェントの実力を測る、ソフトウェアエンジニアリング特化ベンチマーク

Code

varies の詳細

SWE-bench は、AI・大規模言語モデル (LLM) のソフトウェアエンジニアリング能力を評価するためのベンチマークフレームワークです。GitHub 上の実際のオープンソースリポジトリから収集された本物のバグ修正・Issue 解決タスクを使い、AIエージェントがどれほど現実的なコーディング問題を解けるかを定量的に計測します。

研究者・AIエンジニア・LLM開発者など、コーディングエージェントの性能を客観的に評価・比較したい方に適しています。特に新しいモデルやエージェントシステムを開発する際の標準的な評価指標として活用できます。

既存の LLM やコーディングエージェント (GPT-4、Claude、Gemini など) のコード生成・デバッグ能力を横断比較したい時、あるいは自社開発のAIシステムの実力をオープンな基準で示したい時に特に有用です。学術研究からプロダクト開発まで幅広い場面でリファレンスとして利用されています。

主な機能

実際の GitHub Issue を使ったリアルタスク評価 / 複数LLM・エージェントのスコア横断比較 / Python 製オープンソースリポジトリに基づくテストスイート / Pass@k 形式の定量的スコアリング / SWE-bench Lite・SWE-bench Verified など難易度別バリアント提供 / リーダーボードによる最新モデルのランキング公開 / 再現可能な評価環境のセットアップ支援

基本情報

開発元
Princeton NLP / SWE-bench Team
対応プラットフォーム
web

口コミ・評価

このツールの最初の口コミを書きませんか?

星をタップして評価

匿名で投稿できます・30秒ほどで完了します