SWE-bench は、AI・大規模言語モデル (LLM) のソフトウェアエンジニアリング能力を評価するためのベンチマークフレームワークです。GitHub 上の実際のオープンソースリポジトリから収集された本物のバグ修正・Issue 解決タスクを使い、AIエージェントがどれほど現実的なコーディング問題を解けるかを定量的に計測します。
研究者・AIエンジニア・LLM開発者など、コーディングエージェントの性能を客観的に評価・比較したい方に適しています。特に新しいモデルやエージェントシステムを開発する際の標準的な評価指標として活用できます。
既存の LLM やコーディングエージェント (GPT-4、Claude、Gemini など) のコード生成・デバッグ能力を横断比較したい時、あるいは自社開発のAIシステムの実力をオープンな基準で示したい時に特に有用です。学術研究からプロダクト開発まで幅広い場面でリファレンスとして利用されています。
monterey ai
顧客の声を一元管理し、フィードバック収集・分析・アクションまでを自動化するAIプラットフォーム