SWE-bench は、AI・大規模言語モデル (LLM) のソフトウェアエンジニアリング能力を評価するためのベンチマークフレームワークです。GitHub 上の実際のオープンソースリポジトリから収集された本物のバグ修正・Issue 解決タスクを使い、AIエージェントがどれほど現実的なコーディング問題を解けるかを定量的に計測します。
研究者・AIエンジニア・LLM開発者など、コーディングエージェントの性能を客観的に評価・比較したい方に適しています。特に新しいモデルやエージェントシステムを開発する際の標準的な評価指標として活用できます。
既存の LLM やコーディングエージェント (GPT-4、Claude、Gemini など) のコード生成・デバッグ能力を横断比較したい時、あるいは自社開発のAIシステムの実力をオープンな基準で示したい時に特に有用です。学術研究からプロダクト開発まで幅広い場面でリファレンスとして利用されています。
ジブンログ
AIと音声で面談するだけで職務経歴書が自動生成されるAIキャリアアシスタント。マイクに向かって話すだけでAIがキャリアをヒアリングし、職務経歴書のドラフトを自動作成。AIを相手にした面接練習(ロールプレイ)にも対応する。numoment 株式会社が提供する日本発のプロダクト。