2026年、AIベンチマークの信頼性に大きな疑問が投げかけられています。Meta、OpenAI、Googleなどの主要AI企業が、公開リーダーボードでのスコアを操作していた実態が明らかになり、「ベンチマークスコアは本当にAIの能力を測っているのか?」という根本的な問いが浮上しています。
ベンチマーク操作の実態
研究者たちは、280万件のモデル比較記録を分析し、選択的なモデル提出によってスコアが最大100ポイント水増しされていたことを発見しました。各社は非公開テストを実施し、最も成績の良いバリアントだけをリーダーボードに提出していたのです。これにより、ベンチマーク競争は能力の測定ではなく、誰が最もうまくシステムを利用するかのゲームに変質していました。
データ汚染の問題
さらに深刻な問題として、データ汚染(Data Contamination)があります。StarCoder-7bの事例では、漏洩したデータとクリーンなデータでスコアが4.9倍も異なることが判明しました。トレーニングデータにベンチマークの問題が混入することで、モデルは「解く」のではなく「暗記する」状態になっていたのです。にもかかわらず、データ汚染の報告義務は業界で標準化されていません。
実務との乖離
高いコーディングベンチマークスコアの裏には、AI生成コードのバグ率が通常の4倍という現実が隠れています。トップモデルは数学・コーディング・QAベンチマークで軒並み90%以上を達成していますが、実際のワークフローではAPIを捏造したり、ツールをスキップしたり、ループに陥ったりします。テスト性能と実務での有用性のギャップは、かつてないほど広がっています。
業界の対応:独自評価への移行
こうした問題を受け、業界は公開ベンチマークから独自のドメイン特化テストへと移行し始めています。Artificial Analysisは、MMLU-Pro、AIME 2025、LiveCodeBenchなどの定番ベンチマークを撤廃し、AA-OmniscienceやStatistical Volatility Indexといった独自指標を採用しました。また、関数型ベンチマーク(Functional Benchmarks)と呼ばれる、問題の構造は同じだが具体的な数値を変えたテストも研究されています。
AIを選定する際の注意点
企業がAIツールを選定する際は、ベンチマークスコアだけを鵜呑みにせず、以下の点を確認することが重要です。第一に、自社のユースケースに近い実タスクでの評価を行うこと。第二に、複数のベンチマークを横断的に見ること。第三に、ベンダーが提示するスコアの評価条件(データセット、プロンプト形式、サンプル数)を確認すること。スコアの裏にある前提条件を理解することが、正しいAI選定の第一歩です。
AIの導入や選定でお悩みの方は、HelloCraftAIが実務に即したAIの活用支援を行っています。お気軽にご相談ください。