OpenAI が Separating signal from noise in coding evaluations を発表 ── 人気ベンチマーク「SWE-Bench Pro」の欠陥を指摘
AIのコーディング能力を測る際、みんなが当たり前に使っていたベンチマークテストに重大な欠陥があるかもしれない――。OpenAIの最新分析がそんな衝撃の事実を突きつけている。テストの信頼性が揺らぐと、モデルの真の実力がさっぱり見えなくなってしまう。AI評価の根本を揺るがすなかなか厄介な報告だ。
▸何が変わったのか
OpenAIの新しい分析により、人気のコーディングベンチマークである「SWE-Bench Pro」に深刻な問題があることが明らかになった。これにより、AIモデルを評価する際の信頼性と正確性に大きな懸念が生じている。具体的な数値や新機能などの詳細については現時点では不明。
◈技術背景と意義
「SWE-Bench Pro」は、AIが実際のソフトウェア開発のバグ修正などをどれだけ解決できるかを測るテストだ。しかしここで、本当に測るべきシグナルと関係のないノイズが混ざってしまうと、正しいスコアが出せない。OpenAIはこのままではAIがどこまで進化したのか正確に把握できなくなると警告している。本当の実力を見極めるための、重要な一歩と言える。
SOURCE: OpenAI (2026-07-08)