SWE-Bench Pro監査、AI評価はデータ品質の時代へ
OpenAIはSWE-Bench Proを詳細に監査し、公開タスクの約3割に壊れた課題があると推定しました。AIモデルの性能比較はベンチマークの点数だけでなく、問題文、テスト、採点基準が本当に能力を測っているかを検証する段階に入っています。
何が分かったのか
OpenAIはSWE-Bench Proを監査し、タスクの一部に厳しすぎるテスト、曖昧な問題文、低いテスト網羅などの問題があると報告しました。
なぜ重要なのか
ベンチマークが壊れていると、モデルの能力を過大評価または過小評価します。安全な公開判断や研究投資の優先順位も誤りやすくなります。
研究への影響
今後は、難しい評価セットを作るだけでなく、評価データ自体を人間とAIで監査する仕組みが重要になります。点数よりも測定の信頼性が問われます。