要約
OpenAIは、SWE-Bench Proというコーディング評価ベンチマークが多くの問題を抱えていることを発表しました。新たな監査によって、約30%のタスクが破損していると推定されています。この問題は、モデルの能力を正確に測定することが重要であることを示しており、誤った評価が安全性や研究の優先順位に影響を与える可能性があります。
SWE-Bench Proは、SWE-bench Verifiedを改善するために設計され、より現実的なコーディングタスクを通じてモデルの能力を測定することを目指していました。しかし、最近の調査で、タスクの設計やデータの問題が発覚し、意味のある評価を提供できなくなったことが明らかになりました。このため、OpenAIはモデル開発者に対して、ベンチマークの結果を慎重に検討するよう呼びかけています。
調査によると、問題の多くは、厳しすぎるテスト、指定が不足したプロンプト、カバレッジの低いテスト、誤解を招くプロンプトに関連しています。このような結果は、難易度の高いが公正なベンチマークを整備することの難しさを示しており、データ品質チェックにおけるエージェントの利用がますます重要になることを示唆しています。
元記事: https://openai.com/index/separating-signal-from-noise-coding-evaluations/
公開日: Wed, 08 Jul 2026 21:03:51 +0000
この記事はAIアシスト編集により作成されています。
📰 元記事: 元記事を読む