英国AI Security Institute、標準ベンチマークはAIエージェント能力を系統的に過小評価と実証
英国AI Security Institute、標準ベンチマークはAIエージェント能力を系統的に過小評価と実証
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-04 |
| 元記事 | The Decoder |
要約
英国のAI Security Instituteが、標準ベンチマークのトークン予算制限がAIエージェントの実際の能力を系統的に過小評価していることを実証した研究を発表した。評価時に課されるリソース制約を解除すると、複数のタスクで性能が大幅に向上することが確認された。この知見はAIリスク評価の方法論に根本的な問いを投げかけており、規制当局がベンチマーク評価結果を基に安全性判断を下すことへの警鐘となる。現実に即したAI能力評価手法の開発が、政策立案・規制の実効性確保において喫緊の課題であることが示された。