新ベンチマーク、AIが実際の知識業務の3%しか完全解決できないことを示す
新ベンチマーク、AIが実際の知識業務の3%しか完全解決できないことを示す
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-06-20 |
| 元記事 | The Decoder |
要約
新たに公開されたベンチマークにより、最先端のAIモデルでも現実的な知識業務タスクを完全に解決できる割合はわずか3%に留まることが明らかになった。既存のベンチマークはモデルが得意とする形式化された問題設定が多く、実務で求められる複雑な情報統合・判断・長文推論の能力を十分に評価できていないという批判が背景にある。今回のベンチマークはコンサルティング・法律・研究調査など実際のプロフェッショナル業務を模した課題を設定しており、測定基準の現実性を高めた点が特徴だ。AI能力の過大評価に歯止めをかける重要な知見であり、エンタープライズ導入を検討する企業にとってもリスク評価の参考となる。