AIサーチエージェントは「正しい質問を聞く能力」が欠如——DiscoBenchで精度43%を記録
AIサーチエージェントは「正しい質問を聞く能力」が欠如——DiscoBenchで精度43%を記録
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-06 |
| 元記事 | The Decoder |
要約
新ベンチマーク「DiscoBench」は、AIサーチエージェントがあいまいなクエリを受けた際の対処能力を評価するために設計された。結果、エージェントは検索自体よりも「曖昧さが生じた際に適切な確認質問をする能力」に大きな欠陥があることが判明し、全体精度は43%にとどまった。あいまいさを除去した場合には精度が最大40ポイント改善されることも確認されており、「何を検索するか」ではなく「何を確認すべきか」の判断誤りが主要な失敗要因であることが示された。エージェントの実業務導入において、曖昧クエリへの対応力強化が重要な技術課題として浮き彫りになった。