DeepMind、世界初の「ダブルブラインドAI評価」をパイロット実施
DeepMind、世界初の「ダブルブラインドAI評価」をパイロット実施
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-08-28 |
| 元記事 | Google DeepMind Blog |
要約
AIモデルの能力評価では、評価者がモデルの開発元を知ることでバイアスが生じる問題が指摘されてきた。DeepMindは評価者も評価対象モデルも互いに情報を隠す「ダブルブラインドAI評価」を世界で初めてパイロット実施した。臨床試験で実績のある二重盲検法をAI評価に適用することで、開発元による恣意的なベンチマーク設計や評価バイアスを排除し、客観的な性能測定が可能となる。AI開発における信頼性の高い評価手法の確立は、業界全体の安全性・透明性向上にもつながると期待される。