Anthropic Opus 5、ARC-AGI-3でFable 5とGPT-5.6 Solを大幅上回る
Anthropic Opus 5、ARC-AGI-3でFable 5とGPT-5.6 Solを大幅上回る
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-27 |
| 元記事 | The Decoder |
要約
ARC-AGI-3は、学習データに含まれないタスクを解決できるかを測定する汎用知能ベンチマークであり、対話型環境でルール推論と段階的実行を要求する。従来の最高記録はOpenAI GPT-5.6 Solの7.8%だった。Anthropicの「Claude Opus 5」が同ベンチマークで30.2%を達成し、前記録をほぼ4倍上回った。同社は「より強い論理的推論能力が、未知環境での自律的探索と計画を可能にする」と分析しており、代数記法への変換や反射方程式の独立的定式化など従来見られない行動が確認された。ただし独立テスト(Witnessベンチマーク)では改善幅が小さく、ジャンル固有データへの適応学習の可能性も指摘されており、汎用推論の実質的進展かベンチマーク特化最適化かについて議論が続いている。