核サボタージュマルウェア解析ベンチマーク:GPT-5.6 Solのみ8段階を完全クリア、他のAIは途中で停滞
核サボタージュマルウェア解析ベンチマーク:GPT-5.6 Solのみ8段階を完全クリア、他のAIは途中で停滞
| 項目 | 内容 |
|---|---|
| ジャンル | セキュリティ |
| 日付 | 2026-07-24 |
| 元記事 | SecurityWeek |
要約
SentinelOneが、2005年のWindowsマルウェア「Fast16」(イランの核兵器開発関連ソフトを妨害したとされる)を対象に、AIモデルの長期的な逆エンジニアリング能力を測定するベンチマークを開発した。GPT-5.5・5.6 Sol(OpenAI)、GLM-5.2(Z.ai)、Opus(Anthropic)など複数のフロンティアモデルが8段階のタスクに挑んだ結果、「GPT-5.6 Solのみが全段階を完了」し、他モデルは初期段階で停滞した。評価の核心は誤った結論を撤回しその影響を追跡して根本原因を修正できるかという「プロジェクト規模での回復能力」だ。研究者らは最高性能モデルでも意味的エラーが見られることから、AIはあくまで人間が監督する調査支援ツールとして活用すべきと結論づけている。