AIモデルがMirrorCodeタスクで19日間連続・2600ドルをかけてプログラミング
AIモデルがMirrorCodeタスクで19日間連続・2600ドルをかけてプログラミング
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-06-27 |
| 元記事 | The Decoder |
要約
Epoch AIが開発したMirrorCodeベンチマークは、AIモデルが「元のコードにアクセスせずに完全なプログラムを再現できるか」を測定するものだ。今回のテストでは、あるAIモデルが単一タスクに対して19日間連続で実行し続け、総コストが2,600ドルに達した。Claude Opus 4.7は成功率56%を達成したが、複雑なタスクではいずれのモデルも苦戦している。長時間・高コストのAI実行が実用的になりつつある一方で、複雑な現実世界のコーディング課題においてはまだ限界があることが示された。AIエージェントの長期タスク実行能力と経済性に関する重要な知見を提供している。