OpenAI、自社AIを攻撃するAI「GPT-Red」を公開——人間の赤チームを大幅に凌駕
OpenAI、自社AIを攻撃するAI「GPT-Red」を公開——人間の赤チームを大幅に凌駕
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-16 |
| 元記事 | OpenAI News |
要約
セキュリティ研究の最前線では、AIによる自動化が急速に進んでいる。OpenAIは、自社のAIモデルに対する攻撃を自動化するレッドチーミングシステム「GPT-Red」を公開した。同システムは自己対戦(セルフプレイ)を活用し、AIの安全性・アライメント・プロンプトインジェクション耐性を継続的に向上させる仕組みを持つ。テスト環境での攻撃成功率は84%に達し、人間の赤チームチームの13%を大幅に上回った。これによりGPT-5.6モデルでは攻撃成功率を90%超から23%未満に低減できたという。AIを使ってAIの安全性を高める手法は今後のAI安全基盤として広く活用される可能性がある。