OpenAI、AIモデルの防御強化に向けた自動レッドチーム専用モデル「GPT-Red」を開発中
OpenAI、AIモデルの防御強化に向けた自動レッドチーム専用モデル「GPT-Red」を開発中
| 項目 | 内容 |
|---|---|
| ジャンル | AI |
| 日付 | 2026-07-17 |
| 元記事 | MIT Technology Review |
要約
OpenAIがAIモデルの脆弱性を自動発見するための専用モデル「GPT-Red」を開発していることが明らかになった。GPT-Redは「他のモデルの防御力を高めるスパーリングパートナー」と位置づけられ、サイバー攻撃への耐性強化を目的とした自動レッドチーミングを担う。従来は人手で行っていた敵対的プロンプトの探索をAIが代替することで、リリース前の安全性評価を大幅に効率化する狙いがある。AI安全性の課題が業界全体で高まるなか、OpenAIが社内の評価インフラにも積極投資している姿勢が伺える。