OpenAI、自動レッドチームAI「GPT-Red」発表──人間の攻撃成功率13%に対し84%
記事のポイント
📰ニュース
OpenAIが、自社AIモデルの脆弱性を自動で発見する「GPT-Red」を発表しました。
🔍注目ポイント
自己対戦型強化学習により攻撃側と防御側を同時に訓練し、人間のレッドチームより高い攻撃成功率を達成しました。
🔮これからどうなる
AIモデルの安全性が向上し、悪意あるプロンプトインジェクションなどへの耐性が強化されるでしょう。
GPT-Redは、未知のシナリオにおいても人間のレッドチーマーの攻撃成功率13%に対し、84%という高い成功率を示しました。
この技術は、最新モデル「GPT-5.6 Sol」に既に導入されており、プロンプトインジェクションへの耐性が大幅に向上しています。
AIの安全性を自動で高める新しいアプローチです。
この技術は、最新モデル「GPT-5.6 Sol」に既に導入されており、プロンプトインジェクションへの耐性が大幅に向上しています。
AIの安全性を自動で高める新しいアプローチです。
AIがAIの弱点を見つけるなんて、まるでSFの世界ですね。これで私たちの使うAIの安全性が格段に上がりそうです。