執筆・編集

OpenAIの自動レッドチーム「GPT-Red」とは?AI自身に弱点を探させてモデルを堅牢化する新手法

OpenAIの自動レッドチーム「GPT-Red」とは?AI自身に弱点を探させてモデルを堅牢化する新手法
mail@yanagiya.biz

OpenAIが2026年7月15日に発表した自動レッドチーム「GPT-Red」を取り上げ、AI自身にモデルの弱点を探させて堅牢化する新手法を解説しています。従来は人間が担っていた脆弱性診断を、攻撃役のGPT-Redと防御役のモデルを競わせる自己対戦型の強化学習に置き換え、プロンプトインジェクションなど実世界の脅威への防御力を高める仕組みです。検証では、訓練環境の外での攻撃成功率がGPT-Redは84%に達し、人間の13%を大きく上回りました。

自動販売機を運営するエージェント「Vendy」への攻撃では三つの目標をすべて達成しています。この手法で鍛えた結果、GPT-5.6 Solでは直接的なプロンプトインジェクションの失敗が6分の1に減り、偽の思考連鎖を使う攻撃への耐性もGPT-5.1の95%以上から10%以下に抑えられました。能力を落とさず堅牢性だけを強化できた一方、攻撃手法の流出を防ぐ管理が課題だと指摘しています。

この要約は生成AIで作成しました。

記事はこちら
OpenAIの自動レッドチーム「GPT-Red」とは?AI自身に弱点を探させてモデルを堅牢化する新手法
OpenAIの自動レッドチーム「GPT-Red」とは?AI自身に弱点を探させてモデルを堅牢化する新手法
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました