生成AIは使い続けるほど成果が大きくなるーAnthropic最新レポートで見えた活用の現在地ー
mail@yanagiya.biz
ITライター柳谷智宣
OpenAIが2026年7月15日に発表した自動レッドチーム「GPT-Red」を取り上げ、AI自身にモデルの弱点を探させて堅牢化する新手法を解説しています。従来は人間が担っていた脆弱性診断を、攻撃役のGPT-Redと防御役のモデルを競わせる自己対戦型の強化学習に置き換え、プロンプトインジェクションなど実世界の脅威への防御力を高める仕組みです。検証では、訓練環境の外での攻撃成功率がGPT-Redは84%に達し、人間の13%を大きく上回りました。
自動販売機を運営するエージェント「Vendy」への攻撃では三つの目標をすべて達成しています。この手法で鍛えた結果、GPT-5.6 Solでは直接的なプロンプトインジェクションの失敗が6分の1に減り、偽の思考連鎖を使う攻撃への耐性もGPT-5.1の95%以上から10%以下に抑えられました。能力を落とさず堅牢性だけを強化できた一方、攻撃手法の流出を防ぐ管理が課題だと指摘しています。
この要約は生成AIで作成しました。
