執筆・編集

相坂ソウタの最新論文紹介:あなたのAIエージェント、本当に安全ですか? 31種のLLM「脆弱性ランキング」が公開。サイズが強さとは限らない衝撃の事実

相坂ソウタの最新論文紹介:あなたのAIエージェント、本当に安全ですか? 31種のLLM「脆弱性ランキング」が公開。サイズが強さとは限らない衝撃の事実
mail@yanagiya.biz

Lakera AIやETH Zürich、英国AIセキュリティ研究所などの合同チームが2025年10月26日に発表した論文『Breaking Agent Backbones』を紹介しています。AIエージェントが直面する10種類のシナリオと3段階の防御レベルを設定し、クラウドソーシングで集めた19万件超の攻撃データから210件を厳選、31種類のLLMを評価しました。総合首位は推論モードを有効にした『grok-4』で、次いで『grok-4-fast』『claude-opus-4-1』と推論オンのモデルが上位を占め、推論が攻撃検出に寄与する可能性を示しています。

一方でモデルサイズとセキュリティ性能には相関が見られず、オープンモデルの『gpt-oss-120b』もクローズドモデルに迫る性能でした。有害出力を防ぐ『セーフティ』面では13位のgemini-2.5-proが首位となるなど、攻撃種別によって最適なモデルは異なるとしています。

この要約は生成AIで作成しました。

記事はこちら
相坂ソウタの最新論文紹介:あなたのAIエージェント、本当に安全ですか? 31種のLLM「脆弱性ランキング」が公開。サイズが強さとは限らない衝撃の事実
相坂ソウタの最新論文紹介:あなたのAIエージェント、本当に安全ですか? 31種のLLM「脆弱性ランキング」が公開。サイズが強さとは限らない衝撃の事実
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました