kintone AWARD 2024開催! 入り口はひとつ作戦の桜和設備と現場と二人三脚で伴走したLILE THE STYLE
mail@yanagiya.biz
ITライター柳谷智宣
Lakera AIやETH Zürich、英国AIセキュリティ研究所などの合同チームが2025年10月26日に発表した論文『Breaking Agent Backbones』を紹介しています。AIエージェントが直面する10種類のシナリオと3段階の防御レベルを設定し、クラウドソーシングで集めた19万件超の攻撃データから210件を厳選、31種類のLLMを評価しました。総合首位は推論モードを有効にした『grok-4』で、次いで『grok-4-fast』『claude-opus-4-1』と推論オンのモデルが上位を占め、推論が攻撃検出に寄与する可能性を示しています。
一方でモデルサイズとセキュリティ性能には相関が見られず、オープンモデルの『gpt-oss-120b』もクローズドモデルに迫る性能でした。有害出力を防ぐ『セーフティ』面では13位のgemini-2.5-proが首位となるなど、攻撃種別によって最適なモデルは異なるとしています。
この要約は生成AIで作成しました。
