執筆・編集

“善人”すぎるAIは、悪役になれない?LLMの「演技力」と「安全性」の間に横たわる深いジレンマ

"善人"すぎるAIは、悪役になれない?LLMの「演技力」と「安全性」の間に横たわる深いジレンマ
mail@yanagiya.biz

LLMが悪役を演じるのが苦手だという研究を取り上げています。Tencentの論文では、道徳性の異なる4段階のキャラクターをLLMに演じさせ、「Moral RolePlayベンチマーク」で忠実度を測定しました。キャラクターの道徳レベルが下がるほどスコアは単調に低下し、最も善良なレベル1の3.21に対し、悪役にあたるレベル4では2.62まで落ち込みます。特に利己的な人物から悪役へ移る段階での落差が大きく、マイナス0.43を記録しました。

「欺瞞的」「操作的」「残酷」といった悪役の核となる性質の再現でつまずく傾向が強く、ClaudeやGPT-4oなど総合性能の高いモデルほど悪役演技では下位に沈む逆転も見られます。原因は安全性のアラインメントにあり、嘘や欺瞞、自己中心的な言動を生成しないよう訓練されているためだと説明されています。AIを善良にするほど創作での表現力が制限されるため、フィクションと現実を区別できる洗練されたアラインメント技術が必要だと結論づけています。

この要約は生成AIで作成しました。

記事はこちら
“善人”すぎるAIは、悪役になれない?LLMの「演技力」と「安全性」の間に横たわる深いジレンマ
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました