Anthropicのブラウザ操作の全自動化ツール「Claude in Chrome」の実践的活用法
mail@yanagiya.biz
ITライター柳谷智宣
LLMが悪役を演じるのが苦手だという研究を取り上げています。Tencentの論文では、道徳性の異なる4段階のキャラクターをLLMに演じさせ、「Moral RolePlayベンチマーク」で忠実度を測定しました。キャラクターの道徳レベルが下がるほどスコアは単調に低下し、最も善良なレベル1の3.21に対し、悪役にあたるレベル4では2.62まで落ち込みます。特に利己的な人物から悪役へ移る段階での落差が大きく、マイナス0.43を記録しました。
「欺瞞的」「操作的」「残酷」といった悪役の核となる性質の再現でつまずく傾向が強く、ClaudeやGPT-4oなど総合性能の高いモデルほど悪役演技では下位に沈む逆転も見られます。原因は安全性のアラインメントにあり、嘘や欺瞞、自己中心的な言動を生成しないよう訓練されているためだと説明されています。AIを善良にするほど創作での表現力が制限されるため、フィクションと現実を区別できる洗練されたアラインメント技術が必要だと結論づけています。
この要約は生成AIで作成しました。
