執筆・編集

Claudeは回答前に何を考えている?脅迫や薬物リスクも見抜く内部判断をAnthropicが解明

Claudeは回答前に何を考えている?脅迫や薬物リスクも見抜く内部判断をAnthropicが解明
mail@yanagiya.biz

Anthropicが2026年7月6日に公開した研究を取り上げ、Claudeが回答前に内部で何を考えているかを読み出す「Jacobian lens(J-lens)」という手法を解説しています。Claude Sonnet 4.5に5まで数えながら内省せよと指示すると、画面には数字が出る一方、内部からはcountingやhalfway、doneといった単語が抽出されました。言語化できる概念が置かれる場をJ-spaceと名付け、保持できるのは一度に約25個以下でした。内部のSoccerをRugbyに置き換えると回答が変わり、FranceをChinaに換えると首都などの関連情報も中国に変わりました。

安全性の検証では、脅迫のシナリオでblackmailやthreatが回答前に現れ、薬の服用量では8000mgでdangerousやWARNINGが検出されました。反実仮想的な内省訓練では不正直さのスコアが0.25から0.07へ低下。安全性監査への活用が期待されるとまとめています。

この要約は生成AIで作成しました。

記事はこちら
Claudeは回答前に何を考えている?脅迫や薬物リスクも見抜く内部判断をAnthropicが解明
Claudeは回答前に何を考えている?脅迫や薬物リスクも見抜く内部判断をAnthropicが解明
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました