Claude Codeにアプリの公開前レビューを頼んでみた ~ただし“AIがそれっぽく出した情報”をそのまま信じてはいけない [第8回]
mail@yanagiya.biz
ITライター柳谷智宣
Anthropicが2月17日に発表した「Claude Sonnet 4.6」の実力を解説しています。前世代と比べて約70%の確率で好ましいと評価され、上位モデルのOpus 4.5との比較でも59%の確率でSonnet 4.6のほうが優れていると判定されました。価格は据え置きで100万トークンあたり入力3ドル、出力15ドル。無料プランのデフォルトモデルにも採用されています。
画面を認識してマウスを操作するコンピューター操作の能力が実用レベルに近づき、表計算ソフトの操作や複数手順にわたるWebフォーム入力で人間並みの力を見せ始めました。API利用者には100万トークンのコンテキストウィンドウが提供され、長期の作業でも一貫性を保つコンテキスト圧縮も加わっています。経営シミュレーションのVending-Bench Arenaでは、目先の利益より設備投資を優先する長期戦略で圧勝。プロンプトインジェクションへの耐性も強化されています。
この要約は生成AIで作成しました。
