Googleスプレッドシートやテキスト翻訳と組み合わせてChatGPTを使い倒す
mail@yanagiya.biz
ITライター柳谷智宣
Opper社のFelix Wunderlich氏が、53種類のAIモデルに「洗車場が50メートル先にある場合、歩くか運転するか」という常識問題を出題した検証結果を紹介しています。1回のテストで正解したのは11モデルのみで、Claude Opus 4.6やGPT-5、Gemini 3のFlash・Proなどにとどまり、Llama・Mistral・DeepSeekは全滅でした。同一プロンプトを10回ずつ計530回実施したところ、10回連続正解はClaude Opus 4.6、Gemini系3モデル、Grok-4の5モデルのみで、GPT-5は7割、Kimi K2.5は5割にとどまりました。
Rapidataと提携し1万人に同じ問題を出したところ人間の正答率は71.5%で、これを上回れたAIは7モデルのみ。距離に関する経験則が文脈推論を上書きしてしまう点が本番運用のリスクとして指摘されています。
この要約は生成AIで作成しました。
